← BIBLIOTECA

GUÍA

robots.txt dice sí, tu servidor dice no: por qué los rastreadores de IA siguen siendo rechazados

Un robots.txt que permite GPTBot, ClaudeBot y PerplexityBot es una petición, no una puerta. La puerta es tu CDN, tu firewall y tu protección contra bots, y deciden por su cuenta. Dónde un sí se convierte en un no, por qué los agentes que abren tu página mientras un comprador pregunta dependen sobre todo de esa capa, y qué puede y qué no puede demostrar cada prueba.

Dos capas deciden si un rastreador de IA lee tu página. robots.txt expresa lo que te gustaría que hicieran los rastreadores. Tu edge, es decir, la CDN, el firewall de aplicaciones web y cualquier protección contra bots que haya delante de tu servidor, decide qué pasa de verdad con cada petición. La propia documentación de Cloudflare dice que cumplir robots.txt es voluntario. Y al revés también: un robots.txt que dice Allow no impide que el edge diga que no.

La mayoría de los sitios revisan la primera capa y dan por hecha la segunda. El resultado es un robots.txt que da la bienvenida a los rastreadores de búsqueda con IA mientras el servidor que tiene delante los rechaza, y nadie en la empresa lo sabe.

Cuatro lugares donde un sí se convierte en un no

  • ·Una política de bots de IA en la CDN. Desde el 1 de julio de 2026 Cloudflare permite configurar Search, Training y Agent por separado, y el 15 de septiembre de 2026 retiró el interruptor único Block AI Bots. Desde esa fecha, los dominios nuevos de todos los planes, incluido el gratuito, reciben por defecto un ajuste que bloquea Training y Agent en las páginas que muestran anuncios y permite Search. Cloudflare sitúa bots de consulta de chat como ChatGPT-User en la categoría Agent. El bloqueo se aplica en el edge, diga lo que diga robots.txt.
  • ·Un robots.txt que no escribiste tú. El robots.txt gestionado de Cloudflare añade reglas Disallow para rastreadores como GPTBot, ClaudeBot y Google-Extended delante de tu propio archivo. El robots.txt que recibe un rastreador puede ser distinto del que tienes en tu repositorio.
  • ·Protección genérica contra bots. Bot Fight Mode de Cloudflare presenta desafíos al tráfico que coincide con patrones de bots conocidos y no se puede saltar con reglas personalizadas del WAF. Su documentación no dice si los rastreadores de IA verificados quedan exentos, así que no lo des por hecho. La protección contra bots de Vercel excluye a los bots verificados, pero Vercel indica que no funciona detrás de un proxy inverso como Cloudflare.
  • ·Reglas que alguien añadió. Los bloqueadores por user agent, como la extensión User Agent Blocker de Netlify o el conjunto de reglas de bots de IA de Vercel, ambos desactivados por defecto, las reglas personalizadas del firewall y los bloqueos por IP actúan antes de que nadie lea robots.txt.

Los agentes que abren tu página mientras un comprador pregunta

Los proveedores de IA usan agentes distintos para entrenar, para construir un índice de búsqueda y para abrir una página en el momento en que un usuario pregunta. No se comportan igual ante robots.txt.

OpenAI dice que las reglas de robots.txt pueden no aplicarse a ChatGPT-User, porque lo activa un usuario. Perplexity dice que Perplexity-User en general ignora robots.txt. Anthropic dice que sus bots, Claude-User incluido, respetan robots.txt. Para dos de esos tres proveedores, el edge es la única puerta que decide de forma fiable la consulta en directo, y los agentes en vivo son también la categoría que Cloudflare bloquea ahora por defecto en las páginas que muestran anuncios, en los dominios nuevos.

La documentación de Perplexity es la que va más lejos: pide a los propietarios de sitios que usen sus rangos de IP publicados en la configuración del WAF y que los actualicen de forma automática. La propia guía de Perplexity sitúa la decisión de acceso en el firewall.

La trampa de Google-Extended

Google-Extended controla si tu contenido se usa para entrenar futuros modelos Gemini y para fundamentar respuestas en Gemini Apps y Vertex AI. Google indica que no afecta a la inclusión en la Búsqueda de Google y que no es una señal de ranking. No tiene user agent propio: Google rastrea con sus rastreadores habituales. Una regla de firewall que busque Google-Extended en el user agent no coincide con nada.

El error contrario sale más caro. Las vistas creadas con IA y el Modo IA se controlan con los controles de la Búsqueda. Para aparecer como enlace de apoyo, una página tiene que estar indexada y ser apta para mostrarse con un fragmento. Una regla en el edge que bloquee Googlebot saca la página de la Búsqueda y de las vistas creadas con IA a la vez.

Cómo comprobarlo y qué demuestra cada prueba

  • ·Descarga el robots.txt en vivo de tu dominio, no el archivo de tu código. Muestra lo que reciben los rastreadores, incluido lo que añada tu CDN.
  • ·Solicita tus páginas clave con user agents de IA y con el user agent de un navegador normal, y compara el código de estado y el tamaño. Una diferencia revela una regla que actúa sobre el user agent. Es la prueba más rápida y detecta los bloqueos autoinfligidos más comunes.
  • ·Conoce su límite. Una petición desde tu portátil con el user agent de un rastreador no es el rastreador. Las plataformas de edge verifican a los rastreadores reales por sus rangos de IP publicados, DNS inverso o peticiones firmadas, así que una petición suplantada puede recibir otro trato. Un 200 no demuestra que el rastreador real pase, y un 403 no demuestra que esté bloqueado.
  • ·Para las decisiones basadas en IP o en verificación, revisa los registros de tu edge o de tu servidor y filtra por los rangos de IP que publican los proveedores: OpenAI, Perplexity y Anthropic publican listas en JSON, y Google publica los rangos de sus rastreadores y un procedimiento de DNS inverso. En Cloudflare, AI Crawl Control muestra las peticiones de cada rastreador de IA y su ajuste actual, Allow o Block.
  • ·Para Google, la herramienta de inspección de URLs de Search Console muestra si Google puede rastrear e indexar una página.

Lo que medimos en nuestro propio sitio

El 27 de septiembre de 2026 pedimos tkmstudio.com/services/agent-access-check nueve veces: una con un user agent de Chrome y una con cada uno de estos: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot y Perplexity-User. Las nueve devolvieron 200 con los mismos 32.668 bytes. La respuesta llevaba server: Netlify y ninguna cabecera cf-ray, y el robots.txt en vivo permite todos los rastreadores.

Lo que demuestra: ninguna regla nuestra actúa sobre estos user agents, y Cloudflare no está en el camino de la petición. Lo que no demuestra: cómo se trata una petición que llega desde el rango de IP del propio proveedor. Esa respuesta está en los registros. Primero medir, después decir solo lo que la medición sostiene.

Preguntas frecuentes

Si mi robots.txt permite GPTBot, ¿puede mi CDN bloquearlo igualmente?

Sí. El rastreador lee robots.txt y lo cumple de forma voluntaria. Una regla de la CDN o del firewall actúa sobre la petición antes de servir ninguna página. En Cloudflare, una política de bots de IA en Block rechaza al rastreador en el edge, diga lo que diga robots.txt.

¿Respeta ChatGPT robots.txt cuando un usuario le pide abrir mi página?

OpenAI dice que las reglas de robots.txt pueden no aplicarse a ChatGPT-User, porque la consulta la activa un usuario. Que esa consulta llegue a tu página depende de las reglas de tu edge, no de robots.txt.

¿Bloquear Google-Extended saca mi sitio de las vistas creadas con IA?

No. Google indica que Google-Extended no afecta a la inclusión en la Búsqueda de Google. Las vistas creadas con IA y el Modo IA siguen los controles de la Búsqueda, como el acceso de Googlebot, noindex y los ajustes de fragmentos.

¿Puedo comprobar el acceso de los rastreadores de IA con curl?

En parte. curl con el user agent de un rastreador muestra si una regla actúa sobre ese user agent. No puede reproducir decisiones basadas en la IP del rastreador o en su verificación, porque la petición no sale del proveedor. Para eso, coteja tus registros con los rangos de IP que publican los proveedores.

Fuentes

  • ·OpenAI, Overview of OpenAI Crawlers: https://developers.openai.com/api/docs/bots
  • ·Perplexity, Perplexity Crawlers: https://docs.perplexity.ai/guides/bots
  • ·Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?: https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
  • ·Google Search Central, Google's common crawlers: https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
  • ·Google Search Central, AI features and your website: https://developers.google.com/search/docs/appearance/ai-features
  • ·Google Search Central, Verify requests from Google crawlers and fetchers: https://developers.google.com/crawling/docs/crawlers-fetchers/verify-google-requests
  • ·Cloudflare Docs, Block AI bots: https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/
  • ·Cloudflare Changelog, New options to manage AI traffic, 1 July 2026: https://developers.cloudflare.com/changelog/post/2026-07-01-ai-traffic-options/
  • ·Cloudflare Blog, Your site, your rules: new AI traffic options for all customers, 1 July 2026: https://blog.cloudflare.com/content-independence-day-ai-options/
  • ·Cloudflare Docs, robots.txt setting: https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/
  • ·Cloudflare Docs, Bot Fight Mode: https://developers.cloudflare.com/bots/get-started/bot-fight-mode/
  • ·Vercel Docs, Bot Management: https://vercel.com/docs/bot-management
  • ·Netlify Docs, Block AI crawlers and bots: https://docs.netlify.com/build/build-with-ai/block-ai-crawlers/