← BIBLIOTECA

EVIDENCIA

Cloudflare /crawl ya aplica los Content Signals: por qué da error 400 y qué hacen use=reference y ai-train=no

Desde el 31 de agosto de 2026, el endpoint /crawl de Browser Run de Cloudflare rechaza los rastreos que van más allá de lo que permite la línea Content-Signal del robots.txt de una web. Es el primer caso documentado de un crawler que hace cumplir esas preferencias, y por ahora el único. Qué aplica exactamente, por qué las peticiones por defecto fallan ahora con un error 400 y qué significa para tu visibilidad en IA.

Qué cambió el 31 de agosto

Browser Run es el servicio de navegador alojado de Cloudflare, que hasta el 15 de abril de 2026 se llamaba Browser Rendering. Su endpoint /crawl, lanzado en beta el 10 de marzo de 2026, recibe una URL de partida y devuelve las páginas renderizadas en HTML, Markdown o JSON estructurado.

Desde el 31 de agosto, el endpoint lee la línea Content-Signal de la web antes de rastrearla. Quien hace la petición declara dos cosas:

Si las preferencias de la web son más estrictas que lo declarado, la petición se rechaza de entrada con un 400 y el mensaje "Crawl disallowed by Content-Signal directive (purpose or use level)", que indica que la directiva Content-Signal no permite el rastreo por el fin declarado o por el nivel de uso. Una web con use=reference acepta contentUse reference y rechaza el full por defecto. Una web con use=immediate rechaza cualquier rastreo. Una web sin línea Content-Signal se rastrea con normalidad. Las reglas Disallow del robots.txt se siguen aplicando URL a URL, y esas páginas aparecen con el estado "disallowed".

  • ·contentUse: "the level at which you intend to use the crawled content. Allowed values, from least to most permissive, are reference and full. The default is full." Es el nivel de uso que piensas dar al contenido rastreado: reference o full, de menos a más permisivo, con full como valor por defecto.
  • ·crawlPurposes: por defecto el endpoint "declares all three purposes", es decir, declara los tres fines: search, ai-input y ai-train.

Por qué ahora fallan las peticiones por defecto en muchas webs

El Managed Robots.txt de Cloudflare escribe este bloque en las zonas que lo usan: User-Agent: *, después Content-signal: search=yes, ai-train=no, use=reference, y por último Allow: /.

Una petición /crawl por defecto declara ai-train y full, así que choca dos veces con ese bloque: una por el fin y otra por el nivel de uso. Para rastrear una web así, tienes que enviar contentUse reference y acotar crawlPurposes, por ejemplo dejándolo solo en search.

Lo que no significa

  • ·La directiva use sigue en pruebas. La documentación de Cloudflare dice que la empresa "is testing content-use, an optional extension to Content Signals", es decir, que está probando content-use como extensión opcional de Content Signals. Se presentó el 1 de julio de 2026 con tres niveles: immediate, "interact, but store and reuse nothing", que permite interactuar sin almacenar ni reutilizar nada; reference, "index, excerpt, and link back", que permite indexar, citar fragmentos y enlazar a la fuente, y es el valor por defecto; y full, "summarize and reproduce", que permite resumir y reproducir.
  • ·Los demás crawlers no se han sumado. Search Engine Roundtable informó el 6 de julio de 2026 de que John Mueller, de Google, dijo sobre la directiva: "it has no effects whatsoever for any crawler or llm." Según él, no tiene ningún efecto en ningún crawler ni LLM. No hemos encontrado ningún compromiso público de OpenAI, Anthropic ni Perplexity para respetarla.
  • ·La vía de estandarización usa otros términos. El borrador del vocabulario AI Preferences del IETF, versión 08 del 14 de septiembre de 2026, define las categorías AI Training, AI Use y Search, y advierte de que su contenido "DO NOT REFLECT CONSENSUS of the Working Group": no refleja el consenso del grupo de trabajo.

Qué significa para tu visibilidad en IA

Los Content Signals son una preferencia que hoy solo hace cumplir un actor. Una línea use=reference o ai-train=no frena a los clientes de /crawl de Cloudflare. Con la evidencia que hemos encontrado, no cambia lo que hacen ChatGPT, Gemini o Claude. Si quieres que los motores de IA te citen, lo que decide sigue siendo a qué crawlers dejas entrar, en el robots.txt y en tu edge, y qué encuentran cuando llegan.

Si tu robots.txt lleva una línea Content-Signal que no has escrito tú, puede venir del Managed Robots.txt de Cloudflare. Léela y mantenla solo si es la política que has elegido.

Revisamos nuestras ocho webs el 16 de septiembre de 2026. Ninguna tiene línea Content-Signal, así que una petición /crawl llega a ellas con normalidad. Primero se mide, después se concluye.

Preguntas frecuentes

¿Por qué Cloudflare /crawl me da error 400?

Porque la línea Content-Signal del robots.txt de la web de destino es más estricta que lo que declara tu petición. El error dice "Crawl disallowed by Content-Signal directive (purpose or use level)": o uno de los fines que has declarado está en no, o tu contentUse supera el nivel use de la web.

¿Cómo rastreo una web con use=reference y ai-train=no?

Envía contentUse reference y acota crawlPurposes para que no incluya ai-train, por ejemplo solo search. La petición por defecto, con contentUse full y los tres fines, se rechaza.

¿Qué significa use=reference en Content-Signal?

En la definición de Cloudflare, reference significa "index, excerpt, and link back": indexar, citar fragmentos y enlazar a la fuente. El nivel más estricto, immediate, significa "interact, but store and reuse nothing", interactuar sin almacenar ni reutilizar nada, y full significa "summarize and reproduce", resumir y reproducir. Cloudflare sigue presentando use como una extensión en pruebas.

¿Google u OpenAI respetan los Content Signals?

No hemos encontrado ningún compromiso público. Según lo publicado el 6 de julio de 2026, John Mueller, de Google, dijo que la directiva no tiene ningún efecto en ningún crawler ni LLM. El /crawl de Cloudflare es el único caso de cumplimiento que hemos podido documentar.

¿Debo poner una línea Content-Signal en mi robots.txt?

Solo como una política decidida a conciencia. Hoy obliga a los clientes de /crawl de Cloudflare y, para todos los demás, solo expresa una intención. No sustituye a las reglas del robots.txt para los crawlers que de verdad quieres controlar.

Fuentes

  • ·Changelog de Cloudflare, Crawl endpoint now respects the Content Signals use directive, 31 de agosto de 2026: https://developers.cloudflare.com/changelog/post/2026-08-31-crawl-content-use/
  • ·Documentación de Cloudflare, Browser Run /crawl endpoint: https://developers.cloudflare.com/browser-run/quick-actions/crawl-endpoint/
  • ·Changelog de Cloudflare, Browser Rendering renamed to Browser Run, 15 de abril de 2026: https://developers.cloudflare.com/changelog/post/2026-04-15-br-rename/
  • ·Changelog de Cloudflare, Crawl entire websites with a single API call, 10 de marzo de 2026: https://developers.cloudflare.com/changelog/post/2026-03-10-br-crawl-endpoint/
  • ·Documentación de Cloudflare, Managed robots.txt: https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/
  • ·Blog de Cloudflare, Content Independence Day AI options, 1 de julio de 2026: https://blog.cloudflare.com/content-independence-day-ai-options/
  • ·Blog de Cloudflare, Content Signals Policy, 24 de septiembre de 2025: https://blog.cloudflare.com/content-signals-policy/
  • ·Search Engine Roundtable, Google: Cloudflare Content Signals Robots.txt Directive Has No Effects, 6 de julio de 2026: https://www.seroundtable.com/google-cloudflare-content-signals-41631.html
  • ·IETF, draft-ietf-aipref-vocab-08, 14 de septiembre de 2026: https://datatracker.ietf.org/doc/draft-ietf-aipref-vocab/