Saltar al contenido

Qué crawlers de IA permitir y cuáles bloquear

Los bots de IA hacen tres trabajos distintos: recopilar datos de entrenamiento, recuperar páginas para fundamentar una respuesta y seguir un enlace que un usuario acaba de pedir. Bloquearlos en bloque cuesta visibilidad.

Por Luis Aguilar — Chief Technology Officer 8 min de lectura
Cables de un panel de parcheo en un rack, la capa de red donde se detiene de verdad a un crawler que ignora robots.txt
Una directiva es una petición; los límites de tasa y la verificación por IP son la aplicación. Foto: Brett Sayles / Pexels.
Contenido

Los bots de IA hacen tres trabajos distintos. Unos recopilan datos de entrenamiento, otros recuperan páginas para fundamentar una respuesta que se escribe ahora y otros siguen un enlace que pidió una persona. La documentación de cada operador los nombra por separado, y robots.txt también puede hacerlo. Bloquearlos en bloque elimina visibilidad que casi todos los sitios quieren conservar.

Puntos clave

  • Los crawlers de entrenamiento y los fetchers de recuperación son user agents distintos con consecuencias distintas. GPTBot entrena, OAI-SearchBot muestra sitios en la búsqueda de ChatGPT, y bloquear OAI-SearchBot saca al sitio de esas respuestas.
  • Google-Extended controla entrenamiento y grounding solo para las apps de Gemini. Google afirma que no afecta a la inclusión ni al ranking en Google Search, y no controla las AI Overviews.
  • Los fetchers activados por el usuario son la excepción del modelo. OpenAI y Perplexity documentan que sus reglas de robots.txt pueden no aplicarse cuando una persona pide una página concreta.
  • robots.txt es una petición, no un control de acceso. El RFC 9309 dice que las reglas “no son una forma de autorización de acceso”, y en agosto de 2025 Cloudflare publicó pruebas de rastreo no declarado que las ignoraba.
  • La adopción sigue siendo escasa. En el Web Almanac de 2025, GPTBot aparecía en el 4,5 % de los robots.txt de escritorio y ClaudeBot en el 3,6 %, muy por encima de 2024 pero aún una minoría.

Tres trabajos distintos bajo una sola palabra

“Crawler de IA” junta tres comportamientos con consecuencias distintas.

Diagrama que separa tres comportamientos de los bots de IA: entrenamiento sin enlace, recuperación que cita y peticiones iniciadas por una persona.
Solo el primero tiene un intercambio en una dirección, y solo él se decide por razones de ingresos.

Recopilación para entrenamiento: descarga contenido para construir o ajustar un modelo. No hay atribución, ni enlace, ni tráfico. El intercambio va en una dirección, y por eso los editores discuten.

Recuperación y grounding: pide páginas mientras se compone una respuesta, y el asistente suele citar y enlazar lo que usó. Está más cerca de un índice de búsqueda que de un dataset. Es la superficie donde importa ser citado, con la lógica de selección que describe cómo eligen sus fuentes los asistentes de IA.

Recuperación activada por el usuario: ocurre cuando alguien pega una URL o pregunta por una página. Los operadores lo tratan como un navegador actuando por una persona, no como un rastreo, y documentan que robots.txt puede no detenerlo.

Un único Disallow: / para todo lo que huela a IA trata los tres como uno solo. No lo son.

Los user agents que están documentados

Todos los agentes de esta lista aparecen en la documentación de su operador, donde conviene comprobar las reglas antes de desplegar nada.

  • [OpenAI](https://developers.openai.com/api/docs/bots) documenta GPTBot para entrenamiento, OAI-SearchBot para mostrar sitios en la búsqueda de ChatGPT y ChatGPT-User para acciones iniciadas por el usuario. OpenAI advierte que los sitios excluidos de OAI-SearchBot no aparecerán en esas respuestas.
  • [Anthropic](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) documenta ClaudeBot para contenido que puede contribuir al entrenamiento, Claude-User para peticiones iniciadas por el usuario y Claude-SearchBot para mejorar la calidad de los resultados. Cada uno se bloquea en su propio grupo de robots.txt.
  • [Google](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers) documenta Googlebot para Search y Google-Extended como token independiente para entrenamiento y grounding de Gemini. Google-CloudVertexBot rastrea solo para agentes de Vertex AI a petición del propietario del sitio.
  • [Perplexity](https://docs.perplexity.ai/guides/bots) documenta PerplexityBot, que muestra y enlaza sitios en resultados y no rastrea para entrenar. También documenta Perplexity-User, que atiende visitas iniciadas por el usuario y suele ignorar robots.txt.
  • [Apple](https://support.apple.com/en-us/119829) documenta Applebot para Spotlight, Siri y Safari, y Applebot-Extended, que no es un crawler. Es un token de exclusión del uso para entrenamiento, y las páginas que lo bloquean siguen apareciendo en los resultados de Apple.
  • [Meta](https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/) documenta meta-externalagent para entrenamiento e indexación y meta-externalfetcher para enlaces pedidos por el usuario, junto al antiguo facebookexternalhit.
  • [Common Crawl](https://commoncrawl.org/ccbot) opera CCBot, cuyos archivos alimentan muchos datasets de terceros, y [Amazon](https://developer.amazon.com/en/amazonbot) opera Amazonbot, que según su documentación puede usarse para entrenar modelos de Amazon.

Qué controla robots.txt y qué no

Robots.txt expresa una preferencia a los clientes que se portan bien. No es un sistema de permisos, y tratarlo como tal es el error más común aquí.

El RFC 9309, publicado en septiembre de 2022, estandariza el Robots Exclusion Protocol y es explícito sobre sus límites. Las reglas “no son una forma de autorización de acceso” y el archivo “no sustituye a medidas válidas de seguridad de contenido”. Listar una ruta además la hace pública (IETF, septiembre de 2022).

El cumplimiento es voluntario y el incumplimiento está documentado. En agosto de 2025 Cloudflare publicó hallazgos según los cuales Perplexity habría usado crawlers no declarados con direcciones rotatorias para alcanzar contenido en dominios de prueba cuyo robots.txt prohibía todos los bots. Cloudflare retiró a Perplexity de su lista de bots verificados. La lección operativa se sostiene: si algo no debe leerlo una máquina, necesita autenticación, no una directiva.

Las reglas se aplican además por host. Un robots.txt en el dominio principal no hace nada por un subdominio de documentación ni por un host de medios, y Anthropic lo dice de forma expresa.

Bloquear el entrenamiento no es bloquear la visibilidad

El error más caro es un bloqueo amplio que, de rebote, saca al sitio de las respuestas de asistentes.

La posición de Google está documentada y es poco ambigua. Google-Extended cubre entrenamiento y grounding para las apps de Gemini y la API de Vertex AI. Google afirma que “no afecta a la inclusión de un sitio en Google Search ni se usa como señal de ranking”. Su documentación sobre funciones de IA indica que las directivas de robots.txt para Googlebot controlan el rastreo para Search, y que nosnippet, data-nosnippet, max-snippet y noindex limitan lo que se muestra. Es decir: las AI Overviews se gobiernan con los controles de Search, no con Google-Extended.

La misma separación vale fuera de Google. Bloquear GPTBot indica que el contenido no debería usarse para entrenar. Bloquear OAI-SearchBot saca al sitio de las respuestas de ChatGPT. Son dos decisiones distintas.

Qué cuesta bloquear y qué cuesta que te rastreen

La contrapartida comercial es real, y la evidencia apunta en las dos direcciones.

Panel de datos: unas 71.000 peticiones de páginas HTML de Anthropic por cada referencia devuelta, frente a unas diez referencias por rastreo de Mistral.
La relación decide el argumento de quien cobra por páginas vistas; un sitio de servicios suele cobrar por ser encontrado.
El análisis de Cloudflare Radar del 19 al 26 de junio de 2025 midió la relación entre rastreo y referencias por plataforma. Registró unas 71.000 peticiones de páginas HTML de Anthropic por cada referencia devuelta, mientras Mistral enviaba unas diez referencias por petición de rastreo (Cloudflare, julio de 2025).

Para un editor cuyos ingresos dependen de las páginas vistas, esa asimetría es todo el argumento. Para una empresa de servicios cuyo sitio existe para ser encontrado, faltar en la respuesta de un asistente suele ser peor que ser leído sin clic. Ese es el razonamiento detrás de tratar el contenido que acumula valor como activo y no como campaña.

La infraestructura también cambió los valores por defecto. El 1 de julio de 2025 Cloudflare anunció que los dominios nuevos bloquearían por defecto a los crawlers de IA salvo pago por el acceso, junto a un mecanismo de pago por rastreo. Eso no hace correcto el bloqueo: lo hace fácil, y por eso hoy muchos sitios bloquean sin haber decidido.

Controles más allá de robots.txt

Existen otras tres capas, cada una con un trabajo distinto.

Señales de contenido. En septiembre de 2025 Cloudflare publicó la Content Signals Policy, una extensión de robots.txt que expresa qué puede hacerse con el contenido una vez recuperado. Define tres señales: search, ai-input y ai-train. Cloudflare aplicó search=yes, ai-train=no a más de 3,8 millones de dominios que ya usaban su robots.txt gestionado, dejando ai-input sin definir.

Controles de fragmento. nosnippet, data-nosnippet y max-snippet limitan cuánto se puede reproducir de una página sin sacarla del índice. En la documentación de Google son las palancas para las funciones de IA dentro de Search.

Aplicación en red. Las reglas de WAF, los límites de tasa y la verificación por rangos de IP publicados son lo que de verdad detiene a un cliente que ignora el archivo. Todos los operadores citados publican rangos de direcciones para verificación, lo que hace detectable la suplantación de user agent.

llms.txt es una propuesta, no un estándar

Jeremy Howard propuso `llms.txt` el 3 de septiembre de 2024 como un archivo markdown que ayuda a los modelos de lenguaje a usar un sitio en tiempo de inferencia. La web de la especificación lo llama propuesta y la describe abierta a comentarios de la comunidad.

En el Web Almanac de 2025, publicado el 15 de enero de 2026, HTTP Archive encontró llms.txt en cerca del 2 % de los sitios móviles, con 324.184 archivos válidos identificados. De ellos, el 39,6 % venía del plugin All in One SEO y el 3,6 % de Yoast: valores por defecto más que una elección (HTTP Archive, enero de 2026).

El 17 de junio de 2025 John Mueller, de Google, escribió que “ningún sistema de IA usa actualmente llms.txt”. Ninguna de las documentaciones de operador citadas en este artículo menciona el archivo. Publicarlo es barato e inocuo; tratarlo como mecanismo de ranking o de citación no lo respalda nada publicado por un operador.

Una política por defecto defendible

Para la mayoría de sitios comerciales que quieren visibilidad en asistentes y no quieren donar un corpus completo de entrenamiento, la posición de partida defendible es estrecha, no absoluta.

Se permiten los agentes de recuperación y búsqueda: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Applebot y Googlebot. El entrenamiento se decide aparte, bloqueando GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, CCBot y Amazonbot si el contenido es un activo comercial y no una superficie de marketing. Los fetchers activados por el usuario se dejan en paz, porque bloquearlos rompe sobre todo el caso en que alguien compartió tu enlace a propósito.

Después toca verificar, no suponer. Se leen los logs de servidor cada mes por user agent y se contrastan las peticiones con los rangos de direcciones publicados. La documentación se relee cada trimestre, porque estos tokens cambian más a menudo que casi cualquier ajuste de SEO técnico. Vale la misma disciplina que gobierna un presupuesto de JavaScript: una política que nadie mide es una política que no existe.

Preguntas frecuentes

¿Bloquear GPTBot saca mi sitio de ChatGPT?

No. OpenAI documenta GPTBot como el crawler de entrenamiento y OAI-SearchBot como el agente que muestra sitios en la búsqueda de ChatGPT. Bloquear GPTBot afecta al uso para entrenamiento. Lo que saca al sitio de las respuestas de búsqueda es bloquear OAI-SearchBot, y OpenAI lo advierte de forma explícita.

¿Google-Extended controla las AI Overviews?

No. La documentación de Google limita Google-Extended al entrenamiento y grounding de las apps de Gemini y la API de Vertex AI, y afirma que no afecta a la inclusión ni al ranking en Search. Las funciones de IA dentro de Search dependen del acceso de Googlebot y de controles como nosnippet y data-nosnippet.

¿Los crawlers de IA respetan robots.txt?

La mayoría de los agentes declarados sí, y varios publican rangos de IP para verificarlos. El cumplimiento es voluntario según el RFC 9309, y Cloudflare documentó un caso de evasión en agosto de 2025. El contenido que de verdad no debe leer una máquina va detrás de autenticación.

¿Merece la pena publicar llms.txt?

Cuesta poco y no demuestra nada. HTTP Archive lo encontró en cerca del 2 % de los sitios móviles en 2025, generado casi siempre por plugins de SEO. John Mueller dijo en junio de 2025 que ningún sistema de IA lo usaba. Publícalo si tu plugin ya lo hace; no construyas estrategia sobre él.

¿Qué hago con los fetchers activados por el usuario?

Tratarlos como navegadores. OpenAI documenta que las reglas de robots.txt pueden no aplicarse a ChatGPT-User porque la petición la inicia una persona, y Perplexity documenta que Perplexity-User suele ignorar robots.txt. Bloquearlos castiga sobre todo al visitante que compartió tu página a propósito.

¿Cada cuánto conviene revisarlo?

Cada trimestre. Aparecen tokens nuevos, los existentes cambian de alcance y la documentación de los operadores se actualiza sin aviso. Basta una entrada de calendario recurrente con las URL de documentación de cada operador, y la decisión encaja con el resto de la gobernanza de la aprobación de un presupuesto de IA.

Separa primero los tres trabajos, decide después el entrenamiento aparte de la recuperación, y aplica en la capa de red lo que el archivo solo pide. El bloqueo total es una decisión sobre modelos de ingresos tomada con una herramienta técnica, y casi ninguna empresa que lo hace le ha puesto precio. Durante el próximo año conviene mirar si los acuerdos de rastreo de pago llegan a editores pequeños y si el tráfico de recuperación convierte a tasas que merezcan reportarse. Hasta entonces, la posición honesta es la que se ve en los despliegues de agentes en el mid-market, donde la medición aún va por detrás de la adopción.

Compartir en

Lectura relacionada

Construyamos lo que sigue.

Creamos marcas, productos y experiencias que impulsan tu negocio.

Iniciar un proyecto
we are ONE

ONE News. Qué construimos y cómo escala.

Ideas directas y prácticas sobre marca, tecnología y rendimiento digital

Más de 1000 suscriptores

Al suscribirte, aceptas los Términos de Uso y la Política de Privacidad de Onetouch.

Iniciemos juntos un nuevo caso de estudio

01.

¿Qué necesitas?

02.

Tu presupuesto es...

03.

¿Tienes una fecha límite específica?

04.

¡Adjunta un brief del proyecto si quieres!

¡Adjunta un brief del proyecto si quieres!

05.

Sobre ti...