¿Bloquear los rastreadores de IA en robots.txt o en el servidor? Lo que dice la documentación

La pregunta se repite en cuanto alguien mira los registros del servidor y ve rastreadores de IA pasando por su web: ¿los bloqueo? Y detrás viene la segunda: si se bloquean en robots.txt o directamente en el servidor.
La respuesta corta es que casi siempre la decisión está mal planteada, porque no hay «los rastreadores de IA»: hay al menos dos tipos con efectos opuestos, y bloquearlos juntos es el error más caro que se puede cometer aquí.
No es un bot, son dos trabajos distintos
Tanto Google como OpenAI separan explícitamente el rastreo para entrenar modelos del rastreo para aparecer en sus respuestas. Y los controlan con tokens distintos.
El token es Google-Extended, y la documentación de Google Search Central es precisa sobre qué hace: sirve para gestionar si el contenido rastreado puede usarse para entrenar futuras generaciones de los modelos Gemini y para la fundamentación de las aplicaciones de Gemini y de Vertex AI.
Y añade la frase que decide la mitad de estas dudas:
«Google-Extended no afecta a la inclusión de los sitios en la Búsqueda de Google ni se utiliza como factor de posicionamiento en la Búsqueda de Google.»
Es decir: bloquear Google-Extended no le saca de la Búsqueda ni le penaliza. Es una decisión sobre entrenamiento, no sobre visibilidad.
OpenAI
Aquí la separación es aún más explícita. OpenAI documenta dos tokens con funciones opuestas:
GPTBot— el de entrenamiento de sus modelos.OAI-SearchBot— el de búsqueda: es el que hace que su sitio aparezca en las respuestas de búsqueda de ChatGPT.
Su documentación lo dice sin rodeos: cada ajuste es independiente, y un editor puede permitir OAI-SearchBot para salir en los resultados y a la vez bloquear GPTBot para que su contenido no alimente el entrenamiento. Y avisa de lo contrario: los sitios que se excluyen de OAI-SearchBot no se mostrarán en las respuestas de búsqueda de ChatGPT.
Detalle operativo útil: OpenAI indica que puede tardar unas 24 horas desde que usted cambia el robots.txt hasta que sus sistemas se ajustan. No espere ver el efecto en la siguiente hora.
Y ahora sí: ¿robots.txt o servidor?
Aquí está el dato que zanja el dilema del título, y que sorprende a casi todo el mundo:
Google-Extended no tiene una cadena de user-agent propia en las peticiones HTTP. Lo dice la documentación: el rastreo se hace con las cadenas de user-agent habituales de Google, y el token de robots.txt se usa únicamente como control.
La consecuencia es directa: a Google-Extended no se le puede bloquear en el servidor, porque no llega como un agente distinto al que responder con un 403. No hay nada que filtrar. El único sitio donde esa preferencia existe es el robots.txt.
Con GPTBot y OAI-SearchBot sí hay cadenas propias y rangos de IP publicados, así que técnicamente se pueden bloquear en el servidor. Pero conviene no hacerlo salvo que tenga un motivo concreto:
- Bloquear en el servidor es invisible para quien audita su sitio. El
robots.txtes público y declara su intención; una regla en el servidor no la ve nadie, empezando por el siguiente que herede su web. - Un bloqueo por IP envejece. Los rangos cambian y usted acaba manteniendo una lista.
- Y no distingue el motivo. Si mañana quiere permitir la búsqueda y seguir negando el entrenamiento, el
robots.txtlo expresa en dos líneas.
El servidor tiene sentido para lo que robots.txt no cubre: bots que lo ignoran, scraping abusivo o picos que le tumban la máquina. Eso ya no es una decisión editorial, es defensa.
El error que de verdad cuesta dinero
El patrón que se repite: alguien lee que «la IA se lleva el tráfico», mete un bloque grande de Disallow contra todo lo que suene a IA y, sin querer, incluye OAI-SearchBot. Resultado: sigue apareciendo en Google exactamente igual, no ha evitado nada del entrenamiento que ya ocurrió, y se ha borrado de las respuestas de ChatGPT, que es justo el sitio donde empezaba a haber visibilidad nueva.
Antes de tocar nada, decida qué quiere de verdad:
- Quiero aparecer en respuestas de IA y no me importa el entrenamiento → permita todo. Es la opción por defecto y no requiere hacer nada.
- Quiero aparecer, pero no alimentar el entrenamiento → bloquee
Google-ExtendedyGPTBot, y deje pasarOAI-SearchBoty Googlebot. - No quiero saber nada → bloquéelos todos, asumiendo que desaparece de las respuestas de ChatGPT.
Dos trampas del propio robots.txt, comprobadas aquí
Las dos nos han pasado en esta web, así que van con la factura pagada:
- Los grupos por bot NO heredan las reglas del grupo
*. Cada agente obedece únicamente a su grupo más específico. Si usted añade un bloque para un bot de IA y teníaDisallowgenerales en*, ese bot dejará de respetarlos: hay que repetirlos dentro de cada grupo. - Bloquear recursos técnicos rompe el renderizado. Tuvimos un
Disallow: /_next/que impedía cargar el CSS y el JavaScript, y Google veía el sitio roto. Si bloquea rutas, compruebe que no son las que sirven los estilos.
Nuestro robots.txt, hoy, cabe en cinco líneas: un único grupo * que permite todo salvo /api/ y /buscar/, más los dos sitemaps. No bloqueamos ningún rastreador de IA, y es una decisión consciente: preferimos aparecer en las respuestas.
Preguntas frecuentes
¿Bloquear Google-Extended me saca de AI Overviews? La documentación de Google no menciona AI Overviews al describir ese token: habla de entrenamiento de Gemini y de fundamentación en aplicaciones de Gemini y Vertex AI, y aclara que no afecta a la inclusión en la Búsqueda. Mientras Google no lo documente, cualquiera que le asegure lo contrario está deduciendo, no citando.
¿Sirve de algo bloquear ahora si ya me han rastreado? Para el entrenamiento pasado, no. El control es hacia adelante.
¿Cuánto tarda en aplicarse? OpenAI cifra en unas 24 horas el ajuste de sus sistemas tras cambiar el robots.txt.
¿Y los bots que ignoran robots.txt? Esos no se resuelven aquí. Eso es servidor, cortafuegos o CDN, y es un problema de abuso, no de preferencia editorial.
Foto de portada: «Paris metro turnstiles during a regular day», de Tangopaso, en dominio público. Fuentes: documentación de Google Search Central sobre rastreadores y documentación de OpenAI sobre sus rastreadores, ambas consultadas el 3 de septiembre de 2026. La traducción de las citas de OpenAI es nuestra.
Para seguir el hilo: los informes de IA de Search Console · la presión europea sobre los datos de búsqueda de Google · cómo comprobamos un hueco de datos en GA4.