Robots.txt y bots de IA: qué permitir y qué bloquear
Por Maquinable · Publicado el 24 de septiembre de 2026
Los bots de IA y el robots.txt generan mucha confusión: hay quien recomienda bloquear "a ChatGPT" para proteger el contenido y quien dice que hay que abrir la puerta a la IA para que te recomiende. Las dos cosas pueden ser ciertas a la vez, porque detrás de cada asistente hay varios bots con funciones distintas. Esta guía explica qué hace cada uno, qué dice cada empresa en su documentación y qué postura le conviene a la web de una pyme.
Qué es el robots.txt y qué no hace
El robots.txt es un archivo de texto que vive en tuweb.es/robots.txt. Antes de recorrer una web, los rastreadores (crawlers, en inglés) lo leen para saber qué pueden visitar. Cada bloque empieza con User-agent, el nombre del bot, seguido de reglas Disallow (no entres aquí) o Allow (aquí sí).
Tres cosas que conviene tener claras:
- Es una petición, no un candado. Los bots de las grandes empresas dicen respetarlo; un bot malicioso lo ignora sin más.
- Bloquear no borra. Si un bot ya recogió tus páginas, bloquearlo hoy no elimina lo que se llevó.
- No sirve para desindexar. Para que una página no salga en Google se usa la etiqueta
noindex, no el robots.txt.
Si has oído hablar de llms.txt, son archivos distintos: el robots.txt da o quita permisos, y llms.txt solo resume tu web para la IA. Si tu robots.txt bloquea a un bot, lo que pongas en tu llms.txt le da igual. Lo explicamos en qué es llms.txt.
Los tres tipos de bots de IA
Cada empresa de IA usa varios bots, y lo que hace cada uno decide si te conviene dejarlo entrar.
Bots de entrenamiento. Recogen contenido para entrenar futuros modelos. Son GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl, un archivo abierto que usan muchos modelos) y Meta-ExternalAgent (Meta). Google-Extended y Applebot-Extended funcionan distinto: no rastrean por su cuenta, son nombres que se usan en el robots.txt para decirle a Google y a Apple que no usen tu contenido para entrenar su IA.
Bots de búsqueda. Indexan tu web para poder citarla y enlazarla cuando alguien pregunta algo. Son OAI-SearchBot (la búsqueda de ChatGPT), Claude-SearchBot, PerplexityBot y Meta-WebIndexer. Si los bloqueas, esos asistentes tienen más difícil mencionarte con enlace.
Bots iniciados por el usuario. Entran cuando una persona le pide a un asistente que lea una página concreta. Son ChatGPT-User, Claude-User, Perplexity-User, Meta-ExternalFetcher y Google-Agent. OpenAI, Perplexity, Google y Meta dicen en su documentación que estos bots pueden no respetar el robots.txt, porque actúan en nombre de una persona. Anthropic es la excepción: dice que todos sus bots, Claude-User incluido, lo respetan.
Qué bot es de quién y para qué sirve
| Empresa | Bot | Para qué | ¿Respeta robots.txt? |
|---|---|---|---|
| OpenAI | GPTBot | Entrenamiento | Sí |
| OpenAI | OAI-SearchBot | Búsqueda de ChatGPT | Sí |
| OpenAI | ChatGPT-User | Lo que pide un usuario | No garantizado |
| Anthropic | ClaudeBot | Entrenamiento | Sí |
| Anthropic | Claude-SearchBot | Búsqueda | Sí |
| Anthropic | Claude-User | Lo que pide un usuario | Sí |
| Perplexity | PerplexityBot | Búsqueda | Sí |
| Perplexity | Perplexity-User | Lo que pide un usuario | No, en general |
| Google-Extended | Permiso para entrenar Gemini | Sí (es una regla de robots.txt) | |
| Apple | Applebot-Extended | Permiso para entrenar la IA de Apple | Sí (es una regla de robots.txt) |
| Common Crawl | CCBot | Archivo abierto usado para entrenar | Sí |
| Meta | Meta-ExternalAgent | Entrenamiento | Sí |
| Meta | Meta-ExternalFetcher | Lo que pide un usuario | Puede saltárselo |
| ByteDance | Bytespider | Sin documentación oficial | No documentado |
Fuentes, consultadas el 24 de septiembre de 2026: OpenAI, Anthropic, Perplexity, Google, Apple, Common Crawl y Meta.
No bloquees facebookexternalhit. Es el bot que genera la vista previa (título, imagen y descripción) cuando alguien comparte un enlace a tu web por WhatsApp, Facebook o Instagram.
¿Bloquear o permitir? Tres posturas para una pyme
No hay una respuesta única, pero para una pyme casi siempre sirve una de estas tres.
Postura 1: abrir todo
Para negocios que viven de que los encuentren: servicios locales, empresas B2B, tiendas online. No bloqueas nada y cualquier asistente puede leerte, citarte y usar tu contenido para entrenar. Es lo que hacemos en maquinable.com, porque nuestro negocio depende de que nos encuentren.
Postura 2: bloquear el entrenamiento y permitir la búsqueda
La más equilibrada para la mayoría. Pides que no usen tu contenido para entrenar modelos, pero dejas entrar a los bots que pueden citarte con enlace. Añade esto a tu robots.txt, sin borrar lo que ya tengas:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: meta-externalagent
Disallow: /
OAI-SearchBot, Claude-SearchBot, PerplexityBot y Googlebot siguen entrando porque no los nombras. Si más adelante quieres bloquear también a Bytespider, añade un bloque igual con su nombre, sabiendo que ByteDance no documenta si lo respeta.
Postura 3: cerrar todo
Para contenido de pago o muy diferencial, que no quieres ver resumido por una IA. Bloqueas también los bots de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
Pierdes la posibilidad de que ChatGPT, Claude o Perplexity te citen con enlace en sus respuestas. Y no consigues cerrar del todo la puerta: varios bots iniciados por usuarios pueden seguir entrando, y lo que ya se usó para entrenar no se borra.
En ningún caso permitir los bots de búsqueda garantiza que un asistente te recomiende. Es una condición necesaria, no una garantía.
Cómo editar tu robots.txt sin romper nada
Dónde se edita depende de tu web:
- WordPress: los plugins Yoast SEO y Rank Math tienen un editor de robots.txt en sus herramientas.
- Shopify: se edita la plantilla
robots.txt.liquiddel tema. - Wix y Squarespace: tienen opciones propias más limitadas; si no encuentras cómo, pregúntale a tu proveedor.
- Web hecha a medida: pídeselo a quien la mantiene y pásale el bloque de la postura que elijas.
Los errores más comunes:
- Escribir
User-agent: ChatGPT. Ese bot no existe, así que la regla no hace nada. Hay que usar los nombres de la tabla. - **Poner
Disallow: /bajoUser-agent: *.** Bloquea a todos los bots, Googlebot incluido, y tu web puede desaparecer de Google. - Bloquear Googlebot pensando que bloqueas la IA de Google. Googlebot es el que te mete en el buscador. Para el entrenamiento de Gemini se usa Google-Extended.
Para comprobar el resultado, abre tuweb.es/robots.txt en el navegador y revisa que se vea lo que esperas. Si tienes Google Search Console, su informe de robots.txt te avisa de errores.
Cloudflare puede estar bloqueando a la IA aunque tu robots.txt diga que sí
Muchas webs de pymes pasan por Cloudflare sin que el dueño lo sepa, porque lo configuró la agencia o el proveedor. Y Cloudflare puede bloquear bots de IA en su red, antes de que lleguen a leer tu robots.txt.
Los cambios, por fecha:
- Julio de 2024: añade un botón para bloquear bots de IA con un clic, en todos los planes. Es opcional.
- 1 de julio de 2025: a cada dominio nuevo se le pregunta al darse de alta si permite los rastreadores de IA.
- 15 de septiembre de 2026: separa los bots en tres categorías (búsqueda, agente y entrenamiento) y cambia los valores por defecto. En las páginas que muestran anuncios, los bots de entrenamiento y de agente quedan bloqueados, y los de búsqueda permitidos. Según su comunicado del 1 de julio de 2026, esto aplica a los clientes nuevos, a los sitios nuevos y a los sitios del plan gratuito que no hubieran cambiado su configuración antes de esa fecha.
Qué significa para ti: si tu web está en Cloudflare y tiene páginas con anuncios, ChatGPT-User o Claude-User pueden estar bloqueados en esas páginas aunque tu robots.txt los permita. Y si alguien activó el bloqueo general, pueden estar fuera todos.
Dónde mirarlo: en el panel de Cloudflare, dentro de tu dominio, busca AI Crawl Control. Ahí ves qué bots de IA intentan entrar y si se les bloquea, y puedes cambiarlo. Está en todos los planes, también en el gratuito. Cloudflare ofrece además un robots.txt gestionado que añade reglas de IA a tu archivo; no viene activado por defecto.
Si prefieres que lo revisemos nosotros, nuestro diagnóstico gratuito comprueba si los bots de IA pueden leer tu web. Tienes el resto de guías en Guías.
Google-Extended y los AI Overviews: la confusión más común
Mucha gente bloquea Google-Extended pensando que así sale de las respuestas con IA de Google. No funciona así. Según la documentación de Google, actualizada el 14 de julio de 2026, Google-Extended controla si tu contenido se usa para entrenar futuros modelos de Gemini, y "does not impact a site's inclusion in Google Search nor is it used as a ranking signal".
Los AI Overviews y el Modo IA forman parte del buscador, y se controlan con Googlebot y con las etiquetas nosnippet y noindex. Bloquear Google-Extended no te saca de ellos. Bloquear Googlebot sí, pero también te saca de Google entero.
Preguntas frecuentes
¿Si bloqueo GPTBot desaparezco de ChatGPT?
No. GPTBot solo recoge contenido para entrenar modelos. La búsqueda de ChatGPT usa OAI-SearchBot, y ChatGPT-User entra cuando un usuario pide leer tu página. Si bloqueas GPTBot y dejas pasar a OAI-SearchBot, ChatGPT puede seguir citándote con enlace.
¿Bloquear los bots de IA afecta a mi posicionamiento en Google?
No, mientras no bloquees Googlebot. Google dice que Google-Extended no afecta a la inclusión en su buscador ni al ranking. Los bots de OpenAI, Anthropic o Perplexity tampoco influyen en Google.
¿Los bots de IA respetan de verdad el robots.txt?
Los de entrenamiento y de búsqueda de las grandes empresas dicen que sí. Los que entran a petición de un usuario, en general no: OpenAI, Perplexity, Google y Meta avisan de que pueden saltárselo. Anthropic dice que todos los suyos lo respetan. Bytespider no tiene documentación oficial.
Mi robots.txt permite a los bots de IA, ¿por qué no me encuentran?
Puede que algo los bloquee antes: Cloudflare u otro proveedor, un cortafuegos o un plugin de seguridad. Revisa AI Crawl Control si usas Cloudflare. Aun con el acceso abierto, que un asistente te mencione depende de tu contenido y de la pregunta.
¿Merece la pena bloquear los bots de IA si mi web es pequeña?
Depende de qué vendes. Si vives de que te encuentren, bloquear la búsqueda te resta visibilidad y bloquear el entrenamiento aporta poco. Si tu contenido es tu producto, bloquear el entrenamiento tiene sentido. Nunca bloquees Googlebot.
¿Cómo bloqueo ChatGPT en el robots.txt?
"ChatGPT" no es el nombre de ningún bot, así que User-agent: ChatGPT no hace nada. OpenAI usa GPTBot para entrenar, OAI-SearchBot para buscar y ChatGPT-User para lo que pide un usuario. Bloquea cada uno por su nombre, sabiendo que el último puede no respetarlo.