maquinable.comwebs legibles para los agentes de IAESENDiagnóstico gratis

Maquinable › Guías

Qué es llms.txt y si le sirve a la web de tu pyme

Por Maquinable · Publicado el 24 de septiembre de 2026

Qué es llms.txt: un archivo de texto en formato Markdown que se coloca en la raíz de tu web y resume, para los modelos de IA, quién eres y cuáles son tus páginas importantes. Si has oído hablar de él en LinkedIn, en un webinar o en un aviso de tu plugin de WordPress, este artículo te explica qué es, quién lo lee de verdad hoy y si merece la pena en la web de una pyme.

Qué es llms.txt, sin tecnicismos

Las webs están hechas para personas: menús, banners de cookies, carruseles, textos que aparecen al hacer scroll. Un modelo de lenguaje o LLM (la tecnología detrás de ChatGPT, Claude, Gemini o Perplexity) que entra en esa web tiene que separar lo importante del decorado, y a veces no lo consigue. llms.txt le ofrece un atajo: una página de texto limpio que dice "esto somos y aquí están nuestras páginas clave".

El archivo vive siempre en la misma dirección: tuweb.es/llms.txt. Está escrito en Markdown, que es texto plano con almohadillas (#) para los títulos y guiones para las listas. Lo propuso Jeremy Howard, cofundador de Answer.AI, el 3 de septiembre de 2024, y publicó una segunda versión el 10 de agosto de 2026 con lo aprendido en dos años de uso. Ninguna organización de estándares lo ha aprobado: es una convención que cada web adopta si quiere.

La propuesta solo exige un título con el nombre de la web. Lo demás es opcional: un resumen de una o dos frases, algún párrafo de contexto y listas de enlaces agrupadas por secciones, cada una con una línea que explica qué hay en esa página.

Así se vería el de una asesoría ficticia:

# Asesoría Ejemplo

> Asesoría fiscal, laboral y contable para autónomos y pymes de Zaragoza.
> Trabajamos con cuota mensual fija y atendemos en persona y en línea.

## Servicios
- [Autónomos](https://ejemplo.es/autonomos): altas, IVA trimestral e IRPF.
- [Sociedades](https://ejemplo.es/sociedades): contabilidad, impuesto de sociedades y cuentas anuales.
- [Laboral](https://ejemplo.es/laboral): nóminas, contratos y seguros sociales.

## Tarifas y contacto
- [Tarifas](https://ejemplo.es/tarifas): cuotas mensuales por tipo de cliente.
- [Contacto](https://ejemplo.es/contacto): dirección, horario y teléfono.

Son quince líneas que dicen qué haces, para quién, dónde trabajas y dónde está cada cosa.

llms.txt, robots.txt y sitemap.xml: en qué se diferencian

Los tres son archivos que se ponen en la raíz de la web y se confunden con facilidad. Hacen cosas distintas:

ArchivoQué haceQuién lo lee¿Imprescindible?
robots.txtDa o quita permiso a cada rastreador para entrarTodos los buscadores y los rastreadores de IA documentadosSí
sitemap.xmlLista todas las URLs de la webBuscadores como Google y BingMuy recomendable
llms.txtResume la web y enlaza una selección de páginasAlgunos agentes y herramientas de IA (ver más abajo)No

En la práctica, llms.txt no da ni quita permisos. Si tu robots.txt bloquea a GPTBot, OAI-SearchBot, ClaudeBot o PerplexityBot (los rastreadores de OpenAI, Anthropic y Perplexity), da igual lo bien hecho que esté tu llms.txt, porque esos bots no van a entrar.

¿Lo leen ChatGPT, Google, Claude y Perplexity? Lo que dicen ellos mismos

Ninguna documentación oficial respalda que OpenAI o Anthropic ya procesen llms.txt. Esto es lo que dice cada empresa en sus propias páginas, consultadas el 24 de septiembre de 2026.

Google

Su guía de optimización para las funciones de IA del buscador, actualizada el 10 de julio de 2026, es la más clara: "You don't need to create new machine readable files, AI text files, markup, or Markdown to appear in Google Search (including its generative AI capabilities), as Google Search itself doesn't use them." Es decir, no hace falta crear archivos de texto para IA para aparecer en Google, incluidas sus respuestas generadas con IA, porque el buscador no los usa. Fuente: Google Search Central.

Lighthouse, la herramienta de Chrome que mide la calidad técnica de una web, sí incluye desde mayo de 2026 una comprobación de llms.txt en su categoría de navegación con agentes. Si el archivo no existe, la marca como "no aplica" porque "providing the file is optional at the moment". Es una herramienta para agentes que navegan webs, no para el buscador.

OpenAI (ChatGPT)

Su página sobre rastreadores describe GPTBot, OAI-SearchBot y ChatGPT-User, y explica cómo controlarlos con robots.txt. No dice que ninguno lea llms.txt. Lo único relacionado es un enlace al llms.txt de su propia documentación.

Anthropic (Claude)

Su artículo de ayuda sobre rastreadores, actualizado el 7 de abril de 2026, describe ClaudeBot, Claude-User y Claude-SearchBot, todos controlados con robots.txt. No menciona llms.txt.

Perplexity

Su página de rastreadores describe PerplexityBot y Perplexity-User. Tampoco dice que lean llms.txt, y como OpenAI, enlaza al llms.txt de su propia documentación.

Lo que dicen los datos

En junio de 2026, Ahrefs publicó un estudio sobre 137.210 dominios. El 28 % tenía un llms.txt, y el 97 % de esos archivos no recibió ni una sola visita en mayo de 2026. En los dominios sin llms.txt, ningún bot de IA intentó buscarlo.

Las grandes empresas de IA publican llms.txt para su propia documentación, pero ninguna documenta que sus rastreadores lean el de tu web.

Entonces, ¿para qué sirve hoy?

Sirve sobre todo cuando alguien apunta una herramienta de IA a tu web a propósito. Un agente que navega por encargo de un usuario, un asistente de programación al que le dicen "lee esta documentación" o una herramienta conectada a otros sistemas pueden aprovechar un índice limpio en lugar de recorrer la web entera. Por eso donde más se usa es en webs de documentación técnica.

También tiene un valor interno que no depende de ningún bot: escribirlo te obliga a decidir en cinco líneas qué haces y cuáles son tus diez páginas importantes. Muchas webs de pymes no superan ese ejercicio, y lo que sale de él sirve para la página de inicio, para Google Business Profile y para cualquier directorio.

Lo que no hace:

  • No mejora tu posicionamiento en Google (tu SEO).
  • No garantiza que ChatGPT, Claude, Gemini o Perplexity te citen.
  • No protege tu contenido ni impide que lo usen para entrenar modelos. Eso se decide en robots.txt.

¿Merece la pena ponerlo en la web de tu pyme?

Si cuesta poco, sí. En WordPress, Yoast SEO lo genera gratis desde sus ajustes y Rank Math lo activa como módulo. En otros casos son quince minutos con un editor de texto. No perjudica a tu web y puede ayudar a algún agente.

Pero no es lo primero. Si lo que quieres es que un asistente de IA pueda leer tu web y entender a qué te dedicas, esto pesa más, por este orden:

  1. robots.txt: comprueba que no bloqueas a los rastreadores de búsqueda de IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Pasa más de lo que parece, a veces por una plantilla o un plugin de seguridad. Lo explicamos en robots.txt y bots de IA.
  2. Contenido legible sin JavaScript: algunos constructores de webs cargan el texto con scripts, y muchos rastreadores de IA no los ejecutan. Para ellos, esa página está vacía.
  3. Páginas de servicio claras: qué haces, para quién, dónde y cuánto cuesta, dicho en texto y no solo en imágenes.
  4. Después, llms.txt.

Si no sabes cómo está tu web en esos cuatro puntos, en Maquinable hacemos un diagnóstico gratuito que los revisa con un escáner independiente.

Cómo crear un llms.txt en cuatro pasos

  1. Elige entre 10 y 20 páginas clave: servicios, tarifas, contacto, casos, preguntas frecuentes. No metas todas las URLs; para eso está el sitemap.
  2. Escribe el archivo: usa la plantilla de arriba como base. Un título con tu nombre, una o dos frases de resumen y las listas de enlaces con una línea cada uno.
  3. Súbelo a la raíz de tu web: con el nombre exacto llms.txt, en minúsculas. Si usas Yoast o Rank Math, el plugin lo publica por ti.
  4. Comprueba que abre: entra en tuweb.es/llms.txt desde el navegador. Tiene que verse como texto, no descargarse ni dar error.

Si quieres ver uno real, el de esta web está en maquinable.com/llms.txt.

Existe también una variante, llms-full.txt, que incluye el texto completo de las páginas en lugar de solo los enlaces. Tiene sentido en webs de documentación extensa; para una pyme suele sobrar.

Los errores más habituales son meter todas las URLs de la web, enlazar páginas que ya no existen y olvidarse de actualizarlo. Un llms.txt con enlaces rotos da peor imagen que no tener ninguno, así que revísalo cada vez que cambies páginas importantes.

Preguntas frecuentes

¿llms.txt sirve para aparecer en ChatGPT?

No por sí solo. OpenAI no documenta que sus rastreadores lean llms.txt, y un estudio de Ahrefs de junio de 2026 vio que el 97 % de estos archivos no recibe visitas. Para ChatGPT pesa más que robots.txt no bloquee a OAI-SearchBot y que tu contenido se lea sin JavaScript.

¿Google usa llms.txt?

No para su buscador. Su guía de optimización para IA, actualizada en julio de 2026, dice que Google Search no usa archivos de texto para IA y que crearlos ni ayuda ni perjudica. Lighthouse, la herramienta de Chrome, sí lo comprueba, pero como opcional.

¿Qué diferencia hay entre llms.txt y robots.txt?

robots.txt da o quita permiso a cada rastreador para entrar en tu web, y los bots de IA documentados lo respetan. llms.txt solo resume tu web y enlaza tus páginas clave, sin permisos. Si robots.txt bloquea a un bot, el llms.txt no sirve de nada.

¿Dónde se pone el archivo llms.txt?

En la raíz del dominio, de forma que se abra en tuweb.es/llms.txt, igual que robots.txt. En WordPress, Yoast SEO y Rank Math lo generan y lo publican ahí desde sus ajustes, sin tocar el servidor.

¿Qué es llms-full.txt?

Una variante opcional que incluye el texto completo de las páginas, no solo los enlaces. Es útil en webs de documentación técnica extensa, donde una IA necesita todo el contenido. Para la web de una pyme, con el llms.txt normal es suficiente.

¿Puede perjudicar a mi web tener un llms.txt?

No. Google dice que no ayuda ni perjudica a la visibilidad en su buscador. Tampoco abre la puerta a que usen tu contenido: eso se controla en robots.txt, bloqueando a los rastreadores de entrenamiento que no quieras.