Inicio › Investigación › llms.txt y el acceso legible por máquinas
SEMPITE Investigación · Auditoría de ecosistema · Agosto 2026
Auditamos 1.563 archivos llms.txt. Uno de cada seis ya está roto.
llms.txt es el nuevo manual de instrucciones de la web para la IA — un archivo de texto plano que le dice a los modelos de lenguaje qué es un sitio y dónde están sus páginas importantes. La adopción se celebra. El mantenimiento, resulta, no. Descargamos todos los archivos llms.txt listados en los directorios públicos del propio ecosistema y validamos después 19.039 de los enlaces que contienen. El formato diseñado para hacer los sitios legibles a la IA se está pudriendo en silencio — y casi nadie lo está comprobando.
Salud a nivel de archivo: 1 de cada 6 no funciona en absoluto
De los 1.563 archivos llms.txt listados en los directorios públicos del ecosistema (llmstxt.site, directory.llmstxt.cloud, llmstxthub.com), esto es lo que realmente responde:
Los dos modos de fallo que nadie detecta: 32 sitios devuelven un 200 OK para llms.txt — pero sirven el HTML de su página de inicio en lugar del archivo de texto (un repliegue típico de aplicación de página única). El archivo parece vivo en cualquier herramienta de monitorización y es inútil para un modelo de lenguaje. Y 54 sitios devuelven 403 Forbidden a los rastreadores: publicaron un archivo cuyo único propósito es ser leído por bots, y después apuntaron su protección antibots contra él.
Salud a nivel de enlace: qué hay dentro de los archivos que sí funcionan
Validamos 19.039 enlaces de 1.147 archivos correctos — todos los enlaces (hasta 400) de un centenar de sitios de documentación destacados, y una muestra aleatoria de 15 enlaces por sitio para la cola larga:
Otro 5,2% de los enlaces solo responde tras una redirección — la URL que el archivo entrega a la IA no es la URL que existe — y 19 enlaces acabaron en una página de inicio de sesión: técnicamente un 200, en la práctica una puerta cerrada. En total, aproximadamente 1 de cada 16 enlaces dentro de los archivos llms.txt del ecosistema no entrega el contenido que promete. 209 de 1.147 sitios (18,2%) enlazan al menos a una página muerta desde el archivo que escribieron específicamente para guiar a la IA.
Un caso práctico: Stripe
La documentación para desarrolladores de Stripe se considera ampliamente el estándar de oro, que es justo por lo que ilustra el problema. En julio, stripe.com/llms.txt dirigía a los rastreadores de IA a un archivo de «documentación completa» en stripe.com/llms-full.txt — que devolvía un 404. Se lo comunicamos a Stripe el 12 de julio.
- 11 de julio — un sondeo en vivo encuentra que llms.txt dirige a los rastreadores de IA a llms-full.txt, que da 404.
- 12 de julio — comunicamos el enlace roto a Stripe.
- 5 de agosto — el puntero se ha eliminado de llms.txt, pero llms-full.txt sigue dando 404 tanto en stripe.com como en docs.stripe.com. Y una nueva validación de los 768 enlaces de los dos archivos llms.txt de Stripe encuentra 8 páginas de documentación muertas (Treasury, cumplimiento de Issuing y documentación de informes) más 2 enlaces que redirigen a los rastreadores de IA a un muro de acceso al panel.
Si la empresa con mejor cultura de documentación de internet publica callejones sin salida en su manifiesto para IA, la conclusión no es que Stripe sea descuidada — es que el pipeline de compilación de nadie trata llms.txt como producción. La documentación se mueve, los productos se retiran, los identificadores cambian — y el archivo escrito para máquinas se actualiza a mano, o no se actualiza.
Por qué esto importa
Un asistente de IA que sigue un enlace muerto no abre un informe de error. Recurre en silencio a lo que ya cree sobre usted — datos de entrenamiento obsoletos, la página comparativa de un competidor, un hilo de Reddit. Cada enlace roto en un archivo llms.txt es un momento en el que usted le cedió el micrófono a otro. Y a diferencia de un 404 humano, no existe ningún evento de analítica cuando una IA choca contra un callejón sin salida. El fallo es invisible salvo que uno vaya a buscarlo.
El arreglo no tiene glamour: trate llms.txt como infraestructura de producción. Valide sus enlaces en integración continua igual que valida su sitemap. Configure alertas ante los 404. Exima el archivo — explícitamente — de su protección antibots. Los sitios que hagan esto serán los que los sistemas de IA puedan leer de verdad; hoy por hoy, ese listón está sorprendentemente bajo.
¿Quiere saber qué encuentran — o no encuentran — los asistentes de IA cuando leen su sitio?
Haga una comprobación gratuita de visibilidad en IAEstudios relacionados
- 1 de cada 8 archivos llms.txt está vacío. El mayor tiene 11.137 enlaces.
- El 98% de las tiendas Shopify sirven el mismo llms.txt. No es un mapa de contenido.
- Las marcas con archivo llms.txt son justo las que la IA ignora
Todos los estudios de esta área: llms.txt y el acceso legible por máquinas →