InicioInvestigaciónllms.txt y el acceso legible por máquinas

SEMPITE Investigación · Auditoría de ecosistema · Agosto 2026

Auditamos 1.563 archivos llms.txt. Uno de cada seis ya está roto.

llms.txt es el nuevo manual de instrucciones de la web para la IA — un archivo de texto plano que le dice a los modelos de lenguaje qué es un sitio y dónde están sus páginas importantes. La adopción se celebra. El mantenimiento, resulta, no. Descargamos todos los archivos llms.txt listados en los directorios públicos del propio ecosistema y validamos después 19.039 de los enlaces que contienen. El formato diseñado para hacer los sitios legibles a la IA se está pudriendo en silencio — y casi nadie lo está comprobando.

15,7%de los archivos llms.txt listados están rotos a nivel de archivo
18,2%de los sitios con archivo funcional enlazan al menos a una página muerta
19.039enlaces validados en 1.147 sitios
54sitios bloquean a los bots el archivo que publicaron para bots

Salud a nivel de archivo: 1 de cada 6 no funciona en absoluto

De los 1.563 archivos llms.txt listados en los directorios públicos del ecosistema (llmstxt.site, directory.llmstxt.cloud, llmstxthub.com), esto es lo que realmente responde:

Archivo de texto correcto84,3%
404 / desaparecido5,5%
Inaccesible (DNS/tiempo agotado)3,8%
Bloqueado a bots (403)3,5%
Devuelve una página HTML2,0%
Otros errores (5xx, 429)0,9%

Los dos modos de fallo que nadie detecta: 32 sitios devuelven un 200 OK para llms.txt — pero sirven el HTML de su página de inicio en lugar del archivo de texto (un repliegue típico de aplicación de página única). El archivo parece vivo en cualquier herramienta de monitorización y es inútil para un modelo de lenguaje. Y 54 sitios devuelven 403 Forbidden a los rastreadores: publicaron un archivo cuyo único propósito es ser leído por bots, y después apuntaron su protección antibots contra él.

Salud a nivel de enlace: qué hay dentro de los archivos que sí funcionan

Validamos 19.039 enlaces de 1.147 archivos correctos — todos los enlaces (hasta 400) de un centenar de sitios de documentación destacados, y una muestra aleatoria de 15 enlaces por sitio para la cola larga:

Responde correctamente (200)93,9%
Muerto (404/410)2,8%
Bloqueado (403/406/429)2,1%
Inaccesible0,7%
Otros errores0,5%

Otro 5,2% de los enlaces solo responde tras una redirección — la URL que el archivo entrega a la IA no es la URL que existe — y 19 enlaces acabaron en una página de inicio de sesión: técnicamente un 200, en la práctica una puerta cerrada. En total, aproximadamente 1 de cada 16 enlaces dentro de los archivos llms.txt del ecosistema no entrega el contenido que promete. 209 de 1.147 sitios (18,2%) enlazan al menos a una página muerta desde el archivo que escribieron específicamente para guiar a la IA.

Un caso práctico: Stripe

La documentación para desarrolladores de Stripe se considera ampliamente el estándar de oro, que es justo por lo que ilustra el problema. En julio, stripe.com/llms.txt dirigía a los rastreadores de IA a un archivo de «documentación completa» en stripe.com/llms-full.txt — que devolvía un 404. Se lo comunicamos a Stripe el 12 de julio.

  • 11 de julio — un sondeo en vivo encuentra que llms.txt dirige a los rastreadores de IA a llms-full.txt, que da 404.
  • 12 de julio — comunicamos el enlace roto a Stripe.
  • 5 de agosto — el puntero se ha eliminado de llms.txt, pero llms-full.txt sigue dando 404 tanto en stripe.com como en docs.stripe.com. Y una nueva validación de los 768 enlaces de los dos archivos llms.txt de Stripe encuentra 8 páginas de documentación muertas (Treasury, cumplimiento de Issuing y documentación de informes) más 2 enlaces que redirigen a los rastreadores de IA a un muro de acceso al panel.

Si la empresa con mejor cultura de documentación de internet publica callejones sin salida en su manifiesto para IA, la conclusión no es que Stripe sea descuidada — es que el pipeline de compilación de nadie trata llms.txt como producción. La documentación se mueve, los productos se retiran, los identificadores cambian — y el archivo escrito para máquinas se actualiza a mano, o no se actualiza.

Por qué esto importa

Un asistente de IA que sigue un enlace muerto no abre un informe de error. Recurre en silencio a lo que ya cree sobre usted — datos de entrenamiento obsoletos, la página comparativa de un competidor, un hilo de Reddit. Cada enlace roto en un archivo llms.txt es un momento en el que usted le cedió el micrófono a otro. Y a diferencia de un 404 humano, no existe ningún evento de analítica cuando una IA choca contra un callejón sin salida. El fallo es invisible salvo que uno vaya a buscarlo.

El arreglo no tiene glamour: trate llms.txt como infraestructura de producción. Valide sus enlaces en integración continua igual que valida su sitemap. Configure alertas ante los 404. Exima el archivo — explícitamente — de su protección antibots. Los sitios que hagan esto serán los que los sistemas de IA puedan leer de verdad; hoy por hoy, ese listón está sorprendentemente bajo.

¿Quiere saber qué encuentran — o no encuentran — los asistentes de IA cuando leen su sitio?

Haga una comprobación gratuita de visibilidad en IA

Metodología: 1.563 URL únicas de llms.txt recopiladas de llmstxt.site, directory.llmstxt.cloud y llmstxthub.com el 5 de agosto de 2026; cada una descargada con un agente de usuario de escritorio identificado como rastreador de investigación. Los archivos que devolvieron 200 con contenido de texto se analizaron en busca de enlaces absolutos. Validación de enlaces: comprobación completa (con tope de 400 enlaces) para ~100 sitios de documentación ampliamente reconocidos; muestra aleatoria de 15 enlaces para todos los demás; peticiones HEAD con repliegue a GET, 15 s de tiempo límite, redirecciones seguidas. Instantánea única — los sitios cambian; el bloqueo a bots puede variar según agente de usuario e IP; los listados de directorios sobrerrepresentan a los primeros adoptantes. Conjunto de datos publicado bajo CC BY 4.0 — cítese como «SEMPITE llms.txt Ecosystem Audit, agosto de 2026».

Estudios relacionados

Todos los estudios de esta área: llms.txt y el acceso legible por máquinas →

EN