Inicio › Investigación › llms.txt y el acceso legible por máquinas
SEMPITE Investigación · Auditoría de ecosistema, parte 2 · Agosto 2026
1 de cada 8 archivos llms.txt está vacío. El mayor tiene 11.137 enlaces.
Nuestra primera auditoría preguntaba si los archivos llms.txt funcionan. Esta pregunta qué hay dentro de los que sí. La especificación es clara sobre la intención: un mapa breve y curado de su contenido más útil, para que una IA no tenga que adivinar. Abrimos los 1.318 archivos funcionales y contamos. En la práctica, el formato no tiene forma alguna — o está vacío, o es un mapita ordenado, o es una manguera de sitio entero, sin casi nada que imponga la diferencia.
La forma de un archivo llms.txt
Enlaces listados por archivo funcional, en los 1.318 que devolvieron contenido de texto real:
El archivo mediano lista 30 enlaces — exactamente el mapa curado para el que sirve el formato. Pero la media es 147, arrastrada al alza por una cola larga: 76 archivos listan más de 500 enlaces y 107 archivos pesan más de 100 KB. Cuando un archivo lista 11.137 URL, ha dejado de ser un mapa y se ha convertido en un sitemap con pasos añadidos — justo lo que llms.txt venía a sustituir.
Los vacíos son el fallo silencioso
171 archivos — el 13% de todo lo que carga — no contienen ningún enlace. Algunos son un único encabezado; otros, un título y una frase. Superan cualquier comprobación de disponibilidad (200 OK, texto real, no HTML), así que ninguna herramienta de monitorización los señala. Pero para una IA que intenta navegar por el sitio, un llms.txt vacío es indistinguible de no tener llms.txt — salvo porque su existencia implica que alguien decidió que esto ya estaba hecho. Es la casilla de «lo hemos publicado» sin nada detrás.
Dos errores opuestos, una misma causa raíz: el archivo vacío no dice nada; el de 11.137 enlaces lo dice todo y por tanto nada. Ambos ocurren porque llms.txt no tiene paso editorial. Se genera — con un plugin, un script de compilación o una tarde de cinco minutos — y después nunca se cura. El formato da por hecho que una persona decidió qué importa. En su mayoría, ninguna persona lo hizo.
Y los archivos siguen peleándose con el rastreador
Incluso donde el archivo tiene buena forma, la entrega se interpone. De los 19.039 enlaces que validamos dentro de estos archivos, el 1,8% devolvió 429 Too Many Requests — el propio servidor limitando la frecuencia del acto mismo de leer sus páginas recomendadas — y otros 65 fueron bloqueados directamente por antibots. Un archivo construido para invitar a la IA a entrar, servido por una infraestructura configurada para mantener fuera a los bots. La mano izquierda publica el manifiesto; la derecha estrangula a quien lo siga.
La conclusión de las dos partes de esta auditoría es la misma: llms.txt se trata como un artefacto que se produce una vez, no como una superficie que se mantiene. El archivo mediano demuestra que el formato puede funcionar. El octavo vacío, la cola de mangueras y los enlaces limitados por frecuencia demuestran que «puede» y «lo hace» están muy lejos — y que un poco de curaduría y una sola comprobación en integración continua pondrían a un sitio por delante de casi toda la web.
¿Quiere saber qué encuentra realmente un asistente de IA cuando lee su sitio?
Haga una comprobación gratuita de visibilidad en IAEstudios relacionados
- Auditamos 1.563 archivos llms.txt. Uno de cada seis ya está roto.
- El 98% de las tiendas Shopify sirven el mismo llms.txt. No es un mapa de contenido.
- Las marcas con archivo llms.txt son justo las que la IA ignora
Todos los estudios de esta área: llms.txt y el acceso legible por máquinas →