InicioInvestigaciónllms.txt y el acceso legible por máquinas

SEMPITE Investigación · Auditoría de ecosistema, parte 2 · Agosto 2026

1 de cada 8 archivos llms.txt está vacío. El mayor tiene 11.137 enlaces.

Nuestra primera auditoría preguntaba si los archivos llms.txt funcionan. Esta pregunta qué hay dentro de los que sí. La especificación es clara sobre la intención: un mapa breve y curado de su contenido más útil, para que una IA no tenga que adivinar. Abrimos los 1.318 archivos funcionales y contamos. En la práctica, el formato no tiene forma alguna — o está vacío, o es un mapita ordenado, o es una manguera de sitio entero, sin casi nada que imponga la diferencia.

13%de los archivos funcionales no listan ningún enlace — un mapa vacío
30enlaces en el archivo mediano (el formato funcionando como se pretendía)
107archivos superan los 100 KB — volcados de sitio completo
11.137enlaces en el mayor archivo individual (1,5 MB)

La forma de un archivo llms.txt

Enlaces listados por archivo funcional, en los 1.318 que devolvieron contenido de texto real:

0 enlaces (mapa vacío)13,0%
1–1014,9%
11–5035,0%
51–20023,1%
201–5008,3%
500+ (manguera)5,8%

El archivo mediano lista 30 enlaces — exactamente el mapa curado para el que sirve el formato. Pero la media es 147, arrastrada al alza por una cola larga: 76 archivos listan más de 500 enlaces y 107 archivos pesan más de 100 KB. Cuando un archivo lista 11.137 URL, ha dejado de ser un mapa y se ha convertido en un sitemap con pasos añadidos — justo lo que llms.txt venía a sustituir.

Los vacíos son el fallo silencioso

171 archivos — el 13% de todo lo que carga — no contienen ningún enlace. Algunos son un único encabezado; otros, un título y una frase. Superan cualquier comprobación de disponibilidad (200 OK, texto real, no HTML), así que ninguna herramienta de monitorización los señala. Pero para una IA que intenta navegar por el sitio, un llms.txt vacío es indistinguible de no tener llms.txt — salvo porque su existencia implica que alguien decidió que esto ya estaba hecho. Es la casilla de «lo hemos publicado» sin nada detrás.

Dos errores opuestos, una misma causa raíz: el archivo vacío no dice nada; el de 11.137 enlaces lo dice todo y por tanto nada. Ambos ocurren porque llms.txt no tiene paso editorial. Se genera — con un plugin, un script de compilación o una tarde de cinco minutos — y después nunca se cura. El formato da por hecho que una persona decidió qué importa. En su mayoría, ninguna persona lo hizo.

Y los archivos siguen peleándose con el rastreador

Incluso donde el archivo tiene buena forma, la entrega se interpone. De los 19.039 enlaces que validamos dentro de estos archivos, el 1,8% devolvió 429 Too Many Requests — el propio servidor limitando la frecuencia del acto mismo de leer sus páginas recomendadas — y otros 65 fueron bloqueados directamente por antibots. Un archivo construido para invitar a la IA a entrar, servido por una infraestructura configurada para mantener fuera a los bots. La mano izquierda publica el manifiesto; la derecha estrangula a quien lo siga.

La conclusión de las dos partes de esta auditoría es la misma: llms.txt se trata como un artefacto que se produce una vez, no como una superficie que se mantiene. El archivo mediano demuestra que el formato puede funcionar. El octavo vacío, la cola de mangueras y los enlaces limitados por frecuencia demuestran que «puede» y «lo hace» están muy lejos — y que un poco de curaduría y una sola comprobación en integración continua pondrían a un sitio por delante de casi toda la web.

¿Quiere saber qué encuentra realmente un asistente de IA cuando lee su sitio?

Haga una comprobación gratuita de visibilidad en IA

Metodología: los 1.318 archivos analizados son los que devolvieron HTTP 200 con contenido de texto real (no HTML) en la auditoría del ecosistema llms.txt de SEMPITE del 5 de agosto de 2026 (1.563 archivos listados en llmstxt.site, directory.llmstxt.cloud y llmstxthub.com). «Enlaces» cuenta las URL absolutas extraídas de cada archivo. El tamaño es la longitud en bytes descargada. Las cifras de limitación de frecuencia y bloqueo proceden de validar 19.039 de esos enlaces (comprobación completa hasta 400 enlaces para ~100 sitios de documentación destacados; muestra aleatoria de 15 enlaces por sitio para la cola larga). Instantánea única; los recuentos reflejan los archivos tal como se sirvieron a un rastreador de investigación en esa fecha. Conjunto de datos publicado bajo CC BY 4.0 — cítese como «SEMPITE llms.txt Ecosystem Audit (parte 2), agosto de 2026».

Estudios relacionados

Todos los estudios de esta área: llms.txt y el acceso legible por máquinas →

EN