Un cerrojo y pasador de latón en una puerta de madera desgastada, medio abierta, con un sendero de jardín más allá en luz suave

¿Bloquear rastreadores de IA? GPTBot vs ChatGPT-User

Introducción

Versión corta: la mayoría de los negocios no deberían bloquear rastreadores de IA, y los que sí lo hacen están bloqueando lo equivocado. La decisión importante no es si cobrar por el rastreo. Es la diferencia entre un bot de entrenamiento que copia tu sitio para un modelo y un agente activado por el usuario que está obteniendo tu página porque un cliente acaba de preguntar por ti. Bloquea al primero si tienes una razón. Bloquear al segundo aleja a un cliente en medio de su pregunta.

Por qué bloquear por user-agent castiga principalmente a los bots educados

Una regla en robots.txt solo detiene a los rastreadores que leen robots.txt y eligen obedecerlo. OpenAI, Anthropic, Google y Perplexity publican sus user agents y respetan las reglas de disallow. Los raspadores que realmente te preocupan no se anuncian y no leen el archivo. Así que un bloqueo general de user agents de IA mantiene fuera a las empresas que pidieron permiso y no hace nada contra las que no lo hicieron. Si quieres una aplicación real, necesitas hacerlo en el borde, a través de tu CDN o firewall, no en un archivo de texto.

Qué es realmente el cobro por rastreo de Cloudflare y por qué su adopción es mínima

El pay-per-crawl de Cloudflare permite que un sitio devuelva una respuesta de pago requerido a los rastreadores de IA y establezca un precio. Es una idea sensata para la pequeña cantidad de sitios cuyo contenido tiene valor de entrenamiento independiente. Para todos los demás, la economía no funciona, porque el valor marginal de entrenamiento de un solo sitio pequeño es cercano a cero. El dinero de licencias en este mercado va a corpora masivos, archivos a escala de Reddit y grandes editores, negociados como acuerdos y no medidos por página. Un dentista local o una consultora boutique que establezca un precio de rastreo no va a recibir pago. Va a ser omitido.

Un anillo de viejas llaves de latón sobre una mesa lateral de madera junto a una puerta blanca cerrada con pomo de latón en luz de ventana suave

Dos tipos de sitios, dos respuestas correctas

Si tu sitio es el producto, es decir, un editor, un curso de pago, un conjunto de datos propietario o reportajes originales por los que la gente paga para leerlos, bloquear rastreadores de entrenamiento es defendible. El modelo gana lo que tú vendes, y tú no ganas nada a cambio. Bloquea a los agentes de entrenamiento, mantén abiertos a los activados por el usuario y considera los controles de borde mencionados anteriormente.

Muchos sitios son ambos. Una consultora con un curso de pago, una publicación con una página de servicios, una empresa de software con documentación que preferiría no usar para entrenar a un competidor. La respuesta allí no es todo o nada. Prohíbe a los agentes de entrenamiento en la carpeta que contiene el material de pago o propietario y deja el resto del sitio abierto. Robots.txt funciona por ruta, y los agentes activados por el usuario aún pueden llegar a las páginas que existen para atraer clientes.

Si tu sitio existe para que la gente pueda encontrar tu negocio, bloquear es un auto-daño. Construiste el sitio para ser descubierto. Las respuestas de IA son ahora un canal de descubrimiento. Cortar a los rastreadores es la misma decisión que quitarte de Google en 2010 porque Google se beneficiaba de tu listado. Técnicamente cierto, comercialmente al revés.

Qué eligieron las agencias SEO de 307

Queríamos una línea base de las personas que asesoran a todos los demás, así que tomamos los 20 primeros resultados orgánicos para 36 consultas de agencias SEO, incluyendo “seo agency” más una ciudad para 30 grandes áreas metropolitanas de EE. UU., eliminamos directorios y tableros de empleo, y puntuamos los 307 sitios de agencias que quedaron. Solo el 3.6 por ciento bloquea GPTBot. Menos del uno por ciento bloquea ChatGPT-User o PerplexityBot. Noventa y seis por ciento permiten abiertamente al rastreador de entrenamiento de OpenAI. Lo que las agencias digan en publicaciones de blog, en sus propios sitios han decidido que ser encontrado por IA es más importante que mantener a un modelo fuera de leer sus páginas de servicio. La rúbrica completa y la distribución están en el censo de preparación para IA de agencias.

GPTBot es entrenamiento, ChatGPT-User es un cliente en medio de una pregunta

OpenAI ejecuta agentes separados para trabajos separados. GPTBot rastrea la web abierta para construir datos de entrenamiento. ChatGPT-User obtiene una página específica porque una persona en una conversación de ChatGPT preguntó algo que lo requiere, ahora mismo. OAI-SearchBot indexa para la búsqueda de ChatGPT. Perplexity y Anthropic hacen divisiones similares. Esa distinción es toda la política. Si quieres mantener tu contenido fuera del entrenamiento pero aún estar ahí cuando un cliente pregunte, robots.txt puede decir exactamente eso:

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Allow: /

Ajusta las líneas de entrenamiento a tu gusto. El punto es que los agentes activados por el usuario permanezcan abiertos. Nuestra Puntuación de Preparación para IA lee tu robots.txt y marca bloqueos accidentales en los agentes que importan, y el generador de llms.txt les da a los que permites un mapa limpio de qué leer primero.

Bloquear tu propio sitio no te elimina de las respuestas de IA

Esto sorprende a la gente. En nuestro estudio de categoría sobre citas en Google AI Overviews, los sitios web propiedad de marcas recibieron aproximadamente el cinco por ciento de los espacios de citación. El otro 95 por ciento citó a terceros: reseñas, directorios, publicaciones, foros, video. Los motores seguirán describiendo tu negocio desde esas fuentes con o sin que tu propio sitio sea legible. Bloquear no te da control. Elimina la única fuente que escribes tú mismo de la mezcla y deja el resto. Si una descripción incorrecta ya está circulando, la solución es la que está en por qué los negocios desaparecen de la búsqueda de IA, no una línea de disallow.

La pregunta de opt-out de la UE

Google ha propuesto un mecanismo que permitiría a los editores optar por no tener su contenido usado en funciones de búsqueda de IA, y los reguladores de la UE han estado recopilando las opiniones de los editores al respecto. Vale la pena observarlo, pero se aplica la misma lógica. Un editor cuyo contenido es el producto puede querer la opción de exclusión. Un negocio cuyo sitio existe para ser encontrado debe tener cuidado con excluirse de la superficie donde los clientes están obteniendo cada vez más sus respuestas. El manejo de Perplexity del contenido rastreado, cubierto en cómo Perplexity procesa tu contenido, muestra cómo se comportan diferente los motores una vez que los dejas entrar.

Sigue Leyendo

Our Research On This

Original SEMPITE studies — live queries, recorded answers, named sources. Free to cite under CC BY 4.0.

All studies on llms.txt and machine-readable access →

Not sure what your robots.txt is blocking? The free AI Readiness Score checks it in seconds.

Get in Touch

Frequently Asked Questions

¿Debería un pequeño negocio bloquear GPTBot?

Normalmente no. GPTBot es el rastreador de entrenamiento de OpenAI, y bloquearlo mantiene tus páginas fuera del entrenamiento futuro de modelos pero no hace nada por el descubrimiento. Un sitio web de negocio existe para ser encontrado, y las respuestas de IA son ahora parte de cómo la gente encuentra negocios. Bloquea solo si tu contenido es el producto que vendes.

¿Qué es ChatGPT-User?

ChatGPT-User es el agente que OpenAI envía cuando una persona en una conversación de ChatGPT pregunta algo que requiere obtener una página específica en tiempo real. No es un rastreador de entrenamiento. Bloquearlo significa que un cliente que acaba de preguntar por ti no puede obtener tu página en la respuesta.

¿Bloquear bots de IA daña el SEO?

No afecta las clasificaciones clásicas de Google, ya que Googlebot es separado. Sí reduce tu presencia en las respuestas de IA de los motores que bloqueas, y no detiene a esos motores de describirte usando fuentes de terceros, que proporcionan aproximadamente el 95 por ciento de las citas en nuestros estudios.

¿Cómo permito ChatGPT pero bloqueo el entrenamiento?

En robots.txt, prohíbe GPTBot y permite ChatGPT-User y OAI-SearchBot. Haz la misma división para otros proveedores, por ejemplo, prohíbe ClaudeBot y permite Claude-User. Los agentes de entrenamiento y los agentes activados por el usuario son publicados separadamente por cada empresa para exactamente este propósito.

¿Las agencias SEO bloquean rastreadores de IA en sus propios sitios?

Casi ninguna. En nuestro censo de 307 principales agencias SEO de EE. UU., solo el 3.6 por ciento bloquea GPTBot y menos del uno por ciento bloquea ChatGPT-User o PerplexityBot. Noventa y seis por ciento permiten al rastreador de entrenamiento de OpenAI.

Leave a Comment

Have a question or something to add? Drop a comment below.

Thanks — your comment has been submitted.
EN