Inicio › Investigación › Métodos
SEMPITE Investigación · Métodos · Septiembre 2026 · Por Jacob Gerrish
Hemos publicado números que estaban equivocados. Así es como los encontramos.
Cada estudio de SEMPITE incluye los registros brutos y el código que los generó, y cada cifra publicada se recalcula a partir de esos registros mediante un script que se niega a construir el paquete si una sola cifra no coincide. Esta página existe porque ese proceso ha detectado cuatro errores reales, uno de ellos meses después de la publicación. Las correcciones te son más útiles que afirmar que no cometemos errores.
La regla: si los datos no pueden enviarse, el estudio no se publica
Un estudio se convierte en un conjunto de datos publicado cuando podemos entregar a un desconocido los registros por unidad y el script que los generó. Algunos estudios de SEMPITE no pasan esa prueba y no se depositan. Es intencional, y es la razón por la que existen cuatro conjuntos de datos en lugar de veintitrés.
Cada paquete se ensambla mediante un script de compilación que recalcula cada cifra principal a partir de las filas brutas y lo compara con lo que afirma el informe. Si alguna cifra no coincide, el script termina y no se produce ningún paquete. La verificación es una puerta, no un informe que alguien lee después.
Por qué eso importa más de lo que parece: el fallo habitual no es un número fabricado. Es un número que era cierto para una versión anterior de los datos, o cierto bajo una definición que cambió silenciosamente. Una puerta detecta esos casos. Un humano releer su propio trabajo no lo hace.
Corrección uno: la regla que pensó que una ciudad era un negocio
En julio y agosto de 2026 publicamos que el 32% y luego el 43% de los negocios que Google posiciona en primer lugar no son mencionados por ChatGPT. Ambas cifras eran incorrectas.
La regla que decidía si una respuesta de IA mencionaba a un negocio contaba cualquier palabra con aspecto distintivo del título de la lista de Google del negocio. Esos títulos están saturados de palabras clave, por lo que las palabras incluían la ciudad y el oficio. Al preguntar "Necesito un fontanero en Miami", casi todas las respuestas contienen las palabras fontanero y Miami, y la regla interpretaba eso como una coincidencia.
Reescribimos el comparador en septiembre, recalculamos las puntuaciones de las respuestas que habíamos almacenado y republicamos. La cifra de agosto es 96.0% invisible, no 43%. La nueva regla tiende a contar una mención dondequiera que la llamada sea ambigua, por lo que la tasa de invisibilidad publicada puede subestimar el problema, pero no inflarlo.
Lo que hizo posible la corrección: habíamos almacenado cada respuesta de IA en su totalidad, no solo los veredictos. Si hubiéramos conservado solo "mencionado: true", el error habría sido permanente e indetectable. Almacenar la respuesta cruda es lo que permite corregir un estudio en lugar de retractarlo.
Corrección dos: aritméticamente perfecta, construida sobre casi nada
Un verificador que comprueba la aritmética no es una comprobación de la calidad de los datos. Durante el estudio de etiquetado de Shopify, una ejecución pasó todas las pruebas aritméticas que teníamos mientras se basaba en 47 de 1,075 tiendas. Cada porcentaje fue calculado correctamente. La colección subyacente había fallado silenciosamente.
La salud de la recopilación ahora se controla por separado de la corrección analítica, porque ambas fallan de forma independiente y solo una de ellas es visible en la salida. Una ejecución debe demostrar que recopiló lo que afirma antes de que sus números sean calculados en absoluto.
Corrección tres: encontrar código de lista de deseos no es encontrar una lista de deseos
Detectar el código de lista de deseos en una página es fácil. Confirmar que un comprador puede guardar algo realmente no lo es. En 1,028 tiendas Shopify, 46.0% tienen código de lista de deseos y 28.1% tienen un control de guardado que pudimos confirmar que funciona.
Cualquiera que mida esto solo mediante la coincidencia de patrones en el código fuente de la página sobreestima las listas de deseos funcionales en aproximadamente 18 puntos porcentuales. Ahora ejecutamos una segunda pasada de verificación que vuelve a obtener cada candidato y registra la evidencia detrás de cada veredicto, y esa evidencia se incluye en el conjunto de datos para que cualquier llamada individual pueda ser disputada.
Corrección cuatro, encontrada mientras escribíamos esta página
Al preparar el Índice de Visibilidad de IA para su depósito, descubrimos que el código de puntuación estaba calculando las tasas publicadas sobre respuestas que se habían almacenado truncadas. Todas las 150 observaciones de Google AI Mode de agosto fueron afectadas. El README del paquete decía que esas respuestas estaban excluidas; el archivo de resumen publicó una tasa para ellas de todos modos.
Una respuesta truncada solo puede subcontar menciones, por lo que esa cifra era un límite superior de la invisibilidad en lugar de una medición de ella. El bloque ahora informa la exclusión y su razón en lugar de un número. Todas las demás cifras no se vieron afectadas, lo cual establecimos con una diferencia antes y después que muestra exactamente un valor cambiado.
Lo que se entrega con cada estudio
Cuatro cosas, en cada depósito, sin excepciones:
Las secciones de limitaciones nombran las cosas que nos avergonzarían: marcos de muestreo que no generalizan, intervalos de confianza optimistas porque las observaciones están agrupadas y al menos una cifra en un conjunto de datos que no puede reproducirse desde los archivos proporcionados, declarada claramente en lugar de omitida.
Verifícalo tú mismo
Los cuatro conjuntos de datos a continuación tienen DOIs permanentes, datos abiertos y código abierto bajo CC BY 4.0 y MIT. Uno de ellos tiene un cuaderno ejecutable que recalcula cada cifra destacada desde los archivos enviados en unos veinte segundos, en el hardware de otra persona, sin nuestra intervención.
- El corpus llms.txt, dos observaciones a seis semanas de distancia
- El Índice de Visibilidad IA de SEMPITE, 50 mercados locales, trimestral
- Etiquetado de productos e intención guardada, 1,028 tiendas Shopify y 700 títulos de Steam
- A quién cita la IA de Google para descubrir libros, 95 citas
Lo que no afirmamos
Que nuestros números sean correctos. Eso no es algo que una página de métodos pueda establecer, y un proveedor que lo afirme no debería ser creído. Lo que afirmamos es más limitado y verificable: los datos detrás de cada cifra publicada están disponibles, el código que los generó está disponible, las limitaciones están documentadas y cuando nos equivocamos lo decimos en público con los datos corregidos adjuntos.
Tres de las cuatro correcciones de esta página fueron encontradas por nuestro propio proceso antes de que nadie más las viera. Una fue encontrada después de la publicación y se republicó. Esperamos que haya una quinta.
Preguntas frecuentes
¿Por qué publican sus propios errores?
Porque la alternativa es pedirte que confíes en los números de un proveedor. Todas las agencias de marketing afirman que su investigación es rigurosa. Casi ninguna publica los datos, y ninguna te cuenta sobre la vez que se equivocaron en una cifra por 53 puntos porcentuales. Una corrección con los datos corregidos adjuntos es evidencia. Una afirmación de rigor no lo es.
¿Cómo verifico yo mismo una cifra de SEMPITE?
Abre el conjunto de datos detrás del estudio, que está enlazado desde cada página de investigación, y recalcula el número a partir de las filas crudas. El código de recopilación y análisis viene incluido con él. Para el estudio de etiquetado de Shopify hay un cuaderno en Kaggle que lo hace en unos veinte segundos sin que tengas que instalar nada.
¿Corrigen cifras después de la publicación?
Sí, en público. Las cifras de visibilidad de IA de julio y agosto de 2026 se republicaron en septiembre después de descubrir que la regla de coincidencia era incorrecta. La página de investigación lleva un aviso de corrección con fecha, el conjunto de datos documenta qué cambió y por qué la cifra anterior era incorrecta, y el número antiguo no se edita silenciosamente.
¿Qué significa que solo cuatro estudios estén depositados cuando publican más de veinte?
Un estudio se convierte en un depósito solo cuando sus registros crudos y el código de recopilación pueden enviarse con él. Algunos de nuestros estudios publicados no pueden cumplir ese criterio, generalmente porque los datos subyacentes no se conservaron en una forma reutilizable. Esos permanecen como informes escritos y no se presentan como conjuntos de datos abiertos. Preferimos tener cuatro estudios que puedas verificar a veinte en los que tengas que confiar.
¿Qué significa que sus intervalos de confianza sean optimistas?
En el Índice de Visibilidad de IA, tres empresas en un mercado se puntúan contra la misma respuesta de IA, por lo que esas tres observaciones no son independientes entre sí. Los intervalos de Wilson que publicamos los tratan como si lo fueran, lo que hace que los intervalos sean más estrechos de lo que deberían ser. Un intervalo robusto a clúster sería más amplio. Lo declaramos en las limitaciones en lugar de dejar que lo descubras tú.