·Metodología·Minds Team

Cómo Leer las Reclamaciones de Precisión de Audiencias Sintéticas

Nueve proveedores de audiencias sintéticas publican cifras de precisión. Utilizan diferentes métricas, diferentes líneas de base y diferentes muestras, por lo que los números no se pueden clasificar entre sí. Ocho preguntas separan una reclamación verificable de una que no se puede falsificar.

Los proveedores de investigación sintética publican cifras de precisión entre el 85% y el 98%. Leído rápidamente, el campo parece establecido y las diferencias parecen pequeñas.

No son comparables. Los porcentajes miden diferentes cantidades contra diferentes líneas de base en diferentes tareas, y varios no miden la precisión en absoluto. Este artículo expone lo que encontramos al leer el material publicado de nueve proveedores en septiembre de 2026, incluido el nuestro, y las ocho preguntas que separan una reclamación que puedes verificar de una que no puedes.

Tenemos un interés aquí. Minds vende audiencias sintéticas. Así que el estándar a continuación se aplica a nosotros en los mismos términos, y el lugar donde salimos peor se declara tan claramente como el de los demás.

Las ocho preguntas

Una reclamación de precisión publicada es verificable cuando responde a estas:

  1. ¿Contra qué estándar externo? Un conjunto de datos independiente nombrado o un estudio publicado, no una muestra interna.
  2. ¿Contra qué techo? Los humanos no reproducen sus propias respuestas perfectamente. Su autoconsistencia es el máximo realista.
  3. ¿Contra qué piso? Lo que la misma métrica puntúa sin modelo detrás de ella.
  4. ¿Qué significa la métrica? "Precisión" no se define por sí misma.
  5. ¿Comparado con qué línea de base? Un aviso ingenuo al mismo modelo es la comparación que importa, porque esa es la alternativa gratuita.
  6. ¿Revisado por quién? La revisión por pares o un preprint invitan a la corrección.
  7. ¿Dónde falla? Un método sin un modo de fallo publicado no ha sido probado lo suficientemente duro como para encontrar uno.
  8. ¿Puede alguien verificarlo? Método, muestra y datos disponibles para inspección.

Lo que publica el campo

Compilado de las propias páginas y documentos públicos de los proveedores, septiembre de 2026.

ProveedorCifra principalLo que mide
Simile85% de fiabilidad de auto-retest humanoReproducción de las respuestas de individuos fuente, contra el piso de ruido humano
Artificial Societies86% de precisión de distribuciónCoincidencia de distribución, contra un techo humano declarado del 91%
Articos86% de temas identificados por expertosRecuperación de temas vs informes publicados de expertos
Evelance89.78% de superposición temáticaCoincidencia de temas, 7 personas vs 23 usuarios reales
Synthetic Users85–92% "Paridad Orgánica Sintética"Similitud de entrevistas sintéticas a reales
Aaru0.90 de correlación medianaCorrelación en un estudio de cliente
Evidenza88% de precisión, 0.81 de correlaciónMétrica no definida públicamente
Fairgen98% de tasa de aprobación de sanidadUn control de calidad interno, no precisión
MindsSpearman 0.85, +4% de sesgo de escalaCorrelación de rangos en 54 anuncios vs un panel humano

Dos observaciones siguen, y ninguna es sobre cuál producto es mejor.

El número más alto no es una cifra de precisión. El 98% de Fairgen es la proporción de perfiles generados que pasan su propio control de calidad de seis dimensiones. No dice nada sobre si la salida coincide con los datos humanos, y Fairgen no afirma que lo haga. Cualquiera que ordene esta tabla por porcentaje los clasificaría primero en una medida en la que nunca participaron.

Solo dos cifras son comparables. El 85% de Simile y el 86% de Artificial Societies se expresan como una proporción de lo que los humanos logran. Se pueden comparar. Nada más en la columna se puede comparar con nada, incluyendo entre sí.

Quién publica fallos

Aquí es donde el campo se separa más claramente.

Fairgen declara los estudios para los cuales su método no es adecuado: seguimiento de marca, segmentación, conjunto conjunto. Su orientación es "probar antes de ir al campo, no en su lugar". Synthetic Users afirma que los encuestados sintéticos "sin calibración son individualmente creíbles, pero colectivamente incorrectos". Articos y Evelance dicen que su salida es direccional y pertenece junto a la investigación humana en lugar de en su lugar.

Aaru, Evidenza y Artificial Societies no publican condiciones de fallo que pudiéramos encontrar.

Dónde estamos, incluido el vacío

Nuestros propios estudios utilizan ablaciones de cuatro condiciones, retienen respuestas reales, sellan selecciones de candidatos antes de que se abran los objetivos, y reportan el piso de oportunidad junto al resultado. En un conjunto de ítems GSS, una distribución plana sin modelo detrás de ella ya puntúa 83.71%; nuestro 92.47% cierra el 54% de la distancia restante. El piso pertenece junto al porcentaje, y generalmente falta.

Publicamos resultados que no funcionaron. Un aumento de perfil registrado de 0.17 puntos tuvo un intervalo del 95% de -1.00 a +1.31, cruzó cero y no cumplió con su criterio de promoción. En avisos cortos cotidianos en una comparación cegada, nuestras audiencias ganaron un 13.8% frente al 30.5% para avisos genéricos y un 34.0% para avisos demográficos. Eso es una pérdida, y se publica.

Lo que no tenemos es revisión por pares. El resultado de ajuste fino de Simile apareció en EMNLP 2025 con un conjunto de datos abierto de 2.9 millones de respuestas. Artificial Societies tiene un resultado de comportamiento grupal en el British Journal of Psychology. Nosotros no tenemos ninguno. Nuestro trabajo de validación se publica en nuestro propio sitio y no ha pasado por revisión externa, y hasta que lo haga, un lector tiene razón al ponderarlo de manera diferente.

Nuestra asociación con SINUS-Institut a veces se lee como validación. No lo es. Es procedencia: el modelo de entorno en el que se basan nuestras personas proviene de décadas de su investigación, lo cual es una declaración sobre insumos más que sobre precisión. Su director general lo expresa claramente: el Milieu-Minds "no reemplazan ni la investigación social ni la experiencia de nuestro instituto".

Cómo verificar cualquier proveedor en diez minutos

Pide la definición de la métrica, el tamaño de la muestra, la línea de base y las condiciones de fallo. Pregunta qué puntúa la misma medida sin modelo detrás de ella. Si un proveedor no puede producir eso, el porcentaje es marketing, quien lo haya publicado y cuán favorable se vea.

Esa prueba no es cómoda para nosotros tampoco. Simplemente es la única que le dice algo a un comprador.

Fuentes

Todas las cifras anteriores proceden del material público de cada proveedor, consultado el 22 de septiembre de 2026. Las afirmaciones cambian: compruebe la fuente antes de confiar en ella. Si hemos interpretado mal la suya, díganoslo y la corregiremos.

Preguntas frecuentes

¿Qué tan precisas son las audiencias sintéticas?

No hay un solo número. Las cifras publicadas varían del 85% al 98%, pero miden cosas diferentes: la superposición de temas, la coincidencia de distribución, la consistencia de respuestas, las tasas de aprobación de calidad y la correlación de rangos no son intercambiables. Una cifra de precisión solo tiene sentido junto a su métrica, su línea de base y la tarea en la que se midió.

¿Por qué no puedo comparar los porcentajes de precisión de dos proveedores?

Porque los denominadores son diferentes. Un proveedor puede informar la proporción de temas que recupera de informes de expertos, otro la proporción de una distribución de respuestas que coincide, otro la proporción de perfiles generados que pasan un control de calidad interno. Clasificar esos números entre sí produce un orden sin sentido.

¿Qué es un techo humano y por qué importa?

Los humanos no reproducen sus propias respuestas de encuesta perfectamente. Si se les pregunta de nuevo dos semanas después, difieren de sí mismos. Esa tasa de autoconsistencia es el techo realista para cualquier simulación, por lo que informar un resultado como una proporción de ello es más informativo que informar un porcentaje bruto.

¿Qué es un piso de oportunidad?

La puntuación que un enfoque logra sin modelo y sin datos detrás de él. En uno de nuestros conjuntos de ítems GSS, una distribución plana ya puntúa 83.71%. Un 92.47% informado, por lo tanto, cierra el 54% de la distancia entre ese piso y una puntuación perfecta, lo cual es una reclamación muy diferente de '92% preciso'.