Probamos audiencias sintéticas frente a la realidad
Lo que cinco conjuntos de datos de encuestas públicas revelan sobre la precisión de las audiencias sintéticas, incluido un test de producción de 301 Minds de la Gen Z, y dónde ayuda el anclaje en perfiles.
La investigación sintética necesita una referencia externa: respuestas de personas reales. Nuestra serie original de investigación comparó respuestas sintéticas con cuatro conjuntos de datos de encuestas públicas y dos puntos de referencia cualitativos. Una prueba de producción posterior con Food and You añadió una comprobación práctica sobre la misma pregunta: ¿con qué nivel de aproximación puede una audiencia de Minds persistentes reproducir las distribuciones de respuesta de una encuesta real?
Los resultados apuntan a dos fuentes de valor distintas. Conservar la incertidumbre mejora las estimaciones de distribución en encuestas. Los perfiles de participantes y las memorias relevantes aportan valor adicional cuando una respuesta depende de las experiencias, los motivos y los valores de una persona. Sus ventajas varían según la tarea.
Réplicas de encuestas seleccionadas
Mean distribution error
Cuestionarios y cohortes diferentes; PISA utiliza ponderación. Menor error es mejor. No agrupar los resultados en una sola puntuación de precisión.
- GSS 20247,53
- ANES 20248,33
- CES 20244,72
- PISA 20226,20
- Food and You 2, Wave 106,01
| Estudio replicado | Dataset público de origen | Resultado |
|---|---|---|
| Réplica de la encuesta GSS 2024 | GSS 2024 | 92.47% de aproximación · 7.53 pp de error medio |
| Réplica longitudinal de ANES 2024 | ANES 2024 Time Series Study | 91.67% de aproximación · 8.33 pp de error medio |
| Réplica pre/post de CES 2024 | 2024 Canadian Election Study | 95.28% de aproximación · 4.72 pp de error medio |
| Réplica internacional de PISA 2022 | PISA 2022 Database | 93.80% de aproximación · 6.20 pp de error medio ponderado |
| Réplica de producción de Food and You 2 | Food and You 2, Wave 10 | 93.99% de aproximación · 6.01 pp de error medio · Pearson 0.804 · Spearman 0.834 |
La aproximación agregada equivale a 100 menos el error porcentual absoluto medio. Mide la brecha entre distribuciones de respuesta. No significa que se haya predicho correctamente el mismo porcentaje de individuos. Los estudios utilizan diferentes instrumentos y detalles de agregación, incluido un resultado ponderado de PISA; las filas no deben promediarse en una sola puntuación de precisión.
Las primeras cuatro filas corresponden a los experimentos de encuestas aisladas originales. La quinta es una ejecución de producto posterior sobre una cohorte cerrada existente. Su inclusión amplía el panorama empírico sin transformar una repetición sobre esa cohorte en un nuevo estudio poblacional independiente.
Gen Z: un cuestionario real a través del producto
La encuesta Food and You 2 de la Food Standards Agency del Reino Unido preguntó con qué frecuencia los jóvenes comen fuera o compran comida para llevar en el desayuno, el almuerzo y la cena. La comparación de producción formuló las mismas tres preguntas a 301 Minds persistentes de entre 16 y 24 años y comparó las distribuciones resultantes con los resultados publicados sobre jóvenes. La base humana de respuestas fue de 257 para cada ítem evaluado.
Se completaron las 903 respuestas planificadas. En las 21 celdas de opciones de respuesta, el error absoluto medio fue de 6.01 puntos porcentuales y la superposición media de distribuciones fue del 78.98%. Estos valores describen propiedades distintas: la transformación de aproximación resume el error promedio por celda, mientras que la superposición muestra cuánta masa de probabilidad comparten las distribuciones.
La ejecución del 18 de agosto mejoró el resultado del 9 de agosto utilizando la misma cohorte y el mismo instrumento: el error se redujo de 7.33 a 6.01 puntos, una reducción relativa del 18.0%. Cada pregunta mejoró. La comparación fue una prueba de regresión de producto con un control histórico, en lugar de una comparación aleatorizada concurrente.
El contexto de las líneas base importa. Un prompt probabilístico genérico congelado registró un error de 6.68 puntos y un modelo nulo de equiprobabilidad registró 7.00 puntos en las mismas celdas. El resultado de producción fue mejor descriptivamente, pero esas líneas base no se volvieron a ejecutar contemporáneamente. Por lo tanto, una puntuación superior a 90 en la escala de aproximación no debe interpretarse por sí sola como una gran ventaja.
El artículo completo de la encuesta de alimentación a la Gen Z describe la audiencia, el cuestionario, la procedencia y los resultados por pregunta. La Food Standards Agency proporcionó el conjunto de datos de referencia público; no patrocinó, respaldó ni revisó este estudio de Minds.
Por qué la incertidumbre mejoró las estimaciones de encuestas
En los cuatro experimentos de encuesta originales, las respuestas probabilísticas redujeron el error de distribución entre 12.47 y 19.72 puntos porcentuales en comparación con forzar una única respuesta. La mejora se observó en los cuatro conjuntos de datos.
Una respuesta probabilística retiene una incertidumbre que una elección categórica descarta. Cuando se agregan a lo largo de una audiencia, estas probabilidades pueden recuperar una distribución poblacional con mayor fidelidad que una sola elección forzada de cada encuestado sintético.
Ese resultado tiene que ver con la recopilación y agregación de respuestas. Los mismos experimentos no demostraron que los perfiles detallados superen de manera constante a los prompts probabilísticos demográficos. La línea base de comparación y el formato de respuesta influyen tanto como la puntuación final.
Otras validaciones seleccionadas
Estos estudios utilizan variables de resultado distintas, por lo que un porcentaje de aproximación resultaría engañoso. Complementan las evidencias de las encuestas en lugar de ampliar su rango de precisión.
| Study and detailed results | Evaluated sample | Reported result | Approximation |
|---|---|---|---|
| PRISM Alignment | 299 participantes, 869 ítems | 32.6% de tasa ganadora por ajuste al participante; 25.7% demográfico y 20.5% genérico | No aplicable |
| Held-out interviews | 22 personas, 66 respuestas, dos corpus | +24.37 puntos compuestos frente a la estimación genérica agrupada por participante | No aplicable |
| Named foundation models | Mismas 22 personas y 66 respuestas, no una cohorte nueva | +25.49 puntos frente a GPT-5.4; +30.05 frente a Claude Sonnet 5 | No aplicable |
| Spark creative diversity | Siete tareas creativas | Diversidad media de 7.90/10 frente a 3.14/10 de la línea base uniforme | No aplicable |
Spark evalúa la diversidad de ideas, no la concordancia con una encuesta representativa ni la predicción del rendimiento publicitario real. Las comparaciones de entrevistas utilizan jueces automáticos, no un porcentaje de personas simuladas correctamente.
Dónde ayudó el contexto de los participantes
Las pruebas cualitativas originales evaluaron respuestas humanas posteriores retenidas durante la generación. En la comparación PRISM Alignment, los Minds completos alcanzaron una tasa ganadora a ciegas del 32.6%, frente al 25.7% de los prompts demográficos y el 20.5% de los prompts genéricos. Este conjunto de datos PRISM es un punto de referencia externo, distinto del propio enfoque PRISM de Minds.
La confirmación independiente mediante entrevistas utilizó dos corpus públicos, 22 personas y 66 respuestas posteriores. Su informe encontró una ventaja positiva de la combinación de perfil y recuperación frente a la generación genérica con prompts en ambos corpus y bajo una segunda versión de juez. Una comparación con modelos comerciales específicos explora esa ventaja frente a respuestas genéricas de GPT y Claude. Esas líneas base no recibieron el historial del participante.
Estos experimentos abordan el ajuste al participante, los motivos, la especificidad y la voz. Las puntuaciones de sus jueces no deben combinarse con porcentajes de distribución de encuestas. Ambas dependen de la evidencia que recibe el encuestado sintético, y las evaluaciones cualitativas aún requieren confirmación independiente por parte de evaluadores humanos.
Hasta dónde se extienden las evidencias
La serie original abarcó 1,881 participantes entre sus encuestas y puntos de referencia cualitativos. La ejecución alimentaria adicional de 301 Minds tiene su propia cohorte y su propio denominador humano de referencia; ambos deben mantenerse separados.
Los objetivos se retuvieron de las entradas en tiempo de ejecución en las pruebas reportadas. Los datos de fuentes públicas aún podrían haber aparecido durante el preentrenamiento del modelo, por lo que la separación en tiempo de ejecución no garantiza la ausencia total de exposición previa. Los resultados de las encuestas originales también provinieron de entornos aislados; no establecen un comportamiento idéntico en todas las versiones del producto. PISA utilizó el redactado maestro en inglés en sus cinco países.
Este resumen presenta la evidencia validada cubierta aquí, no un censo de cada experimento realizado por Minds. Otras pruebas exploratorias o fallidas requieren su propio contexto. El uso práctico de estos hallazgos es elegir la audiencia adecuada, el formato de respuesta idóneo y el método de validación pertinente para cada pregunta específica.
Consulte cómo se construyen los paneles de investigación de Minds para conocer el flujo de trabajo, y use la lista de verificación para validación al decidir qué conclusiones puede respaldar un resultado sintético.


