·Validation·Minds Team

ANES 2024: comparación entre respuestas sintéticas y respuestas humanas posteriores

Una comparación pre y poselectoral de ANES evalúa a 300 personas emparejadas en 28 respuestas posteriores, con resultados diferenciados por formato de respuesta y fundamentación de participantes.

La comparación de ANES 2024 alcanzó una aproximación agregada del 91.67%, o 8.33 puntos porcentuales de error medio de distribución, mediante respuestas probabilísticas basadas en perfiles recuperados. Su mejora medida más clara provino de la obtención de probabilidades: las respuestas probabilísticas genéricas redujeron el error en 12.47 puntos en comparación con la elección forzada genérica.

A diferencia de una comparación que reconstruye respuestas ya suministradas a un modelo, este diseño utilizó evidencia previa de los encuestados antes de las elecciones y evaluó respuestas posteriores reservadas obtenidas tras las elecciones.

La prueba longitudinal

La muestra contó con 300 encuestados emparejados y 28 ítems posteriores. Los objetivos humanos se mantuvieron al margen de la generación en tiempo de ejecución y los candidatos quedaron sellados antes de la evaluación. Las condiciones separaron respuesta forzada genérica, probabilidades genéricas, probabilidades demográficas y probabilidades fundamentadas en evidencia de perfiles recuperados.

La evidencia previa puede aportar contexto sobre un encuestado, pero no equivale a conocer su respuesta posterior. Esta separación temporal convierte el ejercicio en una prueba útil para comprobar si la información previa se traslada a un cuestionario posterior.

Resultados de distribución

Error absoluto medio por ítem

Resultados comunicados para este estudio. La tabla y el análisis conservan el alcance, las referencias y la incertidumbre.

  • Elección forzada genérica22,782
  • Probabilidad genérica10,312
  • Probabilidad demográfica8,263
  • Probabilidad con perfil recuperado8,330
0Puntos porcentuales · menor es mejor30
CondiciónError absoluto medio por ítem
Elección forzada genérica22.782 pp
Probabilidad genérica10.312 pp
Probabilidad demográfica8.263 pp
Probabilidad con perfil recuperado8.330 pp

La transformación final de la aproximación es 100 menos 8.33, lo que resulta en un 91.67%. Describe el error de distribución promedio por celda de respuesta, no la precisión predictiva individual ni un pronóstico de resultados electorales.

En la comparación entre probabilidad genérica y elección forzada genérica, la mejora registrada fue de 12.47 puntos porcentuales. Ningún ítem evaluado retrocedió más de dos puntos en ese contraste. Por tanto, el resultado del formato de respuesta fue consistente más allá de un ítem aislado.

Fundamentación y agregación son cuestiones distintas

Los perfiles recuperados no mejoraron el error absoluto medio agregado respecto a los prompts de probabilidad demográfica. La diferencia registrada fue de +0.046 puntos de error, con un intervalo que cruza el cero. La tabla descriptiva muestra igualmente que la probabilidad demográfica se situó ligeramente por delante.

Los perfiles mejoraron modestamente la puntuación de Brier individual y la precisión exacta, empeorando ligeramente la calibración poblacional. Estos resultados pueden coexistir: predecir la respuesta de una persona y reconstruir la distribución de una audiencia son objetivos distintos. Seleccionar solo la métrica favorable tergiversaría el estudio.

El resultado global del experimento es mixto. Respalda la obtención de probabilidades, pero deja sin confirmar el beneficio agregado incremental de los perfiles.

Implicaciones y limitaciones

Los equipos deben definir su objetivo de evaluación antes de comparar audiencias sintéticas. Una tarea de respuesta individual exige métricas individuales; una tarea de distribución de audiencia requiere calibración agregada. Un buen resultado en una no puede sustituir a la otra.

Este fue un entorno de pruebas aislado que utilizó evidencia estructurada previa a las elecciones, no la ruta completa de producción de Mind entrenada. La muestra evaluada y las preguntas posteriores no establecen una validez general para cualquier audiencia política o instrumento de encuesta. La exclusión en tiempo de ejecución no descarta una exposición previa a datos públicos durante el entrenamiento del modelo.

El piloto de GSS ofrece otra comparación de formatos de respuesta. El estudio de CES amplía el instrumento a diversas modalidades de preguntas. El resumen de evidencia mantiene sus puntuaciones y alcances por separado.

Datos de referencia

ANES 2024