GSS 2024: preservar la incertidumbre mejora el ajuste de las encuestas
Un piloto del GSS con objetivos separados compara cuatro condiciones de respuesta en 360 personas y 17 preguntas, distinguiendo la obtención de probabilidades del valor del perfil.
El piloto de GSS 2024 alcanzó una aproximación agregada del 92.47% con respuestas de probabilidad basadas en perfiles estructurados. Su error medio de distribución fue de 7.53 puntos porcentuales en 17 preguntas y 360 encuestados emparejados. El hallazgo clave no fue simplemente una puntuación final alta: recopilar probabilidades mejoró sustancialmente el ajuste de la distribución frente a solicitar una única respuesta forzada.
Qué se comparó
La evaluación utilizó respuestas reales sobre actitudes y comportamientos del GSS como objetivos de prueba retenidos (held-out targets). Cuatro condiciones diferenciaron el formato de respuesta del contexto proporcionado al modelo: elección forzada genérica, probabilidad genérica, probabilidad demográfica y probabilidad con perfil estructurado. Las respuestas candidatas quedaron selladas antes de abrir los objetivos de evaluación.
El perfil contenía evidencia estructurada de la encuesta, no la representación completa de un Mind en producción. El experimento se ejecutó en un entorno de pruebas aislado. Su resultado respalda el método de respuesta evaluado, no una precisión idéntica para cada audiencia en producción.
Resultados en las cuatro condiciones
Error absoluto medio por ítem
Resultados comunicados para este estudio. La tabla y el análisis conservan el alcance, las referencias y la incertidumbre.
- Elección forzada genérica25,74
- Probabilidad genérica8,44
- Probabilidad demográfica7,67
- Probabilidad con perfil estructurado7,53
| Condición | Error absoluto medio por ítem |
|---|---|
| Elección forzada genérica | 25.74 pp |
| Probabilidad genérica | 8.44 pp |
| Probabilidad demográfica | 7.67 pp |
| Probabilidad con perfil estructurado | 7.53 pp |
La aproximación equivale a 100 menos el error medio absoluto en puntos porcentuales. El 92.47% resultante resume el ajuste de la distribución de respuestas, no el porcentaje de encuestados individuales cuyas elecciones se predijeron correctamente. La cantidad de opciones de respuesta y el método de agregación influyen en esta métrica.
La estimación registrada mediante remuestreo para la probabilidad genérica frente a la elección forzada mostró una reducción del error de 16.51 puntos. Esta es la estimación por bootstrap reportada, no una resta directa de los valores descriptivos redondeados de la tabla. Aísla la comparación entre formatos de respuesta; no debe describirse como un resultado de superioridad del perfil ni del modelo fundacional.
Qué aporta la comparación de perfiles
Los perfiles estructurados mostraron una pequeña ventaja descriptiva frente a la probabilidad demográfica. El incremento registrado por el perfil fue de 0.17 puntos, con un intervalo del 95% de -1.00 a +1.31. El intervalo cruzó el cero y la condición con perfil no cumplió su criterio de validación para paso a producción. En consecuencia, el estudio presenta un resultado global mixto, aun cuando la obtención de probabilidades aportó un hallazgo positivo de gran utilidad.
La distinción práctica es importante. Un mejor ajuste de la distribución derivado de recopilar probabilidades no demuestra por sí solo que añadir detalles biográficos ayude. Una comparación de fundamentación justa mantiene constante el formato de respuesta.
Conclusiones para los equipos
Cuando el objetivo es una distribución de respuestas a una encuesta, preservar la incertidumbre puede aportar más información que reducir cada encuestado sintético a una única respuesta categórica. La evaluación debe conservar tanto una línea base de probabilidad genérica emparejada como una línea base demográfica, de modo que la contribución incremental de un contexto más rico permanezca visible.
Este estudio no establece una estimación representativa para una audiencia de clientes arbitraria, una predicción individual exacta ni una garantía de error frente a cuestionarios nuevos. Ocultar los objetivos en tiempo de ejecución tampoco permite demostrar que los datos públicos no hayan formado parte del preentrenamiento del modelo.
El resumen de evidencia sitúa al GSS junto a otras cuatro comparaciones de encuestas. El seguimiento de ANES evalúa respuestas posteriores utilizando evidencia previa de los encuestados. La comparación de Gen Z en producción evalúa una cohorte independiente de Minds persistentes.


