CES 2024: ajuste de encuestas en múltiples formatos de preguntas
Una comparación de CES evalúa a 300 encuestados emparejados en 27 preguntas binarias, ordinales y de selección múltiple, separando el ajuste agregado de la predicción individual.
La prueba de CES 2024 alcanzó una aproximación agregada del 95.28% con respuestas de probabilidad basadas en perfiles, equivalente a 4.72 puntos porcentuales de error medio de distribución. En la comparación de formatos de respuesta, la obtención de probabilidades redujo el error en una estimación bootstrap registrada de 19.72 puntos respecto a las respuestas forzadas.
El estudio amplía la evidencia sobre encuestas más allá de un único formato de pregunta. También muestra por qué una puntuación final de aproximación debe acompañarse de líneas base comparables.
El cuestionario evaluado
La comparación utilizó a 300 encuestados emparejados de CES y 27 preguntas reservadas: 15 ordinales, 10 binarias y dos baterías de selección múltiple. La información previa de los encuestados aportó contexto; las respuestas de evaluación se mantuvieron fuera de la generación.
Las cuatro condiciones fueron elección forzada genérica, probabilidades o marginales genéricas, probabilidad demográfica y probabilidad con perfil completo. Las opciones de selección múltiple requieren probabilidades marginales porque un encuestado puede elegir más de una opción. Su interpretación difiere de un vector de probabilidad de opción única.
Las distribuciones medidas
Error absoluto medio por ítem
Resultados comunicados para este estudio. La tabla y el análisis conservan el alcance, las referencias y la incertidumbre.
- Elección forzada genérica26,927
- Probabilidad o marginales genéricas7,036
- Probabilidad demográfica4,563
- Probabilidad con perfil completo4,720
| Condición | Error absoluto medio por ítem |
|---|---|
| Elección forzada genérica | 26.927 pp |
| Probabilidad o marginales genéricas | 7.036 pp |
| Probabilidad demográfica | 4.563 pp |
| Probabilidad con perfil completo | 4.720 pp |
La aproximación es 100 menos el error absoluto medio en puntos porcentuales. La cifra del 95.28% describe, por tanto, el ajuste medio de la distribución en estas preguntas evaluadas. No representa un porcentaje de personas simuladas con precisión.
El incremento de probabilidad bootstrap registrado fue de 19.719 puntos, redondeado a 19.72. El contraste puntual reportado fue de 19.892 puntos, con un intervalo del 95% de 16.257 a 23.401. El resumen bootstrap y las medias de las condiciones mostradas utilizan resúmenes y redondeos distintos; no deben sustituirse de forma encubierta entre sí.
Qué mejoraron y qué no mejoraron los perfiles más ricos
Los perfiles completos mejoraron respecto al prompting probabilístico genérico, pero no superaron a la probabilidad demográfica emparejada en la métrica agregada principal. La mejora del perfil frente a la demográfica fue de -0.157 puntos y su intervalo cruzó el cero.
La precisión individual mejoró con el contexto del perfil, mientras que el error agregado fue ligeramente peor que con los datos demográficos. Por tanto, el resultado es mixto, con un hallazgo sólido sobre el formato de respuesta pero sin una ventaja agregada confirmada de la condición de perfil completo sobre la demográfica.
Solo se dispuso de dos baterías de selección múltiple. Esta es evidencia a partir de un cuestionario mixto, no una validación universal de la calibración de selección múltiple en todos los dominios e instrumentos.
Aplicación de la evidencia
Para las estimaciones de distribución, la recopilación y la agregación de respuestas deben tratarse como partes explícitas del diseño de investigación. Una línea base categórica forzada no puede aislar el valor de los perfiles cuando a la audiencia más rica se le permite devolver probabilidades.
Una comparación también debe declarar si su objetivo es el ajuste poblacional a nivel de ítem o la predicción individual. Más contexto no resulta automáticamente mejor para ambos. La muestra evaluada, la configuración del modelo y el cuestionario definen el límite de las afirmaciones.
Esta prueba en un entorno aislado no garantiza el comportamiento actual del producto ni estimaciones representativas para nuevas audiencias de clientes. La exposición previa al entrenamiento con fuentes públicas sigue siendo posible, incluso con la separación del objetivo en tiempo de ejecución.
El estudio longitudinal de ANES examina la misma distinción entre lo agregado y lo individual. La comparación de PISA añade un entorno de cinco países. El resumen de la evidencia conecta estos resultados sin combinarlos en una sola puntuación.


