·Validation·Minds Team

Alineación con PRISM: evaluación del ajuste al participante en respuestas reservadas

Una comparativa de 869 ítems con 299 personas mide si las Minds fundamentadas reflejan mejor los valores y motivos de los participantes, con un evaluador ciego y límites claros según la tarea.

En una comparativa confirmatoria utilizando el PRISM Alignment Dataset externo, las Minds completas ganaron el 32.6% de las evaluaciones ciegas de ajuste al participante, frente al 25.7% de los prompts demográficos y el 20.5% de los prompts genéricos. Las mayores mejoras se observaron en la expresión de valores, la especificidad y una menor genericidad.

Este dataset PRISM es un benchmark externo. Es independiente del motor propietario de modelado de fuentes PRISM de Minds.

Participantes, objetivos y condiciones

El estudio evaluó a 299 participantes del Reino Unido y 869 ítems por participante y dominio. Tres condiciones generaron 2,607 respuestas puntuadas: Minds completas mediante el flujo de producción, prompts solo demográficos y prompts genéricos.

La selección se realizó a ciegas respecto al resultado y las respuestas reales de los participantes se mantuvieron fuera de la generación. Un único evaluador LLM ciego analizó comparaciones anonimizadas por condición y emparejadas por longitud. Se trata de una evaluación automatizada del ajuste al participante, no de una validación independiente por evaluadores humanos.

Qué prefirió el evaluador

Porcentaje de ítems evaluados

Resultados comunicados para este estudio. La tabla y el análisis conservan el alcance, las referencias y la incertidumbre.

  • Ganador: Minds completas32,5662 %
  • Ganador: prompt demográfico25,6617 %
  • Ganador: prompt genérico20,4833 %
  • Empate21,2888 %
0%100
ResultadoPorcentaje de ítems evaluados
Ganador: Minds completas32.5662%
Ganador: prompt demográfico25.6617%
Ganador: prompt genérico20.4833%
Empate21.2888%

La comparativa global registrada reportó una ventaja para Minds de 12.04 puntos porcentuales sobre el prompting genérico y de 6.69 puntos sobre el prompting demográfico. Estas son las estimaciones de la comparativa registrada; no deben sustituirse por la resta directa de las tasas mostradas de forma agregada.

La tasa de victoria no equivale a una aproximación de encuesta. Significa que el evaluador prefirió esa opción bajo la rúbrica de ajuste al participante, no que se haya reproducido con exactitud la misma proporción de respuestas de las personas. Una proporción sustancial de empates también forma parte del resultado.

El límite de la tarea

Las tareas guiadas por valores y controversias ofrecieron la ventaja más clara. Estas preguntas pueden depender de los motivos del participante y de su punto de vista expresado con anterioridad, lo que hace que una fundamentación más rica resulte directamente relevante.

La ventaja no se extendió a todas las tareas. En prompts breves sobre la vida cotidiana, Minds ganó el 13.8%, frente al 30.5% de los prompts genéricos y el 34.0% de los prompts demográficos. Los prompts no guiados también mostraron un rendimiento más débil. La similitud semántica general no mejoró de forma significativa, y la similitud léxica emparejada por longitud fue inferior a la de ambas líneas de base.

Estos hallazgos hacen que el resultado general sea parcial y no una victoria universal en fidelidad de respuesta. También distinguen el ajuste al participante del simple calco de redacción. Una respuesta puede reflejar los motivos de una persona sin coincidir al detalle con su redacción, y una respuesta cotidiana fluida no necesariamente se beneficia de un mayor nivel de detalle en el perfil.

Qué respalda esto

La afirmación respaldada es más acotada y útil: las Minds fundamentadas mejoraron el ajuste al participante evaluado en la cohorte analizada a nivel general, en especial en valores y especificidad. Los evaluadores humanos independientes y los dominios adicionales siguen siendo indispensables para formular afirmaciones de fidelidad más sólidas.

La confirmación con entrevistas reservadas examina la evidencia previa y las respuestas posteriores en otros dos corpus. La comparación con modelos fundacionales analiza cómo se compara este flujo de trabajo fundamentado con las respuestas de modelos genéricos. La visión general de la evidencia separa estas métricas cualitativas de la aproximación de encuestas.

Datos de referencia

PRISM Alignment Dataset