---
title: "El condicionamiento por personalidad hace más distintivos a los encuestados sintéticos"
description: "En un benchmark ciego con 299 perfiles británicos y 869 objetivos reservados, los Minds condicionados por personalidad fueron elegidos más que el prompting genérico o demográfico."
canonical_url: "https://getminds.ai/research/es/personality-conditioned-synthetic-respondents-benchmark-2026"
last_updated: "2026-08-13T13:08:04.196Z"
---

# El condicionamiento por personalidad hace más distintivos a los encuestados sintéticos

Los Minds condicionados por personalidad fueron elegidos en el **32.57%** de las comparaciones ciegas con longitud igualada, por delante del prompting demográfico (**25.66%**) y genérico (**20.48%**); el **21.29%** fueron empates.

La ventaja más clara no fue solo sonar humano, sino sonar como una persona **concreta**: expresar valores, aportar detalles relevantes y diferenciar mejor a unas personas de otras. Esa es la cualidad que necesita la investigación sintética cuando quiere explorar cómo distintos miembros de una audiencia pueden enfocar la misma pregunta.

<study-stats>



</study-stats>

## Por qué importa la personalidad

Los modelos genéricos producen respuestas plausibles. La investigación de mercados suele necesitar algo más exigente: respuestas que reflejen diferencias significativas en prioridades, preferencias y visión del mundo.

Este benchmark pregunta si un Mind completo—basado en demografía y evidencia de personalidad autodeclarada y permitida—puede reproducir mejor una expresión cualitativa reservada que el mismo modelo sin contexto o solo con datos demográficos.

El objetivo era una apertura de conversación escrita por el participante, no una distribución de encuesta ni una opinión objetivamente “verdadera”. Por tanto, medimos ajuste cualitativo al perfil.

## Benchmark ciego de tres brazos

Utilizamos **299 perfiles británicos** del [PRISM Alignment Dataset](https://github.com/HannahKirk/prism-alignment), fijado en la revisión `a9ec82149036374768f70e132a2369a750e06bbe`. El conjunto puntuado contenía **869 objetivos reservados observados**.

<table>
<thead>
  <tr>
    <th>
      Brazo
    </th>
    
    <th>
      Contexto del participante
    </th>
    
    <th>
      Ejecución
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Genérico
    </td>
    
    <td>
      Sin contexto
    </td>
    
    <td>
      Gemini 3.6 Flash directo
    </td>
  </tr>
  
  <tr>
    <td>
      Demográfico
    </td>
    
    <td>
      Edad, género, país, empleo y educación
    </td>
    
    <td>
      Gemini 3.6 Flash directo
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      Demografía más valores, preferencias, comportamiento esperado del asistente y prompts de entrenamiento permitidos
    </td>
    
    <td>
      API Panels de producción con persona, RAG y grounding web; Gemini 3.6 Flash
    </td>
  </tr>
</tbody>
</table>

Los objetivos y sus derivados estaban prohibidos en el contexto de generación. Un único juez ciego Gemini 3.6 Flash vio la evidencia del perfil, la referencia humana reservada y tres candidatos anónimos.

Para que la verbosidad no decidiera el resultado, cada candidato se truncó al número de palabras de la referencia humana antes del juicio. Los 869 objetivos recibieron una evaluación completa de tres brazos.

## Minds fue elegido con mayor frecuencia

<table>
<thead>
  <tr>
    <th>
      Resultado
    </th>
    
    <th align="right">
      Genérico
    </th>
    
    <th align="right">
      Demográfico
    </th>
    
    <th align="right">
      Minds
    </th>
    
    <th align="right">
      Empate
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Victorias
    </td>
    
    <td align="right">
      178
    </td>
    
    <td align="right">
      223
    </td>
    
    <td align="right">
      <strong>
        283
      </strong>
    </td>
    
    <td align="right">
      185
    </td>
  </tr>
  
  <tr>
    <td>
      Proporción de 869 ítems
    </td>
    
    <td align="right">
      20.48%
    </td>
    
    <td align="right">
      25.66%
    </td>
    
    <td align="right">
      <strong>
        32.57%
      </strong>
    </td>
    
    <td align="right">
      21.29%
    </td>
  </tr>
  
  <tr>
    <td>
      Compuesto de fidelidad, 0–100
    </td>
    
    <td align="right">
      27.23
    </td>
    
    <td align="right">
      27.68
    </td>
    
    <td align="right">
      <strong>
        32.38
      </strong>
    </td>
    
    <td align="right">
      —
    </td>
  </tr>
</tbody>
</table>

La ventaja de Minds fue de **+12.04 puntos porcentuales** sobre el prompting genérico (IC 95% +7.13 a +17.00; `p < .001` ajustado por FDR) y de **+6.69 puntos** sobre el demográfico (IC 95% +1.56 a +11.93; `p = .020` ajustado por FDR).

## La señal más fuerte: valores y especificidad

<table>
<thead>
  <tr>
    <th>
      Contexto
    </th>
    
    <th align="right">
      Genérico
    </th>
    
    <th align="right">
      Demográfico
    </th>
    
    <th align="right">
      Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Guiado por valores
    </td>
    
    <td align="right">
      19.30%
    </td>
    
    <td align="right">
      11.58%
    </td>
    
    <td align="right">
      <strong>
        42.81%
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Guiado por controversia
    </td>
    
    <td align="right">
      18.88%
    </td>
    
    <td align="right">
      34.97%
    </td>
    
    <td align="right">
      <strong>
        38.81%
      </strong>
    </td>
  </tr>
</tbody>
</table>

Minds alcanzó **36.88** en valores/personalidad y **33.46** en especificidad, frente a 30.85 y 21.70 en genérico, y 31.85 y 23.36 en demográfico. Su puntuación de genericidad también fue menor—**63.63**, donde menos es mejor—que la genérica (**73.53**) o demográfica (**72.58**).

Las respuestas también se diferenciaron más entre personas. La similitud TF–IDF media fue 0.0308 para Minds, 0.0516 para demográfico y 0.1108 para genérico. Las referencias humanas fueron aún más diversas, con 0.0128, pero la personalidad acercó sustancialmente el modelo a ese patrón.

## Una señal útil por cohortes

Las mejoras más consistentes aparecieron en cohortes de mayor edad. El grupo de 55–64 superó a ambos baselines en tasa de victoria y compuesto tras la corrección. El grupo de 65+ superó claramente al prompting genérico, y el de 45–54 mejoró frente al demográfico en el compuesto.

Estos resultados de subgrupos son exploratorios, pero sugieren que unas preferencias y valores más ricos pueden aportar más señal útil al condicionamiento por personalidad.

## Respuestas más ricas, comparadas con justicia

Las respuestas completas de Minds promediaron **51.62 palabras**, frente a **7.86** en genérico y **7.51** en demográfico. La regla de longitud igualada garantizó que el detalle adicional no ganara simplemente por ocupar más espacio.

En términos prácticos, Minds puede producir material más rico para exploración cualitativa. El siguiente paso del producto es adaptar la profundidad de respuesta a la tarea. Los artefactos no contienen uso de tokens end-to-end comparable para todos los brazos, por lo que no permiten calcular una ratio monetaria.

## Cómo interpretar la evidencia

- **Un juez por ítem (n=1).** Hubo un juicio ciego de Gemini 3.6 Flash y ninguna calibración humana.
- **Una familia de modelos.** Tanto los brazos como el juez usaron finalmente Gemini 3.6 Flash.
- **Un objetivo cualitativo.** Se mide ajuste a texto humano reservado, no prevalencia poblacional ni comportamiento de compra.
- **Un sistema end-to-end.** Personalidad, retrieval, grounding y formato se evaluaron conjuntamente.

La deduplicación semántica **no se aisló en una ablación**. El benchmark no establece si ayudó o perjudicó el resultado y no justifica eliminarla.

Ahora utilizamos estos 869 ítems para orientar el desarrollo. Cualquier afirmación futura de lanzamiento requerirá un nuevo holdout intacto, idealmente con jueces repetidos o calibración humana.

## Qué probaremos después

La siguiente ablación comparará 1. el comportamiento actual de producción, 2. respuestas limitadas a una longitud humana y 3. longitud humana más routing adaptativo que aplique profundidad de personalidad donde aporte más valor.

## Qué significa para la investigación sintética

El hallazgo práctico es claro: **el condicionamiento por personalidad produjo encuestados cualitativos más distintivos que el prompting genérico o demográfico por sí solo** en este benchmark ciego.

Esto hace que Minds sea especialmente útil para generar y someter a presión hipótesis de audiencia, explorar distintos marcos de valores y revelar el lenguaje que podrían utilizar personas diferentes. Complementa la evidencia humana y ofrece a los equipos un punto de partida más diferenciado que una respuesta genérica.

## Cita sugerida

Minds Research Lab. «El condicionamiento por personalidad hace más distintivos a los encuestados sintéticos». 8 de agosto de 2026. [https://getminds.ai/research/es/personality-conditioned-synthetic-respondents-benchmark-2026](https://getminds.ai/research/es/personality-conditioned-synthetic-respondents-benchmark-2026)
