---
title: "Minds frente a GPT-5.4 y Claude Sonnet 5 en respuestas a entrevistas reales"
description: "Un benchmark cualitativo a ciegas que compara Minds basados en evidencia con GPT-5.4 y Claude Sonnet 5 genéricos en respuestas reservadas de entrevistas humanas."
canonical_url: "https://getminds.ai/research/es/minds-vs-foundation-models-qualitative-2026"
last_updated: "2026-08-13T13:07:52.229Z"
---

# Minds frente a GPT-5.4 y Claude Sonnet 5 en respuestas a entrevistas reales

Lo que hace útil a un encuestado sintético no es si puede generar una cita verosímil, sino si puede mantener la perspectiva de una persona real al formularle una nueva pregunta.

Minds Research Lab evaluó esto directamente. Utilizamos 66 respuestas posteriores reservadas de 22 entrevistados reales en dos conjuntos de datos cualitativos públicos e independientes. Se compararon los Minds basados en evidencia con GPT-5.4 genérico, Claude Sonnet 5 y una respuesta genérica del mismo modelo.

Minds superó a GPT-5.4 por **25.49 puntos compuestos** y a Claude Sonnet 5 por **30.05 puntos**. Un segundo evaluador a ciegas reprodujo ambos resultados.

<study-stats>



</study-stats>

## El benchmark

El estudio utilizó dos corpus de entrevistas publicados de forma independiente y con licencia abierta:

- [Entrevistas desidentificadas sobre la inseguridad alimentaria de los refugiados](https://doi.org/10.6084/m9.figshare.29318549.v1), publicadas por investigadores de la Universidad de Utah.
- [Transcripciones de entrevistas internacionales sobre odontología láser](https://doi.org/10.6084/m9.figshare.28456946.v1), publicadas por investigadores de la Universidad de Khon Kaen.

Para cada participante, el material previo podía informar al encuestado sintético, mientras que las respuestas posteriores se reservaron para la evaluación. Los modelos recibieron la misma pregunta de entrevista y la misma instrucción sobre el formato de respuesta. Los modelos fundacionales genéricos no recibieron ninguna memoria ni perfil del participante.

Todos los candidatos se generaron antes de utilizar las respuestas reservadas para la puntuación. Las etiquetas de los candidatos se aleatorizaron para que el evaluador no pudiera ver qué modelo produjo cada respuesta.

## Resultados

<table>
<thead>
  <tr>
    <th>
      Candidato
    </th>
    
    <th align="right">
      Puntuación compuesta
    </th>
    
    <th align="right">
      Tasa de ganadores
    </th>
    
    <th align="right">
      Diferencia con Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds
      </strong>
    </td>
    
    <td align="right">
      <strong>
        67.66
      </strong>
    </td>
    
    <td align="right">
      <strong>
        72.7%
      </strong>
    </td>
    
    <td align="right">
      -
    </td>
  </tr>
  
  <tr>
    <td>
      GPT-5.4
    </td>
    
    <td align="right">
      42.17
    </td>
    
    <td align="right">
      16.7%
    </td>
    
    <td align="right">
      <strong>
        Minds +25.49
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Claude Sonnet 5
    </td>
    
    <td align="right">
      37.61
    </td>
    
    <td align="right">
      0.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +30.05
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Respuesta genérica del mismo modelo
    </td>
    
    <td align="right">
      35.24
    </td>
    
    <td align="right">
      3.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +32.42
      </strong>
    </td>
  </tr>
</tbody>
</table>

El intervalo del 95% agrupado por participante fue de **+15.99 a +34.56** frente a GPT-5.4 y de **+21.86 a +38.12** frente a Claude Sonnet 5. Ambos corpus de entrevistas fueron positivos de manera independiente.

Una segunda versión de evaluación reprodujo incrementos de **+26.13** y **+30.68** puntos. Los dos jueces coincidieron en el candidato ganador en el 81.8% de las respuestas individuales.

## Dónde obtuvo ventaja Minds

La rúbrica midió más que la fluidez superficial. Comparó cada candidato con la respuesta posterior real de la persona en las siguientes dimensiones:

- Alineación semántica
- Punto de vista y valores
- Temas y motivos
- Especificidad
- Voz y estilo
- Ajuste de longitud
- Carácter genérico
- Datos personales no sustentados

Las mayores ventajas de Minds se dieron en alineación semántica, punto de vista, motivos, especificidad y una voz reconocible. En otras palabras, Minds no solo sonaba más pulido, sino que tenía mayor probabilidad de preservar lo que le importaba a esa persona, cómo lo explicaba y qué detalles utilizaba de forma natural.

La ventaja no fue un artefacto derivado de la longitud. Las respuestas candidatas promediaron aproximadamente entre 52 y 60 palabras en todas las condiciones.

## Por qué esto difiere de pedirle a ChatGPT que actúe como un persona

Un modelo genérico es excepcionalmente capaz, pero la pregunta por sí sola no contiene el historial de la persona. Debe generar una respuesta que sea verosímil para alguien en abstracto.

Un Mind está diseñado para mantener un participante de investigación persistente. Puede transmitir conocimientos aprobados, contexto de investigación previo y un punto de vista diferenciado a lo largo de nuevas preguntas. Esto permite que un modelo más pequeño o de menor costo supere a un modelo genérico mucho más grande cuando la tarea depende de conocer a la persona en lugar de conocer el mundo.

Esta es la tesis central de Minds de forma medible: **la profundidad de la personalidad y la memoria relevante pueden importar más que la escala bruta del modelo fundacional.**

## Validación cualitativa adicional

El mismo programa de investigación más amplio también evaluó:

- [PRISM](https://arxiv.org/abs/2404.16019), utilizando 299 participantes no modificados y 869 respuestas humanas elegibles sobre valores, temas controvertidos y consignas no guiadas.
- La [colección de Historias Orales de la NASA](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/), utilizando respuestas posteriores para evaluar la continuidad en entrevistas profesionales extensas.
- Un grupo de reserva independiente de 21 personas de la cohorte lingüística del corpus de entrevistas de refugiados.

En PRISM, los perfiles completos de Minds puntuaron aproximadamente **de 10 a 12 puntos por encima** del prompting genérico y demográfico. En el grupo de reserva independiente de la cohorte lingüística, la condición de Mind mejoró en **20.77 puntos** con respecto a las respuestas genéricas en general.

## Qué significa esto para la investigación de clientes

Los modelos fundacionales genéricos son útiles para generar ideas sobre reacciones verosímiles. Minds está diseñado para un estándar diferente: mantener participantes diferenciados a lo largo de un estudio.

Esto hace que Minds sea especialmente relevante para entrevistas exploratorias, reacciones a conceptos, pruebas de mensajes, descubrimiento de objeciones, investigación de comités de compra, seguimientos basados en personas y la transformación de un archivo de investigación existente en una audiencia interactiva.

El resultado del modelo citado abarca las fuentes de entrevistas y las versiones de modelos probadas. Minds Research Lab continúa ampliando el benchmark en diferentes dominios, idiomas y tipos de preguntas, manteniendo la comparación principal anclada en respuestas humanas reales.

Para conocer la evidencia cuantitativa, lea [Real Survey Benchmarks](/research/survey-approximation-benchmarks-2026). Para ver el programa completo, lea [Minds Research Benchmark 2026](/research/real-world-validation-benchmarks-2026).

## Fuentes públicas del benchmark

- [Transcripciones de entrevistas a refugiados de Utah](https://doi.org/10.6084/m9.figshare.29318549.v1)
- [Transcripciones internacionales sobre odontología láser](https://doi.org/10.6084/m9.figshare.28456946.v1)
- [Conjunto de datos de alineación PRISM](https://arxiv.org/abs/2404.16019)
- [Historias Orales de la NASA](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)

## Cita sugerida

Minds Research Lab. “Minds vs GPT-5.4 and Claude Sonnet 5 on Real Interview Answers.” August 11, 2026. [https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026](https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026)
