·Methodology·Minds Team

Wie man Ansprüche zur Genauigkeit synthetischer Zielgruppen liest

Neun Anbieter synthetischer Zielgruppen veröffentlichen Genauigkeitszahlen. Sie verwenden unterschiedliche Metriken, unterschiedliche Baselines und unterschiedliche Stichproben, sodass die Zahlen nicht miteinander verglichen werden können. Acht Fragen trennen einen überprüfbaren Anspruch von einem nicht falsifizierbaren.

Synthetische Forschungsanbieter veröffentlichen Genauigkeitszahlen zwischen 85 % und 98 %. Auf den ersten Blick scheint das Feld geklärt und die Unterschiede erscheinen gering.

Sie sind nicht vergleichbar. Die Prozentsätze messen unterschiedliche Größen gegenüber unterschiedlichen Baselines bei unterschiedlichen Aufgaben, und mehrere messen überhaupt keine Genauigkeit. Dieser Artikel legt dar, was wir beim Lesen des veröffentlichten Materials von neun Anbietern im September 2026, einschließlich unseres eigenen, herausgefunden haben, und die acht Fragen, die einen überprüfbaren Anspruch von einem nicht überprüfbaren trennen.

Wir haben hier ein Interesse. Minds verkauft synthetische Zielgruppen. Daher wird der untenstehende Standard unter denselben Bedingungen auf uns angewendet, und der Bereich, in dem wir am schlechtesten abschneiden, wird so klar wie der aller anderen angegeben.

Die acht Fragen

Ein veröffentlichter Genauigkeitsanspruch ist überprüfbar, wenn er diese Fragen beantwortet:

  1. Gegen welchen externen Standard? Ein benanntes, unabhängiges Datenset oder eine veröffentlichte Studie, nicht eine interne Stichprobe.
  2. Gegen welche Obergrenze? Menschen reproduzieren ihre eigenen Antworten nicht perfekt. Ihre Selbstkonsistenz ist das realistische Maximum.
  3. Gegen welche Untergrenze? Was die gleiche Metrik ohne Modell dahinter erzielt.
  4. Was bedeutet die Metrik? "Genauigkeit" definiert sich nicht von selbst.
  5. Verglichen mit welcher Basislinie? Ein naiver Hinweis an dasselbe Modell ist der Vergleich, der zählt, denn das ist die kostenlose Alternative.
  6. Von wem überprüft? Peer-Review oder ein Preprint lädt zur Korrektur ein.
  7. Wo versagt es? Eine Methode ohne veröffentlichten Fehlerzustand wurde nicht hart genug getestet, um einen zu finden.
  8. Kann es jeder überprüfen? Methode, Stichprobe und Daten sind zur Einsicht verfügbar.

Was das Feld veröffentlicht

Zusammengetragen aus den eigenen öffentlichen Seiten und Arbeiten der Anbieter, September 2026.

AnbieterHauptzahlWas es misst
Simile85 % der menschlichen SelbsttestzuverlässigkeitReproduktion der Antworten von Quellindividuen, gegen die menschliche Rauschuntergrenze
Artificial Societies86 % VerteilungsgenauigkeitVerteilungsgleichheit, gegen eine angegebene menschliche Obergrenze von 91 %
Articos86 % der von Experten identifizierten ThemenThemenwiederherstellung im Vergleich zu veröffentlichten Expertenberichten
Evelance89,78 % thematische ÜberlappungThemenübereinstimmung, 7 Personas vs. 23 echte Nutzer
Synthetic Users85–92 % "Synthetische organische Parität"Ähnlichkeit von synthetischen zu echten Interviews
Aaru0,90 mediane KorrelationKorrelation in einer Kundenstudie
Evidenza88 % Genauigkeit, 0,81 KorrelationMetrik nicht öffentlich definiert
Fairgen98 % Sanity-DurchlaufquoteEin internes Qualitätstor, nicht Genauigkeit
MindsSpearman 0,85, +4 % SkalenverzerrungRangkorrelation bei 54 Anzeigen im Vergleich zu einem menschlichen Panel

Es folgen zwei Beobachtungen, und keine davon betrifft, welches Produkt besser ist.

Die höchste Zahl ist keine Genauigkeitszahl. Fairgens 98 % ist der Anteil der generierten Profile, die ihr eigenes Qualitätstor mit sechs Dimensionen bestehen. Es sagt nichts darüber aus, ob die Ausgabe mit menschlichen Daten übereinstimmt, und Fairgen behauptet nicht, dass sie das tut. Jeder, der diese Tabelle nach Prozentsatz sortiert, würde sie auf einer Maßnahme an erster Stelle rangieren, an der sie nie teilgenommen haben.

Nur zwei Zahlen sind vergleichbar. Similes 85 % und Artificial Societies' 86 % werden beide als Anteil dessen ausgedrückt, was Menschen selbst erreichen. Sie können verglichen werden. Nichts anderes in der Spalte kann mit irgendetwas verglichen werden, einschließlich untereinander.

Wer Misserfolge veröffentlicht

Hier trennt sich das Feld am schärfsten.

Fairgen gibt die Studien an, für die ihre Methode ungeeignet ist: Markenverfolgung, Segmentierung, Conjoint. Ihre Anleitung lautet: "Drucktest, bevor Sie ins Feld gehen, nicht stattdessen". Synthetic Users geben an, dass synthetische Befragte "ohne Kalibrierung individuell glaubwürdig, aber kollektiv falsch sind". Articos und Evelance sagen beide, dass ihre Ergebnisse richtungsweisend sind und neben menschlicher Forschung stehen sollten, anstatt sie zu ersetzen.

Aaru, Evidenza und Artificial Societies veröffentlichen keine Fehlerbedingungen, die wir finden konnten.

Wo wir stehen, einschließlich der Lücke

Unsere eigenen Studien verwenden vierbedingte Ablationen, halten echte Antworten zurück, versiegeln die Auswahl der Kandidaten, bevor die Ziele geöffnet werden, und berichten die Zufallsuntergrenze neben dem Ergebnis. Bei einem GSS-Item-Set erzielt eine flache Verteilung ohne Modell bereits 83,71 %; unsere 92,47 % schließen 54 % der verbleibenden Distanz. Die Untergrenze gehört neben den Prozentsatz, und sie fehlt normalerweise.

Wir veröffentlichen Ergebnisse, die nicht funktioniert haben. Ein registrierter Profilanstieg von 0,17 Punkten hatte ein 95 % Intervall von -1,00 bis +1,31, überschritt null und erfüllte nicht das Kriterium für die Förderung. Bei kurzen alltäglichen Hinweisen in einem verblindeten Vergleich gewannen unsere Zielgruppen 13,8 % gegenüber 30,5 % für generische Hinweise und 34,0 % für demografische Hinweise. Das ist ein Verlust, und es wird veröffentlicht.

Was wir nicht haben, ist Peer-Review. Similes Feinabstimmungsergebnis erschien bei EMNLP 2025 mit einem offenen Datensatz von 2,9 Millionen Antworten. Artificial Societies hat ein Ergebnis zu Gruppenverhalten im British Journal of Psychology. Wir haben beides nicht. Unsere Validierungsarbeit wird auf unserer eigenen Website veröffentlicht und hat keinen externen Review durchlaufen, und bis dies geschehen ist, hat ein Leser das Recht, sie anders zu gewichten.

Unsere Partnerschaft mit dem SINUS-Institut wird manchmal als Validierung gelesen. Das ist es nicht. Es ist Provenienz: Das Milieu-Modell, in dem unsere Personas verankert sind, stammt aus Jahrzehnten ihrer Forschung, was eine Aussage über Eingaben und nicht über Genauigkeit ist. Ihr Geschäftsführer bringt es klar auf den Punkt: Die Milieu-Minds "ersetzen weder die Sozialforschung noch die Expertise unseres Instituts".

Wie man jeden Anbieter in zehn Minuten überprüft

Fragen Sie nach der Definition der Metrik, der Stichprobengröße, der Basislinie und den Fehlerbedingungen. Fragen Sie, was die gleiche Maßnahme ohne Modell dahinter erzielt. Wenn ein Anbieter diese nicht vorlegen kann, ist der Prozentsatz Marketing, egal wer ihn veröffentlicht hat und wie vorteilhaft er aussieht.

Dieser Test ist auch für uns nicht angenehm. Es ist einfach der einzige, der einem Käufer etwas sagt.

Quellen

Alle oben genannten Zahlen stammen aus dem öffentlichen Material des jeweiligen Anbieters, abgerufen am 22. September 2026. Angaben ändern sich; prüfen Sie die Quelle, bevor Sie sich darauf verlassen. Wenn wir Ihre falsch gelesen haben, sagen Sie es uns und wir korrigieren es.

Häufig gestellte Fragen

Wie genau sind synthetische Zielgruppen?

Es gibt keine einzelne Zahl. Die veröffentlichten Zahlen reichen von 85 % bis 98 %, aber sie messen unterschiedliche Dinge: Themenüberlappung, Verteilungsgleichheit, Antwortkonsistenz, Qualitätssicherungsdurchlaufquoten und Rangkorrelation sind nicht austauschbar. Eine Genauigkeitszahl ist nur im Zusammenhang mit ihrer Metrik, ihrer Basislinie und der Aufgabe, auf der sie gemessen wurde, sinnvoll.

Warum kann ich die Genauigkeitsprozentsätze zweier Anbieter nicht vergleichen?

Weil die Nenner unterschiedlich sind. Ein Anbieter kann den Anteil der Themen berichten, die er aus Expertenberichten wiederherstellt, ein anderer den Anteil einer Antwortverteilung, die er übereinstimmt, ein anderer den Anteil der generierten Profile, die eine interne Qualitätssicherung bestehen. Diese Zahlen gegeneinander zu bewerten, ergibt eine bedeutungslose Reihenfolge.

Was ist eine menschliche Obergrenze und warum ist sie wichtig?

Menschen reproduzieren ihre eigenen Umfrageantworten nicht perfekt. Wenn sie zwei Wochen später erneut gefragt werden, unterscheiden sie sich von sich selbst. Diese Selbstkonsistenzrate ist die realistische Obergrenze für jede Simulation, daher ist es informativer, ein Ergebnis als Anteil davon zu berichten, als einen Rohprozentsatz.

Was ist eine Zufallsuntergrenze?

Die Punktzahl, die ein Ansatz ohne Modell und ohne Daten dahinter erreicht. Bei einem unserer GSS-Item-Sets erzielt eine flache Verteilung bereits 83,71 %. Ein berichteter Wert von 92,47 % schließt daher 54 % der Distanz zwischen dieser Untergrenze und einer perfekten Punktzahl, was eine ganz andere Behauptung ist als '92 % genau'.