



Varianzkompression ist die Neigung synthetischer Befragter, weniger unterschiedlich zu antworten als reale Menschen, sodass Antworten zur Mitte rücken und Randmeinungen, Nischen und ungewöhnliche Reaktionen in den Ergebnissen unterrepräsentiert sind.
Ein Mittelwert kann stimmen, während die Verteilung dahinter nicht stimmt. Genau das beschreibt Varianzkompression.
Sprachmodelle erzeugen wahrscheinliche Antworten. Wahrscheinlich heißt: nahe an dem, was in den Trainingsdaten häufig vorkommt. Wird ein Modell gebeten, tausend verschiedene Personen zu spielen, entstehen deshalb oft Antworten, die sich ähnlicher sind als die tausend realer Menschen. Extreme Zustimmung, klare Ablehnung und die typischen Weiß-nicht-Antworten werden seltener.
Bisbee und Kollegen zeigten 2024, dass synthetische Antworten im Mittel nahe an einer großen US-Wahlstudie lagen, aber deutlich weniger streuten. Wang und Kollegen fanden 2025 in Studien mit 3.200 Teilnehmenden, dass Modelle demografische Gruppen zu flach abbilden: Die Vielfalt innerhalb einer Gruppe geht verloren.
Viele Entscheidungen hängen nicht am Durchschnitt, sondern an den Rändern. Ein neues Angebot lebt oft von einer kleinen Gruppe früher Käufer. Eine Preiserhöhung scheitert an dem Anteil, der kündigt. Eine Nischenmarke wächst mit Menschen, die vom Mainstream abweichen. Wenn die Methode genau diese Ränder glättet, wirkt ein Konzept unauffällig, das in Wahrheit polarisiert.
Eine Untersuchung des NIM beobachtete mehr positive Antworten, weniger Streuung und eine Bevorzugung bekannter Marken bei synthetischen Befragten. Nischen und Neues verschwinden so im Mittelfeld.
Ein Mobilfunkanbieter testet einen Tarif ohne Mindestlaufzeit mit Aufpreis. Synthetische Befragte vergeben im Schnitt 6,1 von 10 Punkten, fast alle Werte liegen zwischen 5 und 7. Eine reale Befragung ergibt einen ähnlichen Mittelwert von 5,8, aber zwei Lager: ein Viertel bewertet mit 9 oder 10, ein Drittel mit 3 oder weniger.
Für die Entscheidung ist das Viertel mit hoher Zustimmung die eigentliche Information. Ob es auch handelt, zeigt ein Verhaltenstest, in dem Menschen den Tarif mit Preis sehen.
Varianzkompression ist nicht dasselbe wie ein falscher Mittelwert. Sie betrifft die Form der Verteilung. Verwandt ist der WEIRD-Bias, der beschreibt, wessen Muster ein Modell wiedergibt. Algorithmische Treue fragt, wie gut Verteilungen insgesamt getroffen werden. Die Zustimmungstendenz realer Befragter ist ein eigener Effekt, der in Befragungen mit Menschen auftritt.
Schauen Sie bei synthetischen Ergebnissen immer auf Streuung und Verteilung, nicht nur auf Mittelwerte. Nehmen Sie ungewöhnliche Konzepte bewusst in den nächsten Schritt mit, auch wenn sie im Screening mittelmäßig abschneiden. Und prüfen Sie Entscheidungen, die an Minderheiten oder frühen Käufern hängen, mit realen Menschen.
Neuere Verfahren versuchen, die Streuung künstlich zu vergrößern, etwa durch andere Abfragetechniken. Das verbessert die Form der Verteilung, schafft aber keine neue Beobachtung. Auch ein Verhaltenstest hat Grenzen: Er zeigt, wie viele Menschen handeln, nicht automatisch warum. Für das Warum ergänzt qualitative Forschung.
Bisbee et al. 2024: Mittelwerte synthetischer Antworten liegen nahe an der US-Wahlstudie ANES, die Antworten streuen aber weniger als in der echten Befragung, Regressionskoeffizienten weichen oft deutlich ab, und derselbe Prompt liefert über drei Monate deutlich andere Ergebnisse. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models, Political Analysis 32(4). Quelle
Wang, Morgenstern & Dickerson 2025: In Studien mit 3.200 Teilnehmenden aus 16 demografischen Gruppen und vier Sprachmodellen stellen die Modelle Gruppen verzerrt dar und bilden deren innere Vielfalt zu flach ab. Large language models that replace human participants can harmfully misportray and flatten identity groups, Nature Machine Intelligence. Quelle
NIM 2024/2025: Synthetische Befragte auf GPT-4-Basis weichen bei 75 % (Softdrinks) bzw. 80 % (Sportbekleidung) der Fragen deutlich von 500 realen Befragten ab, überschätzen bekannte Marken, unterschätzen weniger bekannte und antworten positiver und mit weniger Streuung. Synthetische Befragte, Forschungsvorhaben des Nürnberg Institut für Marktentscheidungen. Quelle
Teilweise, etwa durch Kalibrierung an echten Befragungsdaten. Dafür braucht es aber genau die menschlichen Daten, die ersetzt werden sollten, und die Kalibrierung gilt nur für ähnliche Fragen.
Nein, auch Bewertungen von Konzepten, Preisen und Marken. Überall, wo Ränder zählen, wirkt der Effekt auf die Entscheidung.
An auffällig schmalen Verteilungen, fehlenden Weiß-nicht-Antworten und kleinen Unterschieden zwischen Segmenten, die in realen Daten deutlicher wären.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten