



Algorithmische Treue ist das Maß, in dem ein Sprachmodell die Antwortverteilungen bestimmter Bevölkerungsgruppen aus bereits vorliegenden menschlichen Befragungen wiedergibt, wenn es mit passenden Personenprofilen konditioniert wird.
Der Begriff klingt nach Verlässlichkeit. Entscheidend ist, woran die Treue gemessen wird.
Argyle und Kollegen führten den Begriff 2023 zusammen mit Silicon Sampling ein. Ein Modell gilt als algorithmisch treu, wenn seine simulierten Antworten für viele Untergruppen die Verteilungen einer echten Befragung abbilden, nicht nur den Durchschnitt. Seitdem ist algorithmische Treue der gängige Maßstab, an dem synthetische Befragte bewertet werden.
Park und Kollegen berichteten 2024 von Agenten auf Basis ausführlicher Interviews, die 83 bis 86 % der Konsistenz erreichen, mit der Menschen ihre eigenen Antworten nach zwei Wochen wiederholen. Maier und Kollegen fanden 2025 für Kaufabsichtsfragen zu Körperpflegeprodukten 90 % der Wiederholungszuverlässigkeit menschlicher Befragter. Das sind beachtliche Werte.
Alle diese Werte vergleichen Modelle mit Befragungen. Übereinstimmung mit Befragungen ist nicht Übereinstimmung mit Verhalten. Ein Modell, das perfekt trifft, was Menschen in einer Umfrage angeben, übernimmt auch die bekannte Lücke zwischen Angabe und Handlung. Meta-Analysen zeigen, dass eine deutliche Änderung der Absicht nur eine kleine bis mittlere Änderung des Verhaltens bewirkt.
Für Sie heißt das: Hohe algorithmische Treue ist ein gutes Argument, synthetische Befragte dort einzusetzen, wo Sie sonst befragt hätten. Sie ist kein Beleg dafür, dass Menschen ein neues Angebot wählen.
Fragen Sie deshalb bei jeder berichteten Übereinstimmung nach drei Dingen: gegen welche Daten verglichen wurde, in welcher Kategorie und in welchem Land. Eine Validierung gegen eine US-Meinungsumfrage sagt wenig über einen Tarif in Deutschland.
Ein Anbieter berichtet, seine synthetischen Befragten stimmten zu 88 % mit einer Befragung zu einer neuen Reiserücktrittsversicherung im Abo überein. In der Befragung gaben 42 % an, die Versicherung wahrscheinlich abzuschließen, das Modell kommt auf 44 %.
Beide Werte beschreiben angegebene Absicht. Im Verhaltenstest mit realistischer Angebotsseite liegt die gemessene Abschlussabsicht deutlich darunter. Die Treue zur Befragung war hoch, die Lücke zum Verhalten bleibt bestehen.
Algorithmische Treue ist eine Form der Validierung gegen Befragungsdaten. Ground Truth im Sinne beobachteten Verhaltens ist ein anderer Maßstab. Varianzkompression und WEIRD-Bias beschreiben typische Abweichungen, die die Treue mindern. Test-Retest-Reliabilität misst, wie stabil Menschen selbst antworten, und dient oft als Obergrenze.
Treue ist abhängig von Frage, Modell, Prompt und Zielgruppe. Sie gilt für Themen mit viel Textgrundlage besser als für Neues, und für US-Stichproben besser belegt als für europäische. Ein hoher Wert in einer Kategorie lässt sich nicht auf eine andere übertragen.
Auch der Verhaltenstest hat Grenzen: Er misst gemessene Kaufabsicht in einer realistischen Situation, keinen tatsächlichen Kauf, denn verkauft wird nichts. Horizon misst dort, wo Treue zur Befragung nicht ausreicht: bei der Frage, ob reale Menschen ein neues Angebot wählen.
Argyle et al. 2023: Führt die Begriffe Silicon Sample und algorithmische Treue ein: Ein Sprachmodell, das mit soziodemografischen Profilen realer Befragter aus US-Umfragen konditioniert wird, gibt die Antwortverteilungen vieler Untergruppen dieser Umfragen gut wieder. Maßstab sind Befragungsdaten. Out of One, Many: Using Language Models to Simulate Human Samples, Political Analysis 31(3). Quelle
Park et al. 2024: Agenten auf Basis von Interviews mit 1.052 US-Amerikanern erreichen 83 bis 86 % der Konsistenz, mit der die Personen ihre eigenen Befragungsantworten nach zwei Wochen wiederholen; nur mit Demografie sind es 74 %. Maßstab sind Befragungsantworten. LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals, arXiv. Quelle
Maier et al. 2025: Über 57 Befragungen zu Körperpflegeprodukten mit 9.300 Antworten erreichen simulierte Antworten 90 % der Test-Retest-Reliabilität menschlicher Befragter. Maßstab ist die in der Befragung angegebene Kaufabsicht, nicht Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv Preprint. Quelle
Ja, für den Ersatz oder die Ergänzung von Befragungen. Für Aussagen über Verhalten ist sie der falsche Maßstab.
Weil Verhaltensdaten zu neuen Angeboten selten vorliegen. Genau diese Lücke schließt ein Verhaltenstest.
Das Modell ist fast so konsistent mit den Befragten, wie diese mit sich selbst über zwei Befragungen. Es bleibt ein Vergleich von Angaben mit Angaben.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten