Horizon
Startseite
/
Glossar
/
Algorithmische Treue

Algorithmische Treue

Algorithmische Treue ist das Maß, in dem ein Sprachmodell die Antwortverteilungen bestimmter Bevölkerungsgruppen aus bereits vorliegenden menschlichen Befragungen wiedergibt, wenn es mit passenden Personenprofilen konditioniert wird.

Aktualisiert
September 28, 2026
· Horizon

Der Begriff klingt nach Verlässlichkeit. Entscheidend ist, woran die Treue gemessen wird.

Was dahintersteckt

Argyle und Kollegen führten den Begriff 2023 zusammen mit Silicon Sampling ein. Ein Modell gilt als algorithmisch treu, wenn seine simulierten Antworten für viele Untergruppen die Verteilungen einer echten Befragung abbilden, nicht nur den Durchschnitt. Seitdem ist algorithmische Treue der gängige Maßstab, an dem synthetische Befragte bewertet werden.

Park und Kollegen berichteten 2024 von Agenten auf Basis ausführlicher Interviews, die 83 bis 86 % der Konsistenz erreichen, mit der Menschen ihre eigenen Antworten nach zwei Wochen wiederholen. Maier und Kollegen fanden 2025 für Kaufabsichtsfragen zu Körperpflegeprodukten 90 % der Wiederholungszuverlässigkeit menschlicher Befragter. Das sind beachtliche Werte.

Warum das für Ihre Entscheidung wichtig ist

Alle diese Werte vergleichen Modelle mit Befragungen. Übereinstimmung mit Befragungen ist nicht Übereinstimmung mit Verhalten. Ein Modell, das perfekt trifft, was Menschen in einer Umfrage angeben, übernimmt auch die bekannte Lücke zwischen Angabe und Handlung. Meta-Analysen zeigen, dass eine deutliche Änderung der Absicht nur eine kleine bis mittlere Änderung des Verhaltens bewirkt.

Für Sie heißt das: Hohe algorithmische Treue ist ein gutes Argument, synthetische Befragte dort einzusetzen, wo Sie sonst befragt hätten. Sie ist kein Beleg dafür, dass Menschen ein neues Angebot wählen.

Fragen Sie deshalb bei jeder berichteten Übereinstimmung nach drei Dingen: gegen welche Daten verglichen wurde, in welcher Kategorie und in welchem Land. Eine Validierung gegen eine US-Meinungsumfrage sagt wenig über einen Tarif in Deutschland.

Beispiel

Ein Anbieter berichtet, seine synthetischen Befragten stimmten zu 88 % mit einer Befragung zu einer neuen Reiserücktrittsversicherung im Abo überein. In der Befragung gaben 42 % an, die Versicherung wahrscheinlich abzuschließen, das Modell kommt auf 44 %.

Beide Werte beschreiben angegebene Absicht. Im Verhaltenstest mit realistischer Angebotsseite liegt die gemessene Abschlussabsicht deutlich darunter. Die Treue zur Befragung war hoch, die Lücke zum Verhalten bleibt bestehen.

Abgrenzung

Algorithmische Treue ist eine Form der Validierung gegen Befragungsdaten. Ground Truth im Sinne beobachteten Verhaltens ist ein anderer Maßstab. Varianzkompression und WEIRD-Bias beschreiben typische Abweichungen, die die Treue mindern. Test-Retest-Reliabilität misst, wie stabil Menschen selbst antworten, und dient oft als Obergrenze.

Grenzen

Treue ist abhängig von Frage, Modell, Prompt und Zielgruppe. Sie gilt für Themen mit viel Textgrundlage besser als für Neues, und für US-Stichproben besser belegt als für europäische. Ein hoher Wert in einer Kategorie lässt sich nicht auf eine andere übertragen.

Auch der Verhaltenstest hat Grenzen: Er misst gemessene Kaufabsicht in einer realistischen Situation, keinen tatsächlichen Kauf, denn verkauft wird nichts. Horizon misst dort, wo Treue zur Befragung nicht ausreicht: bei der Frage, ob reale Menschen ein neues Angebot wählen.

Belege

Argyle et al. 2023: Führt die Begriffe Silicon Sample und algorithmische Treue ein: Ein Sprachmodell, das mit soziodemografischen Profilen realer Befragter aus US-Umfragen konditioniert wird, gibt die Antwortverteilungen vieler Untergruppen dieser Umfragen gut wieder. Maßstab sind Befragungsdaten. Out of One, Many: Using Language Models to Simulate Human Samples, Political Analysis 31(3). Quelle

Park et al. 2024: Agenten auf Basis von Interviews mit 1.052 US-Amerikanern erreichen 83 bis 86 % der Konsistenz, mit der die Personen ihre eigenen Befragungsantworten nach zwei Wochen wiederholen; nur mit Demografie sind es 74 %. Maßstab sind Befragungsantworten. LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals, arXiv. Quelle

Maier et al. 2025: Über 57 Befragungen zu Körperpflegeprodukten mit 9.300 Antworten erreichen simulierte Antworten 90 % der Test-Retest-Reliabilität menschlicher Befragter. Maßstab ist die in der Befragung angegebene Kaufabsicht, nicht Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv Preprint. Quelle

Häufige Fragen

Ist eine hohe algorithmische Treue ein Qualitätsmerkmal?

Ja, für den Ersatz oder die Ergänzung von Befragungen. Für Aussagen über Verhalten ist sie der falsche Maßstab.

Warum wird nicht gegen Verhalten validiert?

Weil Verhaltensdaten zu neuen Angeboten selten vorliegen. Genau diese Lücke schließt ein Verhaltenstest.

Was bedeutet 90 % der Test-Retest-Reliabilität?

Das Modell ist fast so konsistent mit den Befragten, wie diese mit sich selbst über zwei Befragungen. Es bleibt ein Vergleich von Angaben mit Angaben.

Woran messen Sie die Treue Ihrer synthetischen Daten?

Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis