



Ground Truth, auf Deutsch Referenzmaß, ist der Maßstab, an dem die Güte einer Messung oder eines Modells geprüft wird; in der Marktforschung entscheidet er, ob ein Ergebnis an Befragungsantworten oder an beobachtetem Verhalten gemessen wird.
Wenn eine Methode als "valide" oder "hoch übereinstimmend" beschrieben wird, lohnt die Frage: übereinstimmend womit? Das Referenzmaß bestimmt, was eine Validierung tatsächlich belegt.
Neue Verfahren, etwa synthetische Befragte oder digitale Zwillinge, werden häufig mit Übereinstimmungswerten beschrieben. Diese Werte sind nur so aussagekräftig wie das Referenzmaß, an dem sie gemessen wurden. Ist das Referenzmaß eine Befragung, zeigt eine hohe Übereinstimmung, dass das Verfahren Befragungsantworten gut nachbildet. Ob Menschen ein Angebot wählen, ist damit noch nicht geprüft.
Für Entscheidungen über neue Angebote, Preise oder Tarife heißt das: Die Frage nach dem Referenzmaß gehört an den Anfang jeder Methodenbewertung, nicht an das Ende.
Ein Sprachmodell gibt wieder, was Menschen gesagt und geschrieben haben. Auch Studien, die synthetischen Befragten eine hohe Übereinstimmung bescheinigen, messen sie an Befragungen, nicht an Verhalten. Zwei viel beachtete Arbeiten zeigen das: In der einen erreichen KI-Agenten bei Antworten in einer großen Sozialbefragung 86 % der Konsistenz, mit der Menschen ihre eigenen Antworten wiederholen. In der anderen erreichen synthetische Antworten auf Kaufabsichtsfragen rund 90 % der Test-Retest-Reliabilität menschlicher Befragter. Beide Ergebnisse sind methodisch bemerkenswert, und beide nutzen Befragungsantworten als Referenzmaß.
Befragungsantworten selbst weichen aber vom Verhalten ab: Absichten werden etwa in der Hälfte der Fälle umgesetzt, und hypothetisch genannte Zahlungsbereitschaft liegt im Schnitt über der realen. Ein Verfahren, das Befragungen gut nachbildet, übernimmt diese Abweichung.
Ein Team prüft ein Verfahren, das Kaufbereitschaft für drei Varianten eines Zahnzusatztarifs simuliert. Die Anbieterunterlagen zeigen eine hohe Übereinstimmung mit einer früheren Befragung. Das Team stellt zwei Fragen: Woran wurde die Übereinstimmung gemessen, und gab es die getesteten Angebote schon im Markt?
Die Antwort: gemessen an Skalenantworten, für bestehende Tarife. Für den neuen Tarif fehlt damit ein Beleg am Verhalten. Das Team nutzt das Verfahren zur Vorauswahl und prüft die zwei verbliebenen Varianten in einem Verhaltenstest.
Validität beschreibt, ob eine Methode misst, was sie messen soll; das Referenzmaß ist der Maßstab, an dem das geprüft wird. Reliabilität beschreibt, ob wiederholte Messungen übereinstimmen, und sagt nichts darüber, ob das Richtige gemessen wird. Ein Verfahren kann sehr reliabel sein und trotzdem am falschen Referenzmaß kalibriert.
Auch beobachtetes Verhalten im Painted-Door-Test ist kein vollständiges Referenzmaß für den späteren Markt: Es zeigt die Entscheidung vor einem realistischen Angebot, nicht Wiederkauf, Retouren oder Wettbewerbsreaktionen. Der ehrlichste Maßstab für ein Verfahren ist deshalb immer der, der der eigenen Entscheidung am nächsten kommt.
Synthetische Befragte machen die Exploration schneller: Hypothesen, Segmente, eine erste Vorauswahl. Ob Menschen ein neues Angebot wählen, zeigt ihr Verhalten. Horizon misst deshalb die Kaufabsicht realer Menschen für die finalen Varianten vor der Investition.
Park et al. 2024: KI-Agenten auf Basis von Interviews mit 1.052 Personen erreichen bei Antworten im General Social Survey 86 % der Konsistenz, mit der die Personen ihre eigenen Antworten zwei Wochen später wiederholen. Maßstab sind Befragungsantworten. LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals, arXiv 2411.10109. Quelle
Maier et al. 2025: Über 57 Produktbefragungen mit 9.300 Antworten erreichen synthetische Antworten rund 90 % der Test-Retest-Reliabilität menschlicher Befragter. Maßstab ist die erfragte Kaufabsicht auf einer Skala, nicht Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv 2510.08338. Quelle
Sheeran & Webb 2016: Absichten werden etwa in der Hälfte der Fälle in Handlung umgesetzt. The Intention-Behavior Gap, Social and Personality Psychology Compass 10(9). Quelle
Schmidt & Bijmolt 2020: Über 77 Studien und 115 Effektgrößen liegt die hypothetisch genannte Zahlungsbereitschaft im Schnitt 21 % über der realen. Accurately measuring willingness to pay for consumer goods: a meta-analysis of the hypothetical bias, Journal of the Academy of Marketing Science 48. Quelle
Woran die Übereinstimmung gemessen wurde, an Befragung oder an Verhalten, und ob die getesteten Angebote bereits im Markt waren.
Nein. Für Einstellungen und Motive ist sie das richtige Maß. Für die Frage, ob Menschen ein neues Angebot wählen, ist beobachtetes Verhalten näher an der Entscheidung.
Nein. Es zeigt die Entscheidung vor einem realistischen Angebot, nicht den späteren Marktverlauf.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten