Horizon
Startseite
/
Glossar
/
Ground Truth / Referenzmaß

Ground Truth / Referenzmaß

Ground Truth, auf Deutsch Referenzmaß, ist der Maßstab, an dem die Güte einer Messung oder eines Modells geprüft wird; in der Marktforschung entscheidet er, ob ein Ergebnis an Befragungsantworten oder an beobachtetem Verhalten gemessen wird.

Aktualisiert
September 28, 2026
· Horizon

Wenn eine Methode als "valide" oder "hoch übereinstimmend" beschrieben wird, lohnt die Frage: übereinstimmend womit? Das Referenzmaß bestimmt, was eine Validierung tatsächlich belegt.

Warum das für Ihre Entscheidung wichtig ist

Neue Verfahren, etwa synthetische Befragte oder digitale Zwillinge, werden häufig mit Übereinstimmungswerten beschrieben. Diese Werte sind nur so aussagekräftig wie das Referenzmaß, an dem sie gemessen wurden. Ist das Referenzmaß eine Befragung, zeigt eine hohe Übereinstimmung, dass das Verfahren Befragungsantworten gut nachbildet. Ob Menschen ein Angebot wählen, ist damit noch nicht geprüft.

Für Entscheidungen über neue Angebote, Preise oder Tarife heißt das: Die Frage nach dem Referenzmaß gehört an den Anfang jeder Methodenbewertung, nicht an das Ende.

Befragung oder Verhalten als Maßstab

Ein Sprachmodell gibt wieder, was Menschen gesagt und geschrieben haben. Auch Studien, die synthetischen Befragten eine hohe Übereinstimmung bescheinigen, messen sie an Befragungen, nicht an Verhalten. Zwei viel beachtete Arbeiten zeigen das: In der einen erreichen KI-Agenten bei Antworten in einer großen Sozialbefragung 86 % der Konsistenz, mit der Menschen ihre eigenen Antworten wiederholen. In der anderen erreichen synthetische Antworten auf Kaufabsichtsfragen rund 90 % der Test-Retest-Reliabilität menschlicher Befragter. Beide Ergebnisse sind methodisch bemerkenswert, und beide nutzen Befragungsantworten als Referenzmaß.

Befragungsantworten selbst weichen aber vom Verhalten ab: Absichten werden etwa in der Hälfte der Fälle umgesetzt, und hypothetisch genannte Zahlungsbereitschaft liegt im Schnitt über der realen. Ein Verfahren, das Befragungen gut nachbildet, übernimmt diese Abweichung.

Beispiel

Ein Team prüft ein Verfahren, das Kaufbereitschaft für drei Varianten eines Zahnzusatztarifs simuliert. Die Anbieterunterlagen zeigen eine hohe Übereinstimmung mit einer früheren Befragung. Das Team stellt zwei Fragen: Woran wurde die Übereinstimmung gemessen, und gab es die getesteten Angebote schon im Markt?

Die Antwort: gemessen an Skalenantworten, für bestehende Tarife. Für den neuen Tarif fehlt damit ein Beleg am Verhalten. Das Team nutzt das Verfahren zur Vorauswahl und prüft die zwei verbliebenen Varianten in einem Verhaltenstest.

Abgrenzung

Validität beschreibt, ob eine Methode misst, was sie messen soll; das Referenzmaß ist der Maßstab, an dem das geprüft wird. Reliabilität beschreibt, ob wiederholte Messungen übereinstimmen, und sagt nichts darüber, ob das Richtige gemessen wird. Ein Verfahren kann sehr reliabel sein und trotzdem am falschen Referenzmaß kalibriert.

Grenzen

Auch beobachtetes Verhalten im Painted-Door-Test ist kein vollständiges Referenzmaß für den späteren Markt: Es zeigt die Entscheidung vor einem realistischen Angebot, nicht Wiederkauf, Retouren oder Wettbewerbsreaktionen. Der ehrlichste Maßstab für ein Verfahren ist deshalb immer der, der der eigenen Entscheidung am nächsten kommt.

Synthetische Befragte machen die Exploration schneller: Hypothesen, Segmente, eine erste Vorauswahl. Ob Menschen ein neues Angebot wählen, zeigt ihr Verhalten. Horizon misst deshalb die Kaufabsicht realer Menschen für die finalen Varianten vor der Investition.

Belege

Park et al. 2024: KI-Agenten auf Basis von Interviews mit 1.052 Personen erreichen bei Antworten im General Social Survey 86 % der Konsistenz, mit der die Personen ihre eigenen Antworten zwei Wochen später wiederholen. Maßstab sind Befragungsantworten. LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals, arXiv 2411.10109. Quelle

Maier et al. 2025: Über 57 Produktbefragungen mit 9.300 Antworten erreichen synthetische Antworten rund 90 % der Test-Retest-Reliabilität menschlicher Befragter. Maßstab ist die erfragte Kaufabsicht auf einer Skala, nicht Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv 2510.08338. Quelle

Sheeran & Webb 2016: Absichten werden etwa in der Hälfte der Fälle in Handlung umgesetzt. The Intention-Behavior Gap, Social and Personality Psychology Compass 10(9). Quelle

Schmidt & Bijmolt 2020: Über 77 Studien und 115 Effektgrößen liegt die hypothetisch genannte Zahlungsbereitschaft im Schnitt 21 % über der realen. Accurately measuring willingness to pay for consumer goods: a meta-analysis of the hypothetical bias, Journal of the Academy of Marketing Science 48. Quelle

Häufige Fragen

Was sollte man einen Anbieter synthetischer Daten fragen?

Woran die Übereinstimmung gemessen wurde, an Befragung oder an Verhalten, und ob die getesteten Angebote bereits im Markt waren.

Ist eine Befragung ein schlechtes Referenzmaß?

Nein. Für Einstellungen und Motive ist sie das richtige Maß. Für die Frage, ob Menschen ein neues Angebot wählen, ist beobachtetes Verhalten näher an der Entscheidung.

Ist Verhalten im Test dasselbe wie Absatz?

Nein. Es zeigt die Entscheidung vor einem realistischen Angebot, nicht den späteren Marktverlauf.

An welchem Maßstab wollen Sie Ihre Entscheidung messen?

Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis