



Synthetische Befragte sind von einem KI-Sprachmodell simulierte Personen, die Fragebögen im Namen einer Zielgruppe beantworten, auf Basis vorgegebener Merkmale wie Alter, Einkommen oder Region und ohne Erhebung bei realen Menschen.
Synthetische Befragte sind das Grundverfahren der synthetischen Forschung. Sie liefern in Stunden Antworten, für die eine Befragung Wochen braucht, und eignen sich deshalb vor allem für die frühe Phase einer Entscheidung.
Synthetische Befragte machen die Exploration schneller: Hypothesen, Segmente, eine erste Vorauswahl. Teams können eine lange Liste von Ideen, Claims oder Tarifbausteinen durchspielen, Einwände sammeln und Fragebögen vorab testen, bevor Feldbudget fließt.
Für die Einordnung der Ergebnisse ist der Maßstab entscheidend. Ein Sprachmodell gibt wieder, was Menschen gesagt und geschrieben haben. Auch Studien, die synthetischen Befragten eine hohe Übereinstimmung bescheinigen, messen sie an Befragungen, nicht an Verhalten. So erreichen synthetische Kaufabsichten in einer Studie über 57 Produktbefragungen 90 % der Test-Retest-Reliabilität menschlicher Befragter (Maier et al. 2025); gemessen wurde an der erfragten Kaufabsicht auf einer Skala. Ob Menschen ein neues Angebot wählen, zeigt ihr Verhalten. Deshalb kommen die finalen Varianten vor der Investition in einen Verhaltenstest mit realen Menschen.
Ein Konsumgüterhersteller entwickelt ein Nachfüllsystem für Reinigungsmittel und hat zwölf Formulierungen für das Hauptversprechen. Synthetische Befragte in drei Profilen bewerten die Formulierungen, das Team streicht acht und schärft vier. Die vier Varianten gehen mit identischem Preis als realistische Angebotsseiten in einen Verhaltenstest. Das synthetische Ranking sah Variante B vorne; bei der gemessenen Kaufabsicht liegt Variante D vorne, B auf Platz drei.
Synthetische Konsumenten ist meist ein Synonym. KI-Personas bündeln ein Segment zu einer Gesprächsfigur und dienen eher dem Dialog als der Zählung. Ein digitaler Zwilling wird zusätzlich mit echten Daten einer Zielgruppe oder Person angereichert. Silicon Sampling ist der wissenschaftliche Ursprung des Verfahrens. Von Befragungen realer Menschen unterscheiden sich synthetische Befragte dadurch, dass niemand gefragt wird; von einem Painted-Door-Test dadurch, dass keine Wahl beobachtet wird.
Studien zeigen neben guten Durchschnitten systematische Abweichungen: künstlich geringe Streuung und kippende Zusammenhänge (Bisbee et al. 2024), überschätzte bekannte und unterschätzte weniger bekannte Marken (Kaiser & Manewitsch 2024) sowie sinkende Übereinstimmung mit wachsender kultureller Distanz zu den USA (Atari et al. 2023). Synthetische Befragte erleben weder Preis noch Alternativen noch Konsequenz. Für Angebote, die es noch nicht gibt, fehlt dem Modell die Grundlage.
Auch ein Verhaltenstest hat Grenzen: Er prüft wenige finale Varianten, nicht Dutzende Ideen, und erklärt das Warum nur teilweise. Deshalb ergänzen sich beide Verfahren im Ablauf.
Maier et al. 2025: Über 57 Produktbefragungen mit 9.300 menschlichen Antworten erreichen synthetische Kaufabsichten 90 % der Test-Retest-Reliabilität der Menschen. Maßstab ist die erfragte Kaufabsicht auf einer Likert-Skala, nicht beobachtetes Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv 2510.08338. Quelle
Bisbee et al. 2024: Mittelwerte synthetischer Antworten liegen nahe an einer US-Wahlbefragung, die Streuung ist aber künstlich gering. Rund 48 % der geschätzten Zusammenhänge weichen signifikant ab, davon 32 % mit umgekehrtem Vorzeichen. Gleiche Prompts liefern über drei Monate unterschiedliche Ergebnisse. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models, Political Analysis 32(4). Quelle
Kaiser & Manewitsch (NIM) 2024: Im Vergleich mit menschlichen Befragten weichen KI-Antworten bei 75 % (Softdrinks) und 80 % (Sportbekleidung) der Fragen ab. Bekannte Marken werden überschätzt, weniger bekannte unterschätzt, Antworten fallen positiver und einheitlicher aus. Synthetische Befragte, Nürnberg Institut für Marktentscheidungen. Quelle
Atari et al. 2023: Die Ähnlichkeit zwischen Modellantworten und menschlichen Antworten sinkt mit der kulturellen Distanz eines Landes zu den USA (r = -0,70). Maßstab sind internationale Wertebefragungen. Which Humans?, PsyArXiv Preprint. Quelle
Bei Durchschnitten oft gut, bei Streuung, Nischen, weniger bekannten Marken und Zielgruppen außerhalb der USA deutlich schlechter. Maßstab ist dabei fast immer eine Befragung.
Für Exploration, das Sammeln von Einwänden, das Vortesten von Fragebögen und die Vorauswahl aus vielen Ideen oder Formulierungen.
Man kann erfragte Kaufabsicht simulieren. Ob Menschen ein neues Angebot tatsächlich wählen, zeigt sich im Verhalten, zum Beispiel in einem Painted-Door-Test.
Themen-Überblick
Synthetische Forschung
To the overviewVerwandte Begriffe
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten