Horizon
Startseite
/
Glossar
/
Synthetische Forschung

Synthetische Forschung

Synthetische Forschung ist Marktforschung, bei der ein KI-Modell die Antworten von Zielgruppen erzeugt, statt sie bei realen Menschen zu erheben, etwa als synthetische Befragte, KI-Personas oder digitale Zwillinge.

Aktualisiert
September 28, 2026
· Horizon

Synthetische Forschung ist in kurzer Zeit vom Nischenthema zu einem der meistdiskutierten Themen der Branche geworden. Dieser Überblick ordnet ein, wofür sie sich eignet, woran ihre Qualität gemessen wird und an welcher Stelle einer Entscheidung das Verhalten realer Menschen den Ausschlag gibt.

Was dahintersteckt

Große Sprachmodelle sind auf enormen Mengen Text trainiert: Foren, Bewertungen, Artikel, Befragungsergebnisse. Fragt man ein solches Modell, wie eine bestimmte Person auf eine Frage antworten würde, erzeugt es eine Antwort, die zu dem passt, was Menschen mit ähnlichem Profil in solchen Texten typischerweise sagen. Aus dieser Fähigkeit sind mehrere Verfahren entstanden, die unter dem Begriff synthetische Forschung zusammenlaufen.

Die einfachste Form sind synthetische Befragte: Ein Modell beantwortet einen Fragebogen im Namen vieler simulierter Personen mit vorgegebenen Merkmalen wie Alter, Einkommen oder Region. KI-Personas gehen einen Schritt weiter und bündeln ein Segment zu einer Figur, mit der man sich unterhalten kann. Digitale Zwillinge werden zusätzlich mit echten Daten einer Zielgruppe oder einzelner Personen angereichert, zum Beispiel mit früheren Befragungen, Interviews oder CRM-Daten. Synthetische Daten im engeren Sinn ergänzen oder ersetzen fehlende Werte in bestehenden Datensätzen, etwa um kleine Teilgruppen aufzufüllen.

Allen Verfahren ist gemeinsam: Ein Sprachmodell gibt wieder, was Menschen gesagt und geschrieben haben. Es verdichtet vorhandenes Wissen über eine Zielgruppe und macht es abfragbar. Das ist für viele Aufgaben wertvoll. Es ist aber etwas anderes als die Beobachtung, was Menschen tun, wenn sie vor einem konkreten Angebot mit Preis und Alternativen stehen.

Wofür synthetische Forschung heute genutzt wird

Der Nutzen liegt vor allem am Anfang eines Entscheidungsprozesses. Synthetische Befragte machen die Exploration schneller: Hypothesen formulieren, Segmente beschreiben, Einwände sammeln, Fragebögen und Leitfäden vorab prüfen, eine lange Liste von Ideen oder Claims auf eine kürzere Liste reduzieren. Was früher Wochen und ein Feldbudget gekostet hat, lässt sich in Stunden durchspielen.

Besonders gut funktioniert das dort, wo viel über eine Kategorie bekannt ist: bei inkrementellen Weiterentwicklungen etablierter Produkte, bei bekannten Marken, bei Fragen, die in ähnlicher Form schon oft gestellt und beantwortet wurden. Auch die Forschung beschreibt Sprachmodelle zunehmend als Mitarbeiter im Forschungsprozess, etwa beim Erstellen von Leitfäden, beim Moderieren von Interviews oder beim Verdichten offener Antworten.

Im Markt finden sich zwei Rollen: synthetische Verfahren als Vorauswahl vor der Befragung realer Menschen und synthetische Verfahren als Ersatz für Befragungen. Für die Einordnung ist entscheidend, welche Frage beantwortet werden soll und woran das Ergebnis gemessen wurde.

Woran die Qualität gemessen wird

Die Qualität synthetischer Forschung wird in Validierungsstudien geprüft. Dabei wird ein Ergebnis mit einem Referenzmaß verglichen, der sogenannten Ground Truth. Bei fast allen bekannten Studien ist dieses Referenzmaß eine Befragung realer Menschen: Antworten im General Social Survey, Wahlbefragungen, Werteumfragen, Conjoint-Studien oder die auf einer Skala erfragte Kaufabsicht.

Das ist methodisch sauber und beantwortet eine wichtige Frage: Wie gut ersetzt ein Modell eine Befragung? Es beantwortet aber nicht die Frage, wie gut ein Modell das Verhalten abbildet. Auch Studien, die synthetischen Befragten eine hohe Übereinstimmung bescheinigen, messen sie an Befragungen, nicht an Verhalten. Wenn schon die Befragung das spätere Verhalten nur begrenzt abbildet, übernimmt ein Modell, das die Befragung gut nachbildet, diese Lücke mit.

Für Entscheidungen über neue Angebote ist das der Kern. Aus der Forschung zum Say-Do-Gap ist bekannt, dass erfragte Kaufabsicht Absatz bei neuen Produkten schlechter abbildet als bei bestehenden (Morwitz, Steckel & Gupta 2007). Ein Modell, das die erfragte Kaufabsicht perfekt trifft, trifft damit noch nicht, wer tatsächlich wählt.

Wie groß die Übereinstimmung ist

Die Ergebnisse sind je nach Aufgabe sehr unterschiedlich, und beide Seiten der Debatte haben belastbare Studien. Auf der einen Seite stehen beeindruckende Werte: Agenten auf Basis ausführlicher Interviews geben Antworten im General Social Survey zu 85 % so genau wieder, wie die Befragten selbst ihre Antworten zwei Wochen später wiederholen (Park et al. 2024). Synthetische Kaufabsichten erreichen über 57 Produktbefragungen 90 % der Test-Retest-Reliabilität menschlicher Befragter (Maier et al. 2025).

Auf der anderen Seite zeigen Studien systematische Abweichungen. In einer Studie des Nürnberg Instituts für Marktentscheidungen wichen KI-Antworten bei 75 bis 80 % der Fragen von den Antworten realer Befragter ab; bekannte Marken wurden überschätzt, weniger bekannte unterschätzt (Kaiser & Manewitsch 2024). Mittelwerte können gut passen, während die Streuung künstlich gering ist und Zusammenhänge zwischen Merkmalen kippen: In einer Replikation einer US-Wahlbefragung wichen rund 48 % der geschätzten Zusammenhänge signifikant ab (Bisbee et al. 2024). Und die Übereinstimmung sinkt mit der kulturellen Distanz eines Landes zu den USA (Atari et al. 2023), was für Zielgruppen in Deutschland, Frankreich oder den Nordics relevant ist.

Beide Befunde passen zusammen. Wo das Modell viel Material hat und nach Durchschnitten gefragt wird, trifft es gut. Wo es um Unterschiede, Nischen, neue Merkmale oder andere Kulturräume geht, wird es unsicherer. Eine Studie zu Zahlungsbereitschaften zeigt das direkt: Für bestehende Produktmerkmale passen die Werte zu Conjoint-Ergebnissen, für neue Merkmale erst nach Feinabstimmung mit früheren menschlichen Daten (Brand, Israeli & Ngwe 2023). Wichtig bleibt in allen Fällen: Gemessen wurde an Befragungen.

Was das für Entscheidungen bedeutet

Die Frage ist deshalb nicht, ob synthetische Forschung gut oder schlecht ist, sondern für welche Entscheidung sie welche Evidenz liefert. Eine hilfreiche Unterscheidung ist die zwischen inkrementellen Entscheidungen im bekannten Umfeld und Entscheidungen über neue Angebote: ein neuer Tarif, ein neues Preismodell, ein Produkt in einer Kategorie, in der die Marke noch nicht vertreten ist.

Für inkrementelle Fragen ist die Datengrundlage eines Modells dicht, und eine synthetische Vorauswahl spart Zeit und Budget. Für neue Angebote fehlt diese Grundlage: Es gibt keine Texte darüber, wie Menschen auf ein Angebot reagiert haben, das es noch nicht gibt. Hinzu kommt, dass synthetische Befragte keine Reibung erleben. Sie haben kein Budget, keine Alternativen im Nebentab, kein Risiko, einen Fehlkauf zu bereuen. Sie bilden Sprachmuster ab, keine Abwägungen.

Das gilt nicht nur für Innovation. Auch bei Preisen, Tarifen, Claims und Markenauftritten bestehender Produkte stellt sich die Frage, ob eine Änderung die Kauf- oder Abschlussabsicht erhöht oder senkt. Eine synthetische Vorauswahl kann die Zahl der Optionen reduzieren. Welcher Preis oder welcher Claim im Angebotsmoment trägt, zeigt die gemessene Wahl realer Menschen.

Je teurer und je neuer die Entscheidung, desto mehr zählt deshalb das Verhalten realer Menschen. Synthetische Befragte machen die Exploration schneller: Hypothesen, Segmente, eine erste Vorauswahl. Ob Menschen ein neues Angebot wählen, zeigt ihr Verhalten. Deshalb kommen die finalen Varianten vor der Investition in einen Verhaltenstest mit realen Menschen.

Wie man synthetische Forschung sinnvoll einsetzt

Erstens: Die Rolle im Ablauf festlegen. Synthetische Verfahren eignen sich für Exploration, Vorauswahl und die Vorbereitung von Studien. Für die Entscheidung über ein neues Angebot braucht es Daten realer Menschen, und für die Frage, ob sie wählen, Verhaltensdaten.

Zweitens: Nach dem Referenzmaß fragen. Wer eine Validierung vorgelegt bekommt, sollte klären, woran das Modell gemessen wurde, in welcher Kategorie, in welchem Land und ob es um bestehende oder neue Produkte ging. Eine hohe Übereinstimmung mit einer Befragung ist eine Aussage über die Befragung.

Drittens: Auf Streuung und Nischen achten. Wenn alle simulierten Personen ähnlich antworten oder die bekannteste Option vorne liegt, ist das oft ein Merkmal des Modells und keine Eigenschaft der Zielgruppe.

Viertens: Den Trichter bewusst schließen. KI vergrößert den Trichter. Am Ende des Trichters steht der Verhaltenstest für die wenigen Varianten, in die tatsächlich investiert wird. Bei Horizon sind das bis zu sechs Varianten, die als realistische Angebote über Google- und Meta-Anzeigen realen Menschen im gewohnten Online-Umfeld gezeigt werden, ohne Panel und ohne Incentive. Verkauft wird nichts; wer sich für ein Angebot entscheidet, erfährt im Anschluss, dass es sich um einen Test handelt. Gemessen wird die Kauf- oder Abschlussabsicht je Variante.

Beispiel

Ein Versicherer plant einen neuen Zahnzusatztarif und hat 20 mögliche Leistungsversprechen formuliert. Mit synthetischen Befragten lässt das Team die Versprechen an drei Zielgruppenprofilen durchspielen, sammelt Einwände und schärft Formulierungen. Nach zwei Tagen stehen vier Versprechen auf der kurzen Liste; das synthetische Ranking sieht Versprechen A klar vorne.

Die vier Versprechen gehen als realistische Angebotsseiten mit identischem Preis in einen Verhaltenstest mit realen Menschen. Nach rund vier Wochen liegt Versprechen C bei der gemessenen Abschlussabsicht vorne, A folgt auf Platz zwei. Ein Grund zeigt sich in der Begleitauswertung: A klingt in der Beschreibung überzeugend, verliert aber im Angebotsmoment gegen C, das eine konkrete Wartezeit nennt. Die synthetische Vorauswahl hat ihren Zweck erfüllt, die Entscheidung trägt das Verhalten.

Methoden und Begriffe im Überblick

Synthetische Befragte: simulierte Antworten auf Befragungen, das Grundverfahren. Synthetische Konsumenten: ein häufig synonym verwendeter Begriff. Silicon Sampling: der wissenschaftliche Ursprung, simulierte Stichproben aus demografischen Profilen. Algorithmische Treue: das Maß, wie gut ein Modell Antwortmuster von Gruppen wiedergibt.

KI-Personas: Segmente als Gesprächsfiguren für Exploration und Einwände. Digitaler Zwilling: ein mit echten Daten angereichertes Modell einer Zielgruppe oder Person. Synthetische Daten und synthetisches Boosting: ergänzte oder aufgefüllte Werte in bestehenden Datensätzen.

Varianzkompression und WEIRD-Bias: zwei bekannte Verzerrungen, zur Mitte rückende Antworten und eine Nähe zu US-Mustern. Ground Truth: das Referenzmaß einer Validierung. KI-Konzeptscreening und KI-generierte Konzepte: der Einsatz vor und im Innovationstrichter. KI in der Marktforschung und hybride Forschung: der größere Rahmen, in dem Synthetik, Befragung und Verhalten jeweils eine klare Rolle haben.

Grenzen

Synthetische Forschung entwickelt sich schnell, und diese Einordnung beschreibt den Stand der veröffentlichten Forschung. Modelle, die auf beobachtetem Verhalten statt auf Text und Befragungen trainiert sind, sind eine andere Klasse von Verfahren und werden hier nicht bewertet. Die Aussagen beziehen sich auf Sprachmodelle, die Befragungsantworten simulieren, und auf Entscheidungen über neue Angebote.

Auch der Verhaltenstest hat Grenzen. Er misst, ob und welche Variante Menschen wählen, erklärt aber nicht allein, warum. Er braucht ausreichend Reichweite in der Zielgruppe, ein realistisches Angebot und eine vorab festgelegte Kennzahl. Er testet wenige Varianten, keine Liste von 50 Ideen. Deshalb ergänzen sich die Verfahren: synthetische Exploration für die Breite, Befragung für Motive, Verhaltenstest für die Wahl zwischen den finalen Varianten.

Alle Begriffe zum Thema

Belege

Park et al. 2024: Agenten auf Basis von Interviews mit 1.052 US-Bürgern geben Antworten im General Social Survey zu 85 % so genau wieder, wie die Personen selbst ihre Antworten zwei Wochen später wiederholen. Maßstab sind Befragungsantworten und Laborspiele, kein Kaufverhalten. Generative Agent Simulations of 1,000 People, arXiv 2411.10109. Quelle

Maier et al. 2025: Über 57 Produktbefragungen mit 9.300 menschlichen Antworten erreichen synthetische Kaufabsichten 90 % der Test-Retest-Reliabilität der Menschen. Maßstab ist die erfragte Kaufabsicht auf einer Likert-Skala, nicht beobachtetes Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv 2510.08338. Quelle

Kaiser & Manewitsch (NIM) 2024: Im Vergleich mit menschlichen Befragten weichen KI-Antworten bei 75 % (Softdrinks) und 80 % (Sportbekleidung) der Fragen ab. Bekannte Marken werden überschätzt, weniger bekannte unterschätzt, Antworten fallen positiver und einheitlicher aus. Synthetische Befragte, Nürnberg Institut für Marktentscheidungen. Quelle

Bisbee et al. 2024: Mittelwerte synthetischer Antworten liegen nahe an einer US-Wahlbefragung, die Streuung ist aber künstlich gering. Rund 48 % der geschätzten Zusammenhänge weichen signifikant ab, davon 32 % mit umgekehrtem Vorzeichen. Gleiche Prompts liefern über drei Monate unterschiedliche Ergebnisse. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models, Political Analysis 32(4). Quelle

Atari et al. 2023: Die Ähnlichkeit zwischen Modellantworten und menschlichen Antworten sinkt mit der kulturellen Distanz eines Landes zu den USA (r = -0,70). Maßstab sind internationale Wertebefragungen. Which Humans?, PsyArXiv Preprint. Quelle

Brand, Israeli & Ngwe 2023: Sprachmodelle geben Zahlungsbereitschaften für bestehende Produktmerkmale plausibel wieder, für neue Merkmale erst nach Feinabstimmung mit früheren menschlichen Ergebnissen. Maßstab sind Conjoint-Studien, also Befragungen. Using LLMs for Market Research, Harvard Business School Working Paper 23-062. Quelle

Häufige Fragen

Können synthetische Befragte eine Befragung ersetzen?

Für Exploration, Vorauswahl und das Prüfen von Fragebögen können sie Befragungen teilweise vorwegnehmen. Studien zeigen gute Übereinstimmung bei Durchschnitten, aber Abweichungen bei Streuung, Nischen, neuen Merkmalen und Zielgruppen außerhalb der USA.

Woran werden synthetische Befragte validiert?

In fast allen veröffentlichten Studien an Befragungen realer Menschen, zum Beispiel am General Social Survey oder an erfragter Kaufabsicht. Eine hohe Übereinstimmung heißt deshalb, dass das Modell die Befragung gut nachbildet, nicht zwingend das Verhalten.

Wofür eignet sich synthetische Forschung am besten?

Für die frühe Phase: Hypothesen bilden, Segmente beschreiben, Einwände sammeln und eine lange Liste auf wenige Kandidaten reduzieren, vor allem bei bekannten Kategorien.

Warum reicht das für neue Angebote nicht?

Ein Sprachmodell gibt wieder, was Menschen über bestehende Produkte gesagt und geschrieben haben. Für Angebote, die es noch nicht gibt, fehlt diese Grundlage, und simulierte Befragte erleben weder Preis noch Alternativen noch Konsequenz.

Nutzt Horizon synthetische Befragte?

Horizon misst in seinen Tests die Kauf- oder Abschlussabsicht realer Menschen an realistischen Angeboten. Synthetische Verfahren können davor sinnvoll sein, um die Varianten auszuwählen, die in den Test gehen.

Was ist der Unterschied zwischen synthetischen Befragten und einem digitalen Zwilling?

Synthetische Befragte werden meist aus demografischen Profilen erzeugt. Ein digitaler Zwilling wird zusätzlich mit echten Daten einer Zielgruppe oder Person angereichert und bildet damit genauer ab, was über sie bekannt ist.

Welche Ihrer Varianten sollte vor der Investition ins Verhalten?

Bringen Sie Ihre Entscheidungsfrage und Ihre Vorauswahl mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis