Horizon
Startseite
/
Glossar
/
Synthetische Daten in der Marktforschung

Synthetische Daten in der Marktforschung

Synthetische Daten in der Marktforschung sind künstlich erzeugte Datenpunkte, die reale Erhebungen ergänzen oder ersetzen, etwa durch Auffüllen kleiner Teilgruppen, Schätzen fehlender Werte oder vollständig simulierte Befragte.

Aktualisiert
September 28, 2026
· Horizon

Synthetische Daten ist der Oberbegriff, unter dem sehr verschiedene Verfahren laufen. Für die Bewertung hilft es, sie auseinanderzuhalten, denn sie haben unterschiedliche Stärken und Risiken.

Warum das für Ihre Entscheidung wichtig ist

Wenn in einer Studie von synthetischen Daten die Rede ist, kann Unterschiedliches gemeint sein. Imputation schätzt einzelne fehlende Antworten auf Basis vorhandener Daten, ein seit Jahrzehnten etabliertes statistisches Verfahren. Synthetisches Boosting füllt kleine Teilgruppen einer realen Stichprobe mit modellierten Fällen auf. Vollständig simulierte Befragte ersetzen die Erhebung ganz. Je größer der synthetische Anteil, desto mehr hängt das Ergebnis vom Modell ab und desto weniger von den befragten Menschen.

Für Entscheidungen ist deshalb die Frage wichtig, wie viel des Ergebnisses beobachtet und wie viel erzeugt ist. Synthetische Daten ergänzen vorhandene Evidenz, sie schaffen keine neue. Für Angebote, die es noch nicht gibt, fehlt die Datengrundlage, aus der ergänzt werden könnte. Ob Menschen ein neues Angebot wählen, zeigt ihr Verhalten.

Beispiel

Eine Befragung zu einem neuen Mobilfunktarif hat 1.000 Befragte, darunter nur 60 Selbstständige. Um diese Gruppe auswerten zu können, wird sie synthetisch auf 300 Fälle aufgestockt. Die aufgestockte Gruppe zeigt eine ähnliche Präferenz wie die 60 realen Fälle, nur mit scheinbar engerem Vertrauensintervall. Die Unsicherheit ist in Wahrheit die der 60 Menschen. Für die Entscheidung, ob ein Tarif für Selbstständige eingeführt wird, braucht es mehr Beobachtungen dieser Gruppe, etwa in einem Verhaltenstest mit gezielter Ansprache.

Welche Fragen Sie bei synthetischen Daten stellen sollten

Welcher Anteil der Fälle ist beobachtet, welcher erzeugt? Auf welcher Datengrundlage wurde das Modell trainiert oder kalibriert, und aus welchem Land und welcher Kategorie stammt sie? Woran wurde das Verfahren validiert, an Befragungen oder an Verhalten? Werden Vertrauensintervalle auf Basis der realen oder der aufgefüllten Fallzahl berichtet?

Wer diese Fragen beantworten kann, kann synthetische Daten sinnvoll einordnen. Für die Entscheidung über ein neues Angebot bleibt der Maßstab, wie sich reale Menschen vor diesem Angebot verhalten.

Abgrenzung

Synthetische Befragte sind eine Form synthetischer Daten, bei der die gesamte Stichprobe simuliert wird. Synthetisches Boosting ergänzt nur Teilgruppen. Synthetische Daten zum Datenschutz, etwa anonymisierte Kopien von Kundendaten, verfolgen ein anderes Ziel und sind hier nicht gemeint. Verhaltensdaten aus einem Painted-Door-Test sind beobachtete Daten: Jede gemessene Entscheidung stammt von einer realen Person.

Grenzen

Synthetische Antworten zeigen häufig künstlich geringe Streuung. In einer Replikation einer US-Wahlbefragung lagen Mittelwerte nahe am Original, rund 48 % der geschätzten Zusammenhänge wichen aber signifikant ab, und gleiche Prompts lieferten über drei Monate unterschiedliche Ergebnisse (Bisbee et al. 2024). Wer synthetische Daten nutzt, sollte offenlegen, welcher Anteil erzeugt ist, und Unsicherheit nicht künstlich verkleinern. Ein Verhaltenstest liefert dafür nur Daten zu den getesteten Varianten und Zielgruppen, nicht zu allen denkbaren.

Belege

Bisbee et al. 2024: Mittelwerte synthetischer Antworten liegen nahe an einer US-Wahlbefragung, die Streuung ist aber künstlich gering. Rund 48 % der geschätzten Zusammenhänge weichen signifikant ab, davon 32 % mit umgekehrtem Vorzeichen. Gleiche Prompts liefern über drei Monate unterschiedliche Ergebnisse. Synthetic Replacements for Human Survey Data? The Perils of Large Language Models, Political Analysis 32(4). Quelle

Argyle et al. 2023: Prägt die Begriffe Silicon Sample und algorithmische Treue: Ein Sprachmodell, das mit demografischen Hintergründen realer Befragter angesprochen wird, gibt die Antwortverteilungen vieler Untergruppen aus US-Wahlbefragungen gut wieder. Maßstab sind Befragungsdaten. Out of One, Many: Using Language Models to Simulate Human Samples, Political Analysis 31(3). Quelle

Häufige Fragen

Sind synthetische Daten dasselbe wie synthetische Befragte?

Nein. Synthetische Befragte sind eine Form synthetischer Daten, bei der die ganze Stichprobe simuliert wird. Andere Formen ergänzen nur einzelne Werte oder Teilgruppen.

Wann sind synthetische Daten sinnvoll?

Zum Schätzen einzelner fehlender Werte, für Exploration und für erste Auswertungen kleiner Gruppen, solange offen bleibt, welcher Anteil erzeugt ist.

Erhöhen synthetische Daten die Aussagekraft einer Studie?

Sie erhöhen die Fallzahl, nicht die Information. Die Unsicherheit bleibt die der realen Beobachtungen.

Wie viel Ihrer Evidenz ist beobachtet?

Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis