Horizon
Startseite
/
Glossar
/
KI-Konzeptscreening

KI-Konzeptscreening

KI-Konzeptscreening ist die Vorauswahl von Produkt-, Tarif- oder Kommunikationskonzepten mit Sprachmodellen, die Befragte simulieren und Konzepte nach der zu erwartenden Zustimmung in einer Befragung ordnen, bevor reale Menschen befragt oder getestet werden.

Aktualisiert
September 28, 2026
· Horizon

Wer aus zwanzig Konzeptideen drei auswählen muss, kann mit einem Sprachmodell in Stunden eine erste Rangfolge bilden. Die Frage ist, was diese Rangfolge aussagt und was nicht.

Warum das für Ihre Entscheidung wichtig ist

Konzeptscreening mit KI verändert vor allem die Breite des Trichters. Wo früher fünf Konzepte in eine Befragung gingen, lassen sich heute dutzende Varianten von Nutzenversprechen, Tarifnamen oder Claims vorsortieren. Das spart Zeit und Budget in einer Phase, in der Fehler noch billig sind.

Gleichzeitig entsteht leicht ein Scheinergebnis: Eine saubere Rangfolge mit Prozentwerten wirkt wie ein Befund, beruht aber auf einem Modell, das wiedergibt, was Menschen gesagt und geschrieben haben. Für die Entscheidung, welches Konzept Budget bekommt, zählt deshalb, welche Frage das Screening beantwortet: Welche Konzepte sind plausibel und verständlich? Das kann es gut. Welches Konzept Menschen wählen, wenn es ein echtes Angebot mit Preis ist? Das zeigt ihr Verhalten.

Das betrifft nicht nur Innovationen. Auch bei Claims, Markenauftritten, Tarifnamen und Preisankern für bestehende Produkte wird KI-Screening heute genutzt, um die Zahl der Varianten vor einer Befragung oder einem Test zu verringern.

Wie es funktioniert

Ein Sprachmodell erhält Personenprofile, etwa Alter, Region und Haushaltssituation, und bewertet jedes Konzept so, wie es eine solche Person in einer Befragung tun würde. Neuere Verfahren lassen das Modell frei antworten und übersetzen den Text anschließend in eine Skala. Das Ergebnis ist eine Verteilung simulierter Zustimmungswerte je Konzept.

Eine Studie über 57 Befragungen zu Körperpflegeprodukten zeigt, wie weit das inzwischen reicht: Die simulierten Antworten erreichen einen Großteil der Wiederholungszuverlässigkeit menschlicher Befragter. Der Maßstab ist dabei die in der Befragung angegebene Kaufabsicht, nicht gemessenes Verhalten.

Beispiel

Ein Versicherer hat zwölf Konzepte für einen Zahnzusatztarif: unterschiedliche Leistungsschwerpunkte, Namen und Preisanker. Ein KI-Screening sortiert vier Konzepte aus, die für Zielgruppen über 50 unverständlich wirken, und markiert zwei Konzepte mit der höchsten simulierten Zustimmung, 71 und 68 von 100 Punkten.

Diese beiden und ein drittes, bewusst abweichendes Konzept gehen danach in einen Verhaltenstest mit realen Menschen. Dort zeigt sich, bei welcher Variante die gemessene Abschlussabsicht am höchsten ist, wenn Preis und Alternativen sichtbar sind.

Abgrenzung

Klassisches Konzept-Screening befragt reale Menschen zu Konzepten. KI-Konzeptscreening simuliert diese Befragung. Beide messen angegebene Zustimmung, also Stated Preference. Ein Verhaltenstest wie der Painted-Door-Test misst dagegen, ob Menschen in einer realistischen Angebotssituation handeln.

Von KI-generierten Konzepten unterscheidet sich das Screening dadurch, dass es nicht Ideen erzeugt, sondern vorhandene Ideen ordnet. In der Praxis laufen beide oft hintereinander.

Grenzen

Sprachmodelle neigen zur Mitte: Sie bevorzugen bekannte Muster und bewerten ungewöhnliche Konzepte eher vorsichtig. In einer Studie des NIM überschätzten synthetische Befragte bekannte Marken und unterschätzten weniger bekannte. Gerade das Konzept, das mit Gewohnheiten bricht, kann im Screening deshalb zu früh ausscheiden. Es lohnt sich, bewusst ein abweichendes Konzept weiterzugeben.

Auch der Verhaltenstest hat Grenzen: Er prüft wenige ausgereifte Varianten, nicht dutzende Rohideen, und er braucht einen Reiz, der wie ein echtes Angebot aussieht. Deshalb ergänzen sich beide Schritte, statt sich zu ersetzen.

Wie Horizon das einordnet

KI vergrößert den Trichter. Am Ende des Trichters steht der Verhaltenstest für die wenigen Varianten, in die tatsächlich investiert wird. Horizon misst dort die Kaufabsicht realer Menschen mit bis zu sechs Varianten, verkauft wird nichts.

Belege

Maier et al. 2025: Über 57 Befragungen zu Körperpflegeprodukten mit 9.300 Antworten erreichen simulierte Antworten 90 % der Test-Retest-Reliabilität menschlicher Befragter. Maßstab ist die in der Befragung angegebene Kaufabsicht, nicht Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv Preprint. Quelle

Brand, Israeli & Ngwe 2025: Ein Sprachmodell reproduziert Zahlungsbereitschaften aus Conjoint-Studien für bestehende Merkmale; für neue Merkmale braucht es Feinabstimmung mit früheren menschlichen Daten derselben Kategorie, über fremde Kategorien hinweg hilft das kaum. Using LLMs for Market Research, MSI Working Paper. Quelle

NIM 2024/2025: Synthetische Befragte auf GPT-4-Basis weichen bei 75 % (Softdrinks) bzw. 80 % (Sportbekleidung) der Fragen deutlich von 500 realen Befragten ab, überschätzen bekannte Marken, unterschätzen weniger bekannte und antworten positiver und mit weniger Streuung. Synthetische Befragte, Forschungsvorhaben des Nürnberg Institut für Marktentscheidungen. Quelle

Häufige Fragen

Ersetzt KI-Konzeptscreening eine Befragung?

Für eine erste Vorauswahl kann es eine Befragung oft vorziehen und verkürzen. Für die Frage, welches Konzept Menschen wählen, liefert es keine eigene Evidenz, weil es an Befragungen kalibriert ist.

Wie viele Konzepte sollten nach dem Screening in einen Verhaltenstest gehen?

Meist zwei bis sechs. Sinnvoll ist, neben den Spitzenreitern ein bewusst abweichendes Konzept mitzunehmen, weil Modelle Ungewohntes eher unterschätzen.

Taugt KI-Konzeptscreening auch für Preise?

Für eine grobe Einordnung von Preisankern ja. Zahlungsbereitschaft für neue Angebote bleibt eine Verhaltensfrage.

Welche Ihrer vorsortierten Konzepte verdienen einen Verhaltenstest?

Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis