



KI-Konzeptscreening ist die Vorauswahl von Produkt-, Tarif- oder Kommunikationskonzepten mit Sprachmodellen, die Befragte simulieren und Konzepte nach der zu erwartenden Zustimmung in einer Befragung ordnen, bevor reale Menschen befragt oder getestet werden.
Wer aus zwanzig Konzeptideen drei auswählen muss, kann mit einem Sprachmodell in Stunden eine erste Rangfolge bilden. Die Frage ist, was diese Rangfolge aussagt und was nicht.
Konzeptscreening mit KI verändert vor allem die Breite des Trichters. Wo früher fünf Konzepte in eine Befragung gingen, lassen sich heute dutzende Varianten von Nutzenversprechen, Tarifnamen oder Claims vorsortieren. Das spart Zeit und Budget in einer Phase, in der Fehler noch billig sind.
Gleichzeitig entsteht leicht ein Scheinergebnis: Eine saubere Rangfolge mit Prozentwerten wirkt wie ein Befund, beruht aber auf einem Modell, das wiedergibt, was Menschen gesagt und geschrieben haben. Für die Entscheidung, welches Konzept Budget bekommt, zählt deshalb, welche Frage das Screening beantwortet: Welche Konzepte sind plausibel und verständlich? Das kann es gut. Welches Konzept Menschen wählen, wenn es ein echtes Angebot mit Preis ist? Das zeigt ihr Verhalten.
Das betrifft nicht nur Innovationen. Auch bei Claims, Markenauftritten, Tarifnamen und Preisankern für bestehende Produkte wird KI-Screening heute genutzt, um die Zahl der Varianten vor einer Befragung oder einem Test zu verringern.
Ein Sprachmodell erhält Personenprofile, etwa Alter, Region und Haushaltssituation, und bewertet jedes Konzept so, wie es eine solche Person in einer Befragung tun würde. Neuere Verfahren lassen das Modell frei antworten und übersetzen den Text anschließend in eine Skala. Das Ergebnis ist eine Verteilung simulierter Zustimmungswerte je Konzept.
Eine Studie über 57 Befragungen zu Körperpflegeprodukten zeigt, wie weit das inzwischen reicht: Die simulierten Antworten erreichen einen Großteil der Wiederholungszuverlässigkeit menschlicher Befragter. Der Maßstab ist dabei die in der Befragung angegebene Kaufabsicht, nicht gemessenes Verhalten.
Ein Versicherer hat zwölf Konzepte für einen Zahnzusatztarif: unterschiedliche Leistungsschwerpunkte, Namen und Preisanker. Ein KI-Screening sortiert vier Konzepte aus, die für Zielgruppen über 50 unverständlich wirken, und markiert zwei Konzepte mit der höchsten simulierten Zustimmung, 71 und 68 von 100 Punkten.
Diese beiden und ein drittes, bewusst abweichendes Konzept gehen danach in einen Verhaltenstest mit realen Menschen. Dort zeigt sich, bei welcher Variante die gemessene Abschlussabsicht am höchsten ist, wenn Preis und Alternativen sichtbar sind.
Klassisches Konzept-Screening befragt reale Menschen zu Konzepten. KI-Konzeptscreening simuliert diese Befragung. Beide messen angegebene Zustimmung, also Stated Preference. Ein Verhaltenstest wie der Painted-Door-Test misst dagegen, ob Menschen in einer realistischen Angebotssituation handeln.
Von KI-generierten Konzepten unterscheidet sich das Screening dadurch, dass es nicht Ideen erzeugt, sondern vorhandene Ideen ordnet. In der Praxis laufen beide oft hintereinander.
Sprachmodelle neigen zur Mitte: Sie bevorzugen bekannte Muster und bewerten ungewöhnliche Konzepte eher vorsichtig. In einer Studie des NIM überschätzten synthetische Befragte bekannte Marken und unterschätzten weniger bekannte. Gerade das Konzept, das mit Gewohnheiten bricht, kann im Screening deshalb zu früh ausscheiden. Es lohnt sich, bewusst ein abweichendes Konzept weiterzugeben.
Auch der Verhaltenstest hat Grenzen: Er prüft wenige ausgereifte Varianten, nicht dutzende Rohideen, und er braucht einen Reiz, der wie ein echtes Angebot aussieht. Deshalb ergänzen sich beide Schritte, statt sich zu ersetzen.
KI vergrößert den Trichter. Am Ende des Trichters steht der Verhaltenstest für die wenigen Varianten, in die tatsächlich investiert wird. Horizon misst dort die Kaufabsicht realer Menschen mit bis zu sechs Varianten, verkauft wird nichts.
Maier et al. 2025: Über 57 Befragungen zu Körperpflegeprodukten mit 9.300 Antworten erreichen simulierte Antworten 90 % der Test-Retest-Reliabilität menschlicher Befragter. Maßstab ist die in der Befragung angegebene Kaufabsicht, nicht Verhalten. LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings, arXiv Preprint. Quelle
Brand, Israeli & Ngwe 2025: Ein Sprachmodell reproduziert Zahlungsbereitschaften aus Conjoint-Studien für bestehende Merkmale; für neue Merkmale braucht es Feinabstimmung mit früheren menschlichen Daten derselben Kategorie, über fremde Kategorien hinweg hilft das kaum. Using LLMs for Market Research, MSI Working Paper. Quelle
NIM 2024/2025: Synthetische Befragte auf GPT-4-Basis weichen bei 75 % (Softdrinks) bzw. 80 % (Sportbekleidung) der Fragen deutlich von 500 realen Befragten ab, überschätzen bekannte Marken, unterschätzen weniger bekannte und antworten positiver und mit weniger Streuung. Synthetische Befragte, Forschungsvorhaben des Nürnberg Institut für Marktentscheidungen. Quelle
Für eine erste Vorauswahl kann es eine Befragung oft vorziehen und verkürzen. Für die Frage, welches Konzept Menschen wählen, liefert es keine eigene Evidenz, weil es an Befragungen kalibriert ist.
Meist zwei bis sechs. Sinnvoll ist, neben den Spitzenreitern ein bewusst abweichendes Konzept mitzunehmen, weil Modelle Ungewohntes eher unterschätzen.
Für eine grobe Einordnung von Preisankern ja. Zahlungsbereitschaft für neue Angebote bleibt eine Verhaltensfrage.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten