



KI-generierte Konzepte testen heißt, von Sprachmodellen erzeugte Produkt-, Tarif- oder Claim-Ideen erst vorzusortieren und die wenigen Varianten, in die investiert werden soll, anschließend im Verhalten realer Menschen zu prüfen.
Generative KI hat die Ideenfindung beschleunigt. Wo früher ein Workshop zehn Konzepte lieferte, liefert ein Modell in Minuten hundert. Der Engpass hat sich damit von der Ideenmenge zur Bewertung verschoben.
KI vergrößert den Trichter. Am Ende des Trichters steht der Verhaltenstest für die wenigen Varianten, in die tatsächlich investiert wird. Dazwischen liegt die eigentliche Arbeit: aus vielen plausiblen Konzepten die auszuwählen, die eine Prüfung verdienen.
Die Forschung zeigt, dass KI-Ideen gut abschneiden können. In einer Studie der Wharton School stammten unter den besten zehn Prozent von 400 Produktideen 35 von 40 von GPT-4 (Girotra et al. 2023). Bemerkenswert ist der Maßstab: Bewertet wurde mit erfragter Kaufabsicht auf einer Skala. Die Studie belegt also, dass KI-Ideen in Befragungen überzeugen. Ob Menschen sie wählen, wenn Preis und Alternativen sichtbar sind, ist eine andere Frage.
Ein zweiter Befund betrifft die Vielfalt. Ideenpools eines Sprachmodells fallen ähnlicher aus als die von Gruppen menschlicher Teilnehmer, gezieltes Prompting verringert den Abstand deutlich (Meincke, Mollick & Terwiesch 2024). Für die Vorauswahl heißt das: Viele Konzepte können sich im Kern ähneln. Umso wichtiger ist, dass die finalen Varianten sich klar in einer Größe unterscheiden, damit ein Test eine eindeutige Antwort geben kann.
Erstens: breit erzeugen, mit KI und mit Menschen. Zweitens: vorsortieren, etwa über Machbarkeit, strategische Passung, ein Konzept-Screening per Befragung oder ein KI-Konzeptscreening. Drittens: die zwei bis sechs Varianten, zwischen denen die Investitionsentscheidung fällt, als realistische Angebote gestalten und im Verhaltenstest prüfen. Viertens: das Warum hinter dem Ergebnis mit Befragung oder Interviews vertiefen.
Ein Konsumgüterhersteller lässt ein Sprachmodell 60 Claim-Ideen für eine neue Spülmaschinen-Tab-Linie erzeugen. Das Team sortiert auf zwölf vor, eine Befragung verkürzt auf vier. Im Painted-Door-Test sieht jede Person ein Angebot mit genau einem der vier Claims, Preis und Packung sind identisch. Pro Variante erreichen rund 2.000 Besucher die Angebotsseite. Der Claim, der in der Befragung auf Platz drei lag, erreicht mit 3,4 Prozent die höchste gemessene Kaufabsicht, der Befragungssieger 2,5 Prozent.
KI-Konzeptscreening bewertet Konzepte mit einem Modell, etwa über synthetische Befragte. Das ist ein Schritt der Vorauswahl. KI-generierte Konzepte testen beschreibt den gesamten Ablauf von der Erzeugung bis zum Verhaltenstest. Synthetische Befragte machen die Exploration schneller: Hypothesen, Segmente, eine erste Vorauswahl. Ob Menschen ein neues Angebot wählen, zeigt ihr Verhalten.
Die zitierten Studien stammen aus bestimmten Kategorien und Zielgruppen und lassen sich nicht ohne Weiteres übertragen. Die Modelle entwickeln sich schnell, Aussagen über ihre Stärken können in einem Jahr anders ausfallen. Auch ein Verhaltenstest hat Grenzen: Er prüft nur die Varianten, die man hineingibt. Wird in der Vorauswahl ein starkes Konzept aussortiert, kann der Test das nicht korrigieren.
Horizon prüft die finalen Varianten im Painted-Door-Test mit realen Menschen im gewohnten Online-Umfeld, ohne Panel und ohne Incentive. Verkauft wird nichts.
Girotra, Meincke, Terwiesch & Ulrich 2023: Unter den besten 10 % von 400 Produktideen stammten 35 von 40 von GPT-4. Gemessen wurde die Qualität mit erfragter Kaufabsicht auf einer Fünf-Punkte-Skala. Ideas are Dimes a Dozen: Large Language Models for Idea Generation in Innovation, Working Paper (Wharton, SSRN 4526071). Quelle
Meincke, Mollick & Terwiesch 2024: Ideenpools von GPT-4 sind weniger vielfältig als die von Gruppen menschlicher Teilnehmer; gezieltes Prompting verringert den Abstand deutlich. Prompting Diverse Ideas: Increasing AI Idea Variance, Working Paper (arXiv 2402.01727). Quelle
Morwitz, Steckel & Gupta 2007: Meta-Analyse: Erfragte Kaufabsicht bildet den späteren Absatz bei neuen Produkten schlechter ab als bei bestehenden. International Journal of Forecasting 23(3). Quelle
Für die Vorauswahl ist das sinnvoll. Studien zur Übereinstimmung messen synthetische Befragte an Befragungen, nicht an Verhalten, deshalb kommen die finalen Varianten vor der Investition in einen Verhaltenstest.
Zwei bis sechs, die sich klar in einer Größe unterscheiden, etwa im Versprechen, im Preis oder im Claim.
Das klärt Ihre Rechtsabteilung. Im Test wird nichts verkauft, und wer sich für ein Angebot entscheidet, erfährt im Anschluss, dass es sich um einen Test handelt.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten