



Evidenz im Innovationsprozess ist die Gesamtheit der Belege, auf die sich Entscheidungen über neue Angebote, Preise, Tarife und Konzepte stützen, idealerweise gemessen, bevor Budget gebunden wird, und nicht erst nach dem Launch.
Die meisten Unternehmen haben einen geordneten Prozess mit Phasen und Freigaben. Offen ist oft, welche Art von Beleg an welcher Stelle ausreicht, und ob darunter auch beobachtetes Verhalten realer Menschen ist.
In jedem Innovations- oder Pricing-Prozess gibt es Momente, in denen Geld, Zeit und Aufmerksamkeit festgelegt werden: die Freigabe der Entwicklung, die Wahl des Tarifmodells, die Entscheidung für einen Preis oder ein Markenversprechen. Welche Belege an diesen Stellen auf dem Tisch liegen, bestimmt die Qualität der Entscheidung stärker als die Zahl der Workshops davor.
Belege lassen sich grob in drei Arten einteilen. Erstens Einschätzungen: Erfahrung, interne Abstimmung, Expertenmeinung, Analogien zu früheren Launches. Zweitens Angaben: Befragungen, Konzepttests, Conjoint, Interviews und Fokusgruppen, also das, was Menschen über ihr künftiges Verhalten sagen. Drittens Verhalten: was Menschen tun, wenn sie einem konkreten Angebot mit Preis und Alternativen gegenüberstehen.
Alle drei haben ihren Platz. Einschätzungen sind schnell und bündeln Wissen. Befragungen erklären Motive, Treiber und Einwände und helfen, viele Optionen zu ordnen. Verhalten beantwortet die Frage, ob ein Angebot gewählt wird. Evidenz im Innovationsprozess heißt deshalb nicht, eine Methode durch eine andere zu ersetzen, sondern jeder Frage die passende Belegart zuzuordnen und vor den teuren Entscheidungen einen Verhaltensbeleg einzuplanen.
Warum Angaben allein für die teuren Entscheidungen selten reichen, ist gut untersucht. Eine Meta-Analyse von 47 Experimenten zeigt: Wird die Absicht mit mittlerer bis großer Stärke verändert (d = 0,66), ändert sich das Verhalten nur klein bis mittel (d = 0,36) (Webb & Sheeran 2006). Absichten werden nach einer Übersicht derselben Autoren etwa in der Hälfte der Fälle in Handlung umgesetzt (Sheeran & Webb 2016).
Für Preise gilt Ähnliches. Über 77 Studien liegt die hypothetisch genannte Zahlungsbereitschaft im Schnitt 21 Prozent über der realen (Schmidt & Bijmolt 2020). Und gerade bei neuen Produkten bildet die erfragte Kaufabsicht den späteren Absatz schlechter ab als bei bestehenden (Morwitz, Steckel & Gupta 2007). Hinzu kommt ein Messeffekt: Bei Kunden, die befragt wurden, ist der Zusammenhang zwischen Absicht und Kauf 58 Prozent stärker als bei nicht befragten, das Befragen selbst verändert also das spätere Verhalten (Chandon, Morwitz & Reinartz 2005).
Auf der anderen Seite steht die Flop-Rate. Häufig ist von 80 oder 90 Prozent gescheiterter Produkte die Rede. Castellion & Markham (2013) zeigen, dass diese Zahl ein Mythos ist: Empirische Studien seit 1977 finden eine Flop-Rate von 40 Prozent oder weniger. Das ist weniger dramatisch, aber immer noch viel, wenn hinter jedem Launch Entwicklung, Werkzeuge, Verpackung, Vertrieb und Marketing stehen.
Die Lücke zwischen Angabe und Verhalten hat keine feste Größe und keine feste Richtung. Sie hängt von Kategorie, Preisniveau, Wettbewerb und Situation ab. Ein pauschaler Korrekturfaktor auf Befragungsergebnisse hilft deshalb wenig. Wer wissen will, wie groß die Lücke bei der eigenen Frage ist, muss das Verhalten beobachten.
Je teurer und schwerer umkehrbar eine Entscheidung ist, desto mehr Gewicht verdient der Verhaltensbeleg. Das betrifft nicht nur neue Produkte: Auch eine Preiserhöhung im Bestand, ein neuer Tarif, ein neues Markenversprechen oder die Frage, welche von drei Ausstattungsvarianten in Serie geht, sind Entscheidungen, die sich vor der Umsetzung am Verhalten prüfen lassen.
Der Zeitpunkt entscheidet über den Nutzen. Verhalten nach dem Launch zu messen, ist wertvoll für die Optimierung, kommt aber, wenn das Budget gebunden ist. Verhaltensevidenz vor dem Budget verschiebt den Moment der Wahrheit nach vorn, in eine Phase, in der Varianten noch billig zu ändern sind.
Schließlich verändert Evidenz die Diskussion im Gremium. Wo sonst die überzeugendste Präsentation oder die ranghöchste Meinung den Ausschlag gibt, liegt dann ein gemeinsamer Datenpunkt auf dem Tisch. Das macht Entscheidungen schneller und im Nachhinein nachvollziehbar, auch wenn ein Launch später hinter den Erwartungen bleibt.
Der wirksamste Hebel ist organisatorisch, nicht methodisch: Vor der Investitionsfreigabe wird ein Verhaltenstest als Gate verankert, ein Behavioural Gate. Damit ist geregelt, dass eine teure Entscheidung nicht allein auf Einschätzungen und Angaben beruht.
Damit ein solches Gate trägt, werden vor dem Test drei Dinge festgelegt. Die primäre Kennzahl, also welcher Schritt im Angebotsablauf als gemessene Kaufabsicht oder Abschlussabsicht zählt. Die Stichprobengröße, damit ein Unterschied zwischen Varianten statistisch belastbar erkennbar ist. Und eine Stopp-Regel, damit niemand den Test beendet, sobald das Ergebnis gefällt. Wer diese Punkte vorab schriftlich festhält, macht das Ergebnis auch für Skeptiker im Gremium nachvollziehbar.
In der Praxis wächst die Rolle von Verhaltensevidenz meist schrittweise: ein erster Test an einer anstehenden Entscheidung, dann eine Wiederholung an einer zweiten, dann eine interne Schwelle, ab der ein Gate als bestanden gilt. Viele Organisationen experimentieren bereits, ohne dass Verhaltensbelege fester Teil der Freigabe sind. Der Schritt vom Experiment zur Regel ist der eigentliche Wechsel.
Horizon setzt den Verhaltenstest als Painted-Door-Test um: realistische Angebotsseiten, ausgespielt über Google- und Meta-Anzeigen an reale Menschen im gewohnten Online-Umfeld, ohne Panel und ohne Incentive, mit bis zu sechs Varianten. Verkauft wird nichts. Wer sich für ein Angebot entscheidet, erfährt im Anschluss transparent, dass es sich um einen Test handelt. Von der Frage bis zur Datenauswertung vergehen rund vier Wochen. Die Entscheidung treffen die Verantwortlichen, Horizon liefert die Datenanalyse.
Ideenfindung: Hier zählt Breite. Workshops, Trendanalysen, Kundeninterviews und KI-gestützte Ideengenerierung liefern Rohmaterial. Belege im engeren Sinn braucht es noch nicht, wohl aber eine klare Frage, welches Problem gelöst werden soll.
Konzept und Vorauswahl: Aus vielen Ideen werden wenige. Konzept-Screening per Befragung, MaxDiff oder Expertenurteil ordnet schnell und günstig. Das Ergebnis ist eine kurze Liste, keine Investitionsgrundlage.
Business Case und Freigabe: Hier wird das größte Budget gebunden, und hier gehört der Verhaltensbeleg hin. Die finalen Varianten, etwa zwei Versprechen, drei Preise oder vier Konzepte, werden als realistische Angebote gestaltet und im Verhalten realer Menschen geprüft. Das Ergebnis fließt in das Gate ein, zusammen mit Kosten, Technik und Strategie.
Entwicklung und Launch: Jetzt geht es um das Wie. MVP, Pilotserie, Feldtest und A/B-Tests im Live-System optimieren Umsetzung, Nutzung und Ansprache. Absatz- und Nutzungsdaten zeigen, ob die Annahmen tragen, und liefern die Grundlage für den nächsten Zyklus.
Einschätzung und Desk Research: schnell und günstig, geeignet für die erste Einordnung eines Marktes. Sie ersetzen keine Messung beim Kunden.
Befragung, Konzepttest, Conjoint und MaxDiff: stark, um viele Ideen oder Merkmale zu ordnen, Motive zu verstehen und Zielgruppen zu beschreiben. Wahlbasierte Verfahren verringern die hypothetische Verzerrung, bleiben aber Angaben ohne Konsequenz.
KI-gestützte Verfahren: Generative KI hat die frühen Phasen stark beschleunigt. Konzepte, Claims und Varianten entstehen in Minuten, synthetische Befragte liefern erste Einschätzungen zu Segmenten und Einwänden. KI vergrößert den Trichter. Am Ende des Trichters steht der Verhaltenstest für die wenigen Varianten, in die tatsächlich investiert wird.
Ein Sprachmodell gibt wieder, was Menschen gesagt und geschrieben haben. Auch Studien, die synthetischen Befragten eine hohe Übereinstimmung bescheinigen, messen sie an Befragungen, nicht an Verhalten. Für Angebote, die es noch nicht gibt, fehlt zudem oft die Datengrundlage. Deshalb bleibt beobachtetes Verhalten der Maßstab für die teuren Entscheidungen, während KI die Arbeit davor schneller und breiter macht.
Painted-Door-Test und Pretotyping: messen Kauf- oder Abschlussabsicht an einem realistischen Angebot, bevor das Produkt existiert oder der Preis im Markt steht. Geeignet für die wenigen finalen Varianten vor der Investition.
A/B-Test im Live-System: optimiert Bestehendes, wenn alle Varianten ausgeliefert werden können. Er beantwortet die Frage nach dem Wie, der Painted-Door-Test die Frage nach dem Ob.
Pre-Order und MVP: bringen echte Zahlungen oder ein funktionierendes Minimalprodukt ins Spiel. Sie liefern starke Belege, setzen aber eine Lieferzusage oder Entwicklungsaufwand voraus.
Ein Hausgerätehersteller hat vier Konzepte für eine Akku-Küchenmaschine in der engeren Auswahl. Ein Konzepttest mit Befragung hat die Liste von zwölf auf vier verkürzt, alle vier erreichen hohe Zustimmungswerte. Vor der Freigabe der Werkzeugkosten verlangt die Geschäftsführung einen Verhaltensbeleg.
Im Painted-Door-Test sieht jede Person genau ein Konzept als realistisches Angebot mit Preis. Pro Variante erreichen rund 2.500 Besucher die Angebotsseite. Als primäre Kennzahl gilt der Klick auf „Jetzt vorbestellen“ mit anschließender Angabe der E-Mail-Adresse. Konzept B erreicht 3,1 Prozent, Konzept A 2,0 Prozent, C und D liegen darunter. Der Unterschied zwischen B und A ist statistisch belastbar. Im Konzepttest lagen A und B fast gleichauf, A sogar knapp vorn.
Das Gremium hat damit einen Datenpunkt, der zeigt, welches Konzept gewählt wird, wenn Preis und Alternativen sichtbar sind. Ob B in Serie geht, entscheidet es weiterhin selbst, zusammen mit Kosten, Technik und Strategie.
Ausgangslage: Die Flop-Rate neuer Produkte zeigt, wie viel auf dem Spiel steht, und warum die oft zitierten 80 Prozent nicht belegt sind. Evidenzbasierte Innovation beschreibt das Prinzip, Entscheidungen auf den besten verfügbaren Beleg zu stützen.
Prozess und Governance: Der Stage-Gate-Prozess gliedert Entwicklung in Phasen und Freigaben. Das Behavioural Gate verankert davor einen Verhaltenstest. Die Go/No-Go-Entscheidung fällt am Gate. Decision Intelligence stellt die Entscheidung vor den Datensatz.
Vorauswahl und Inhalt: Konzept-Screening sortiert viele Ideen vor. Value Proposition testen prüft, welches Versprechen gewählt wird. Test-and-Learn beschreibt die Arbeitsweise, große Wetten in kleinen Tests vorzubereiten.
Methoden: Pretotyping, Nachfragevalidierung, Pre-Launch-Test, Smoke Test, Konzepttest, Pre-Order-Test und Minimum Viable Product unterscheiden sich darin, ob ein Produkt schon existiert, ob gezahlt wird und was gemessen wird.
Messung und Statistik: Primäre Kennzahl, Statistische Signifikanz, Stichprobengröße, Wahrscheinlichkeit, die beste Variante zu sein, Stopp-Regel und Benchmark sorgen dafür, dass ein Testergebnis belastbar ist und richtig eingeordnet wird.
Verhaltensevidenz vor dem Launch ist kein Ersatz für den Markt. Ein Painted-Door-Test misst die Reaktion auf ein Angebot in einem bestimmten Kanal zu einem bestimmten Zeitpunkt. Wiederkauf, Zufriedenheit nach der Nutzung, Reaktionen des Wettbewerbs und Effekte im stationären Handel bildet er nicht ab.
Die Qualität des Ergebnisses hängt am Testdesign. Unterscheiden sich Varianten in mehr als der geprüften Größe, ist unklar, was den Unterschied erklärt. Zu kleine Stichproben oder ein zu früher Stopp erzeugen Scheinsieger. Deshalb gehören primäre Kennzahl, Stichprobe und Stopp-Regel vor den Start.
Nicht jede Entscheidung braucht einen Verhaltenstest. Bei günstigen, leicht umkehrbaren Entscheidungen oder Produkten mit sehr niedrigem Preis steht der Aufwand oft in keinem Verhältnis zum Risiko. Und das Warum hinter einem Ergebnis erklärt eine Befragung oder ein Interview meist besser als der Test selbst. Beides zusammen ergibt das vollständigere Bild.
Webb & Sheeran 2006: 47 Experimente: Eine mittlere bis große Änderung der Absicht (d = 0,66) bewirkt nur eine kleine bis mittlere Änderung des Verhaltens (d = 0,36). Does changing behavioral intentions engender behavior change? A meta-analysis of the experimental evidence, Psychological Bulletin. Quelle
Schmidt & Bijmolt 2020: 77 Studien, 115 Effektgrößen: Hypothetisch genannte Zahlungsbereitschaft liegt im Schnitt 21 % über der realen. Accurately measuring willingness to pay for consumer goods: a meta-analysis of the hypothetical bias, Journal of the Academy of Marketing Science. Quelle
Morwitz, Steckel & Gupta 2007: Meta-Analyse: Erfragte Kaufabsicht bildet den späteren Absatz bei neuen Produkten schlechter ab als bei bestehenden. International Journal of Forecasting 23(3). Quelle
Chandon, Morwitz & Reinartz 2005: Bei befragten Kunden ist der Zusammenhang zwischen Absicht und Kauf 58 % stärker als bei nicht befragten: Das Befragen selbst bläht die Validität auf. Journal of Marketing 69(2). Quelle
Castellion & Markham 2013: Die verbreitete Annahme, 80 % oder mehr neuer Produkte scheiterten, ist ein Mythos; empirische Studien seit 1977 finden eine Flop-Rate von 40 % oder weniger. Perspective: New Product Failure Rates: Influence of Argumentum ad Populum and Self-Interest, Journal of Product Innovation Management. Quelle
Einschätzungen, Angaben aus Befragungen und beobachtetes Verhalten. Alle drei haben ihren Platz; für teure, schwer umkehrbare Entscheidungen sollte mindestens ein Beleg aus beobachtetem Verhalten stammen.
Nein. Befragungen erklären Motive und ordnen viele Optionen, der Verhaltenstest prüft die wenigen finalen Varianten. Beides ergänzt sich.
Vor die Freigabe, die das größte Budget bindet: meist vor Entwicklung, Werkzeugkosten, Tarifumstellung oder Preisänderung. Dann sind Varianten noch billig zu ändern.
Nein. Preise, Tarife, Claims, Markenversprechen und Ausstattungsvarianten bestehender Produkte lassen sich ebenso vorab am Verhalten prüfen.
Von der Frage bis zur Datenauswertung rund vier Wochen, mit bis zu sechs Varianten. Verkauft wird nichts, wer sich für ein Angebot entscheidet, wird im Anschluss transparent informiert.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten