



Statistische Signifikanz bedeutet, dass ein beobachteter Unterschied zwischen Varianten so groß ist, dass er unter der Annahme, es gäbe keinen echten Unterschied, nur selten zufällig entstünde; meist wird dafür eine Schwelle von p unter 0,05 genutzt.
In Variantentests entscheidet Signifikanz darüber, ob ein Unterschied als belastbar gilt. Sie ist ein wichtiges Werkzeug, wird aber oft überschätzt.
Zwei Varianten zeigen fast nie exakt dieselben Werte. Die Frage ist, ob der Abstand auf einen echten Unterschied im Verhalten hindeutet oder im Rahmen des Zufalls liegt. Ein Signifikanztest beantwortet genau diese Frage und schützt davor, auf einen Zufallsausschlag hin zu investieren.
Was er nicht beantwortet: wie groß und wie wichtig der Unterschied ist. Die American Statistical Association hält ausdrücklich fest, dass ein p-Wert weder die Größe eines Effekts misst noch die Bedeutung eines Ergebnisses, und dass Geschäftsentscheidungen nicht allein an einer Schwelle hängen sollten.
Zwei Angebotsseiten für eine Akku-Küchenmaschine, je 2.000 Besucher. Variante A: 80 Klicks auf "In den Warenkorb" (4,0 %). Variante B: 100 Klicks (5,0 %). Der Abstand wirkt deutlich, ein Viertel mehr Kaufabsicht.
Der Zwei-Stichproben-Test für Anteile ergibt einen z-Wert von etwa 1,53 und einen p-Wert von etwa 0,13. Bei der üblichen Schwelle von 0,05 ist der Unterschied nicht signifikant: Ein Abstand dieser Größe entsteht bei dieser Stichprobe auch ohne echten Unterschied in etwa 13 von 100 Fällen.
Mit je 5.000 Besuchern und denselben Anteilen (200 gegenüber 250 Klicks) liegt der p-Wert bei etwa 0,016. Der gleiche Abstand ist jetzt signifikant, weil die größere Stichprobe den Zufallsspielraum verkleinert.
Die Signifikanz auf der primären Kennzahl ist eine von mehreren Bedingungen für einen Sieger. Zusätzlich muss die Wahrscheinlichkeit, die beste Variante zu sein, eine vorab festgelegte Schwelle erreichen, und der Vorsprung muss zu den vorgelagerten Schritten passen, also kein Effekt der Anzeigen sein. Alle Werte werden aus den Rohzahlen neu berechnet. Ergebnisse werden als bestätigt, richtungsweisend oder nicht eindeutig eingeordnet.
Das Konfidenzintervall zeigt die Spanne, in der der wahre Wert plausibel liegt, und damit auch die Größe des Unterschieds. Die Wahrscheinlichkeit, die beste Variante zu sein, ist eine bayesianische Größe und beantwortet eine andere Frage: Wie sicher liegt eine Variante vorn? Praktische Relevanz ist eine inhaltliche Frage: Lohnt sich ein Unterschied dieser Größe für das Geschäft?
Signifikanz hängt stark von der Stichprobe ab. Bei sehr großen Stichproben wird fast jeder Unterschied signifikant, bei kleinen kaum einer. Wer während des Tests wiederholt prüft und beim ersten signifikanten Wert stoppt, erhöht die Quote falscher Treffer deutlich; deshalb gehört eine Stopp-Regel dazu.
Auch ein sauber signifikantes Ergebnis im Verhaltenstest sagt nichts über Effekte, die der Test nicht abbildet, etwa Wiederkauf oder Reaktionen des Wettbewerbs. Nicht signifikant heißt außerdem nicht "kein Unterschied", sondern: Die Daten reichen nicht, um einen Unterschied sicher zu belegen.
Wasserstein & Lazar 2016: Die American Statistical Association hält fest: Ein p-Wert misst weder die Größe eines Effekts noch seine Bedeutung, und Geschäftsentscheidungen sollten nicht allein daran hängen, ob ein p-Wert eine Schwelle unterschreitet. The ASA Statement on p-Values: Context, Process, and Purpose, The American Statistician 70(2). Quelle
Simmons, Nelson & Simonsohn 2011: Simulation: Wer ab 10 Beobachtungen je Gruppe nach jeweils 10 weiteren prüft und bei p < 0,05 stoppt, erhält 14,3 % statt 5 % falsch positive Ergebnisse; bei Prüfung nach jeder Beobachtung 22,1 %. False-Positive Psychology, Psychological Science 22(11). Quelle
Nein. Signifikanz sagt, dass ein Unterschied wahrscheinlich nicht zufällig ist. Wie groß er ist, zeigt das Konfidenzintervall.
Die Daten reichen nicht aus, um einen Unterschied sicher zu belegen. Ein kleiner Unterschied oder Gleichstand kann trotzdem eine valide Erkenntnis sein.
Weil sie nur eine Frage beantwortet. Horizon prüft zusätzlich die Wahrscheinlichkeit, die beste Variante zu sein, und ob der Vorsprung über den Ablauf hinweg stimmig ist.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten