Horizon
Startseite
/
Glossar
/
Statistische Signifikanz

Statistische Signifikanz

Statistische Signifikanz bedeutet, dass ein beobachteter Unterschied zwischen Varianten so groß ist, dass er unter der Annahme, es gäbe keinen echten Unterschied, nur selten zufällig entstünde; meist wird dafür eine Schwelle von p unter 0,05 genutzt.

Aktualisiert
September 28, 2026
· Horizon

In Variantentests entscheidet Signifikanz darüber, ob ein Unterschied als belastbar gilt. Sie ist ein wichtiges Werkzeug, wird aber oft überschätzt.

Warum das für Ihre Entscheidung wichtig ist

Zwei Varianten zeigen fast nie exakt dieselben Werte. Die Frage ist, ob der Abstand auf einen echten Unterschied im Verhalten hindeutet oder im Rahmen des Zufalls liegt. Ein Signifikanztest beantwortet genau diese Frage und schützt davor, auf einen Zufallsausschlag hin zu investieren.

Was er nicht beantwortet: wie groß und wie wichtig der Unterschied ist. Die American Statistical Association hält ausdrücklich fest, dass ein p-Wert weder die Größe eines Effekts misst noch die Bedeutung eines Ergebnisses, und dass Geschäftsentscheidungen nicht allein an einer Schwelle hängen sollten.

Beispiel: Rechnung mit zwei Varianten

Zwei Angebotsseiten für eine Akku-Küchenmaschine, je 2.000 Besucher. Variante A: 80 Klicks auf "In den Warenkorb" (4,0 %). Variante B: 100 Klicks (5,0 %). Der Abstand wirkt deutlich, ein Viertel mehr Kaufabsicht.

Der Zwei-Stichproben-Test für Anteile ergibt einen z-Wert von etwa 1,53 und einen p-Wert von etwa 0,13. Bei der üblichen Schwelle von 0,05 ist der Unterschied nicht signifikant: Ein Abstand dieser Größe entsteht bei dieser Stichprobe auch ohne echten Unterschied in etwa 13 von 100 Fällen.

Mit je 5.000 Besuchern und denselben Anteilen (200 gegenüber 250 Klicks) liegt der p-Wert bei etwa 0,016. Der gleiche Abstand ist jetzt signifikant, weil die größere Stichprobe den Zufallsspielraum verkleinert.

Wie Horizon Signifikanz nutzt

Die Signifikanz auf der primären Kennzahl ist eine von mehreren Bedingungen für einen Sieger. Zusätzlich muss die Wahrscheinlichkeit, die beste Variante zu sein, eine vorab festgelegte Schwelle erreichen, und der Vorsprung muss zu den vorgelagerten Schritten passen, also kein Effekt der Anzeigen sein. Alle Werte werden aus den Rohzahlen neu berechnet. Ergebnisse werden als bestätigt, richtungsweisend oder nicht eindeutig eingeordnet.

Abgrenzung

Das Konfidenzintervall zeigt die Spanne, in der der wahre Wert plausibel liegt, und damit auch die Größe des Unterschieds. Die Wahrscheinlichkeit, die beste Variante zu sein, ist eine bayesianische Größe und beantwortet eine andere Frage: Wie sicher liegt eine Variante vorn? Praktische Relevanz ist eine inhaltliche Frage: Lohnt sich ein Unterschied dieser Größe für das Geschäft?

Grenzen

Signifikanz hängt stark von der Stichprobe ab. Bei sehr großen Stichproben wird fast jeder Unterschied signifikant, bei kleinen kaum einer. Wer während des Tests wiederholt prüft und beim ersten signifikanten Wert stoppt, erhöht die Quote falscher Treffer deutlich; deshalb gehört eine Stopp-Regel dazu.

Auch ein sauber signifikantes Ergebnis im Verhaltenstest sagt nichts über Effekte, die der Test nicht abbildet, etwa Wiederkauf oder Reaktionen des Wettbewerbs. Nicht signifikant heißt außerdem nicht "kein Unterschied", sondern: Die Daten reichen nicht, um einen Unterschied sicher zu belegen.

Belege

Wasserstein & Lazar 2016: Die American Statistical Association hält fest: Ein p-Wert misst weder die Größe eines Effekts noch seine Bedeutung, und Geschäftsentscheidungen sollten nicht allein daran hängen, ob ein p-Wert eine Schwelle unterschreitet. The ASA Statement on p-Values: Context, Process, and Purpose, The American Statistician 70(2). Quelle

Simmons, Nelson & Simonsohn 2011: Simulation: Wer ab 10 Beobachtungen je Gruppe nach jeweils 10 weiteren prüft und bei p < 0,05 stoppt, erhält 14,3 % statt 5 % falsch positive Ergebnisse; bei Prüfung nach jeder Beobachtung 22,1 %. False-Positive Psychology, Psychological Science 22(11). Quelle

Häufige Fragen

Heißt signifikant, dass der Unterschied groß ist?

Nein. Signifikanz sagt, dass ein Unterschied wahrscheinlich nicht zufällig ist. Wie groß er ist, zeigt das Konfidenzintervall.

Was bedeutet ein nicht signifikantes Ergebnis?

Die Daten reichen nicht aus, um einen Unterschied sicher zu belegen. Ein kleiner Unterschied oder Gleichstand kann trotzdem eine valide Erkenntnis sein.

Warum reicht Signifikanz allein nicht für einen Sieger?

Weil sie nur eine Frage beantwortet. Horizon prüft zusätzlich die Wahrscheinlichkeit, die beste Variante zu sein, und ob der Vorsprung über den Ablauf hinweg stimmig ist.

Wann ist der Unterschied bei Ihrer Frage belastbar?

Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis