Horizon
Startseite
/
Glossar
/
Stopp-Regel

Stopp-Regel

Eine Stopp-Regel legt vor dem Start eines Tests fest, unter welchen Bedingungen er beendet wird und wann ein Ergebnis als entschieden gilt; sie verhindert, dass ein Test genau dann gestoppt wird, wenn die Zahlen gerade passen.

Aktualisiert
September 28, 2026
· Horizon

Laufende Tests laden zum Nachsehen ein. Wer beim ersten günstigen Zwischenstand stoppt, überschätzt die Sicherheit seines Ergebnisses. Eine Stopp-Regel trennt die Planung von der Auswertung.

Warum das für Ihre Entscheidung wichtig ist

Zwischenstände schwanken, besonders in den ersten Tagen. Wer täglich prüft und stoppt, sobald ein Unterschied signifikant aussieht, erhöht die Quote falscher Treffer deutlich. Eine viel zitierte Simulation zeigt: Prüft man nach jeweils zehn zusätzlichen Beobachtungen je Gruppe und stoppt beim ersten p-Wert unter 0,05, steigt der Anteil falsch positiver Ergebnisse von 5 % auf 14,3 %.

Für die Entscheidung heißt das: Ein Sieger, der nur durch geschicktes Stoppen entstanden ist, hält im Markt nicht. Die Stopp-Regel macht das Ergebnis verteidigbar, auch gegenüber Kolleginnen und Kollegen, die ein anderes Ergebnis erwartet haben.

Was eine Stopp-Regel festlegt

Eine gute Stopp-Regel beantwortet vor dem Start vier Fragen: Welche Kennzahl entscheidet? Ab welcher Sicherheit gilt eine Variante als vorn? Welche Datenbasis ist mindestens nötig, bevor ein vorzeitiges Ende in Frage kommt? Und wann ist spätestens Schluss, auch ohne klares Ergebnis?

Hinzu kommen Abbruchbedingungen für den Fall, dass ein Test technisch nicht funktioniert, etwa wenn Anzeigen nicht ausgeliefert werden oder die Kosten je Besucher deutlich über der Planung liegen.

Wie Horizon das umsetzt

Vor dem Start werden zwei Regeln im Testdesign festgeschrieben. Die Stopp-Regel: Ein vorzeitiges Ende ist möglich, wenn die Wahrscheinlichkeit, die beste Variante zu sein, die Schwelle des Testtyps erreicht (90 %, bei Preisunterschieden 95 %) und die Datenbasis ausreicht; die geplante Höchstzahl an Besuchern beendet den Test in jedem Fall. Die Siegerregel: signifikanter Unterschied auf der primären Kennzahl, P(best) über der Schwelle und ein Vorsprung, der zu den vorgelagerten Schritten passt.

Zusätzlich zählt der Messzeitraum: Ein Test soll möglichst eine ganze Woche einschließlich Wochenende abdecken, weil sich Verhalten am Wochenende ändert. Technische Abbrüche werden nicht vor dem dritten Tag entschieden.

Beispiel

Drei Tarifseiten, je 2.200 Besucher nach vier Tagen: 4,0 %, 5,0 % und 4,3 %. Die mittlere Variante liegt mit einem P(best) von etwa 83 % vorn. Die Schwelle von 90 % ist nicht erreicht, und der Messzeitraum enthält noch kein Wochenende.

Nach der Regel läuft der Test weiter, obwohl der Zwischenstand verlockend aussieht. Ohne Regel wäre an dieser Stelle die Versuchung groß, die führende Variante auszurufen.

Abgrenzung

Die Stopp-Regel ist nicht dasselbe wie die Stichprobenplanung: Die Planung legt fest, wie viele Besucher angestrebt werden, die Stopp-Regel, wann das Ergebnis gelesen und der Test beendet wird. Sequenzielle Testverfahren sind eine statistische Form, das wiederholte Prüfen von vornherein einzurechnen.

Grenzen

Keine Regel ersetzt das Urteil über die Qualität des Messzeitraums. Mehr Besucher gleichen einen schiefen Zeitraum nicht aus. Eine Stopp-Regel kann außerdem nur verhindern, dass zu früh entschieden wird. Sie garantiert kein eindeutiges Ergebnis: Endet ein Test ohne klaren Sieger, ist das ein valides Ergebnis, etwa dass zwei Varianten gleich stark sind.

Belege

Simmons, Nelson & Simonsohn 2011: Simulation: Wer ab 10 Beobachtungen je Gruppe nach jeweils 10 weiteren prüft und bei p < 0,05 stoppt, erhält 14,3 % statt 5 % falsch positive Ergebnisse; bei Prüfung nach jeder Beobachtung 22,1 %. False-Positive Psychology, Psychological Science 22(11). Quelle

Wasserstein & Lazar 2016: Die American Statistical Association hält fest: Ein p-Wert misst weder die Größe eines Effekts noch seine Bedeutung, und Geschäftsentscheidungen sollten nicht allein daran hängen, ob ein p-Wert eine Schwelle unterschreitet. The ASA Statement on p-Values: Context, Process, and Purpose, The American Statistician 70(2). Quelle

Häufige Fragen

Darf man einen laufenden Test ansehen?

Ja, zur Kontrolle der Technik und der Auslieferung. Entschieden wird aber nur nach der vorab festgelegten Regel.

Warum nicht einfach stoppen, sobald es signifikant ist?

Weil wiederholtes Prüfen die Quote falscher Treffer deutlich erhöht. Ein früher Zwischenstand ist oft ein Zufallsausschlag.

Wer legt die Regel fest?

Sie wird im Testdesign vor dem Start festgehalten und mit dem Auftraggeber abgestimmt. Abweichungen werden vorab dokumentiert.

Wann ist Ihr Test entschieden?

Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.

Daniel Putsche

Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten

Weiterlesen

Danke, Ihre Anfrage ist da.

Wir melden uns innerhalb eines Werktags mit Terminvorschlägen.

Schließen

Demo · Video

Ein kompletter Test, vom Design bis zur Datenanalyse

Demo abspielen

Kapitel: Testdesign · Angebotsseiten · Live-Daten · Ergebnis

Gespräch vereinbaren

Erstes Gespräch

Gespräch vereinbaren

30 Minuten, Ihre Entscheidungsfrage, ein mögliches Testdesign. Ohne Vorbereitung auf Ihrer Seite.

Mit dem Absenden stimmen Sie der Verarbeitung Ihrer Angaben zur Terminvereinbarung zu. Details in der Datenschutzerklärung.

Termin anfragen
Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.
BEISPIELBERICHTBeispielwerte

Beispielbericht Versicherungen

Datenanalyse · Testdesign · Kennzahlen · Methodik

Beispielbericht

Beispielbericht Versicherungen

Ein vollständiger Ergebnisbericht mit Beispielwerten: Fragestellung, Testdesign, Abschlussabsicht je Variante und die Datenanalyse.

12 Seiten, als PDF zum internen Weitergeben
Kostenlos, Download direkt nach kurzem Formular
Hinweis