



Eine Stopp-Regel legt vor dem Start eines Tests fest, unter welchen Bedingungen er beendet wird und wann ein Ergebnis als entschieden gilt; sie verhindert, dass ein Test genau dann gestoppt wird, wenn die Zahlen gerade passen.
Laufende Tests laden zum Nachsehen ein. Wer beim ersten günstigen Zwischenstand stoppt, überschätzt die Sicherheit seines Ergebnisses. Eine Stopp-Regel trennt die Planung von der Auswertung.
Zwischenstände schwanken, besonders in den ersten Tagen. Wer täglich prüft und stoppt, sobald ein Unterschied signifikant aussieht, erhöht die Quote falscher Treffer deutlich. Eine viel zitierte Simulation zeigt: Prüft man nach jeweils zehn zusätzlichen Beobachtungen je Gruppe und stoppt beim ersten p-Wert unter 0,05, steigt der Anteil falsch positiver Ergebnisse von 5 % auf 14,3 %.
Für die Entscheidung heißt das: Ein Sieger, der nur durch geschicktes Stoppen entstanden ist, hält im Markt nicht. Die Stopp-Regel macht das Ergebnis verteidigbar, auch gegenüber Kolleginnen und Kollegen, die ein anderes Ergebnis erwartet haben.
Eine gute Stopp-Regel beantwortet vor dem Start vier Fragen: Welche Kennzahl entscheidet? Ab welcher Sicherheit gilt eine Variante als vorn? Welche Datenbasis ist mindestens nötig, bevor ein vorzeitiges Ende in Frage kommt? Und wann ist spätestens Schluss, auch ohne klares Ergebnis?
Hinzu kommen Abbruchbedingungen für den Fall, dass ein Test technisch nicht funktioniert, etwa wenn Anzeigen nicht ausgeliefert werden oder die Kosten je Besucher deutlich über der Planung liegen.
Vor dem Start werden zwei Regeln im Testdesign festgeschrieben. Die Stopp-Regel: Ein vorzeitiges Ende ist möglich, wenn die Wahrscheinlichkeit, die beste Variante zu sein, die Schwelle des Testtyps erreicht (90 %, bei Preisunterschieden 95 %) und die Datenbasis ausreicht; die geplante Höchstzahl an Besuchern beendet den Test in jedem Fall. Die Siegerregel: signifikanter Unterschied auf der primären Kennzahl, P(best) über der Schwelle und ein Vorsprung, der zu den vorgelagerten Schritten passt.
Zusätzlich zählt der Messzeitraum: Ein Test soll möglichst eine ganze Woche einschließlich Wochenende abdecken, weil sich Verhalten am Wochenende ändert. Technische Abbrüche werden nicht vor dem dritten Tag entschieden.
Drei Tarifseiten, je 2.200 Besucher nach vier Tagen: 4,0 %, 5,0 % und 4,3 %. Die mittlere Variante liegt mit einem P(best) von etwa 83 % vorn. Die Schwelle von 90 % ist nicht erreicht, und der Messzeitraum enthält noch kein Wochenende.
Nach der Regel läuft der Test weiter, obwohl der Zwischenstand verlockend aussieht. Ohne Regel wäre an dieser Stelle die Versuchung groß, die führende Variante auszurufen.
Die Stopp-Regel ist nicht dasselbe wie die Stichprobenplanung: Die Planung legt fest, wie viele Besucher angestrebt werden, die Stopp-Regel, wann das Ergebnis gelesen und der Test beendet wird. Sequenzielle Testverfahren sind eine statistische Form, das wiederholte Prüfen von vornherein einzurechnen.
Keine Regel ersetzt das Urteil über die Qualität des Messzeitraums. Mehr Besucher gleichen einen schiefen Zeitraum nicht aus. Eine Stopp-Regel kann außerdem nur verhindern, dass zu früh entschieden wird. Sie garantiert kein eindeutiges Ergebnis: Endet ein Test ohne klaren Sieger, ist das ein valides Ergebnis, etwa dass zwei Varianten gleich stark sind.
Simmons, Nelson & Simonsohn 2011: Simulation: Wer ab 10 Beobachtungen je Gruppe nach jeweils 10 weiteren prüft und bei p < 0,05 stoppt, erhält 14,3 % statt 5 % falsch positive Ergebnisse; bei Prüfung nach jeder Beobachtung 22,1 %. False-Positive Psychology, Psychological Science 22(11). Quelle
Wasserstein & Lazar 2016: Die American Statistical Association hält fest: Ein p-Wert misst weder die Größe eines Effekts noch seine Bedeutung, und Geschäftsentscheidungen sollten nicht allein daran hängen, ob ein p-Wert eine Schwelle unterschreitet. The ASA Statement on p-Values: Context, Process, and Purpose, The American Statistician 70(2). Quelle
Ja, zur Kontrolle der Technik und der Auslieferung. Entschieden wird aber nur nach der vorab festgelegten Regel.
Weil wiederholtes Prüfen die Quote falscher Treffer deutlich erhöht. Ein früher Zwischenstand ist oft ein Zufallsausschlag.
Sie wird im Testdesign vor dem Start festgehalten und mit dem Auftraggeber abgestimmt. Abweichungen werden vorab dokumentiert.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten