



Die Wahrscheinlichkeit, die beste Variante zu sein (Probability to Be Best, P(best)), ist eine bayesianische Kennzahl, die angibt, mit welcher Wahrscheinlichkeit eine Variante auf der primären Kennzahl vor allen anderen liegt.
Der Signifikanztest fragt, ob ein Unterschied zufällig sein könnte. P(best) fragt direkt, wie sicher eine Variante vorn liegt. Für Entscheidungen zwischen mehreren Varianten ist das oft die anschaulichere Frage.
Bei drei bis sechs Varianten reicht ein paarweiser Signifikanztest nicht, um die Frage zu beantworten, die Entscheider eigentlich stellen: Welche Variante ist die beste, und wie sicher ist das? P(best) beantwortet genau diese Frage in einer Zahl, die sich ohne Statistikstudium lesen lässt: 92 % heißt, dass die Variante nach den bisherigen Daten mit 92 % Wahrscheinlichkeit vorn liegt.
Weil die Zahl so eingängig ist, braucht sie eine vorab festgelegte Schwelle. Sonst wird sie zum Argument für die Variante, die man ohnehin bevorzugt.
Für jede Variante wird aus Besuchern und Klicks eine Wahrscheinlichkeitsverteilung des wahren Anteils gebildet, üblich ist eine Beta-Verteilung. Aus diesen Verteilungen werden sehr oft zufällige Werte gezogen, und es wird gezählt, wie häufig jede Variante den höchsten Wert hat. Der Anteil dieser Ziehungen ist ihr P(best). Die Werte aller Varianten ergeben zusammen 100 %.
Zwei Angebotsseiten mit je 2.000 Besuchern: Variante A 80 Klicks (4,0 %), Variante B 100 Klicks (5,0 %). P(best) für B liegt bei etwa 94 %. Der klassische Test ergibt dagegen einen p-Wert von etwa 0,13, also nicht signifikant.
Beide Zahlen widersprechen sich nicht, sie beantworten verschiedene Fragen. B liegt wahrscheinlich vorn, aber der Unterschied ist noch nicht sicher genug belegt, um ihn als bestätigt zu bezeichnen. Mit je 5.000 Besuchern und denselben Anteilen steigt P(best) auf über 99 %, und der Unterschied wird signifikant.
Die Schwelle wird vor dem Start je Testtyp festgelegt: 90 % für Nachfrage-, Produkt-, Feature-, Value-Proposition-, Marken- und Zielgruppentests mit gleichem Preis, 95 % für Preistests und alle Tests, in denen sich die Preise zwischen den Varianten unterscheiden. Ein Sieger gilt nur dann als bestätigt, wenn P(best) die Schwelle erreicht und der Unterschied auf der primären Kennzahl signifikant ist. Erreicht nur eine der beiden Bedingungen ihr Ziel, ist das Ergebnis richtungsweisend.
Der p-Wert beschreibt, wie überraschend die Daten wären, wenn es keinen Unterschied gäbe; P(best) beschreibt, wie wahrscheinlich eine Variante die beste ist. Das Konfidenzintervall zeigt die Größe eines Unterschieds, P(best) nur die Rangfolge. Eine Variante kann mit hoher Wahrscheinlichkeit die beste sein und trotzdem nur knapp vorn liegen.
P(best) sagt nichts darüber, ob der Vorsprung groß genug ist, um sich geschäftlich zu lohnen, und nichts darüber, ob die beste Variante absolut gut ist. Für diese Frage braucht es eine Einordnung gegen vergleichbare Tests. Bei sehr wenigen Signalen reagiert P(best) empfindlich auf einzelne Klicks und sollte nicht allein entscheiden. Und wie beim Signifikanztest gilt: Wer ständig nachsieht und beim ersten Überschreiten stoppt, überschätzt die Sicherheit.
Nein. P(best) ist die Wahrscheinlichkeit, dass eine Variante vorn liegt. Signifikanz beschreibt, wie unwahrscheinlich die Daten ohne echten Unterschied wären.
Preisentscheidungen lassen sich schwer zurücknehmen und sind teurer, wenn sie falsch sind. Deshalb verlangt Horizon dort 95 % statt 90 %.
Dann ist das Ergebnis nicht eindeutig oder richtungsweisend. Auch das ist eine valide Erkenntnis, etwa dass zwei Varianten gleich stark sind.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten