



Die Stichprobengröße ist die Zahl der Beobachtungen, die ein Test je Variante braucht, um eine Frage mit der gewünschten Genauigkeit zu beantworten; im Painted-Door-Test ist das die Zahl der Besucher je Angebotsseite.
Wie viele Besucher ein Variantentest braucht, entscheidet über Budget, Laufzeit und darüber, ob am Ende überhaupt eine Aussage möglich ist. Die Zahl wird vor dem Start berechnet, nicht geschätzt.
Ein zu kleiner Test kann einen echten Unterschied nicht zeigen und endet als "nicht eindeutig". Ein zu großer Test kostet mehr Zeit und Budget als nötig. Die richtige Stichprobengröße hängt von drei Dingen ab: wie häufig das gemessene Verhalten ist, wie genau das Ergebnis sein muss und wie viele Varianten verglichen werden.
Für Entscheider heißt das: Die Genauigkeit ist eine bewusste Festlegung. Eine Preisentscheidung, die sich schwer zurücknehmen lässt, verlangt eine engere Spanne als eine erste Nachfrageeinschätzung.
Für einen Anteil gilt die übliche Näherung: Besucher je Variante n = (1,96 / Fehlerspanne)² × p × (1 - p). Dabei ist p der erwartete Anteil auf der primären Kennzahl und die Fehlerspanne die gewünschte Genauigkeit bei 95 % Sicherheit. Der Wert wird immer aufgerundet.
Das Budget ergibt sich aus Varianten × Besucher je Variante × Kosten je Besucher, die Laufzeit aus Budget und täglich sinnvoller Ausgabe. Werden zusätzlich Märkte verglichen, vervielfacht sich die Zahl der Zellen, und damit der Bedarf.
Ein Test vergleicht drei Preispunkte für eine Akku-Küchenmaschine. Erwartet wird, dass etwa 5 % der Besucher auf "In den Warenkorb" klicken.
Bei einer Fehlerspanne von 2 Prozentpunkten braucht jede Variante (1,96 / 0,02)² × 0,05 × 0,95, also rund 457 Besucher. Bei 1,5 Prozentpunkten sind es rund 812, bei 1 Prozentpunkt rund 1.825. Für drei Preisvarianten mit 1 Prozentpunkt Spanne sind das knapp 5.500 Besucher insgesamt.
Halbiert man die Fehlerspanne, vervierfacht sich der Bedarf. Genau deshalb wird die Genauigkeit vor dem Start je Testtyp festgelegt, bei Preistests enger als bei einer ersten Nachfrageeinschätzung.
Horizon plant auf der primären Kennzahl des gewählten Aufbaus, mit Ausgangswerten und Kosten je Besucher aus vergleichbaren Tests desselben Kanals und derselben Branche, nie aus einer Schätzung. Vor dem Start wird geprüft, ob die Zielgruppe oder das Suchvolumen die nötigen Besucher in der Laufzeit hergibt. Passt das nicht, stehen die Optionen offen auf dem Tisch: weniger Varianten, eine weitere Spanne oder mehr Budget. Der Messzeitraum soll möglichst eine ganze Woche einschließlich Wochenende abdecken.
Die Stichprobengröße ist nicht dasselbe wie die statistische Power, also die Wahrscheinlichkeit, einen vorhandenen Unterschied bestimmter Größe zu finden; beide hängen aber eng zusammen. Anzeigenimpressionen oder Reichweite sind keine Stichprobe: Gezählt werden die eindeutigen Besucher der Angebotsseite.
Die Formel setzt einen erwarteten Anteil voraus. Liegt der tatsächliche Wert deutlich darunter, reicht die geplante Stichprobe nicht. Eine größere Stichprobe behebt außerdem keine Verzerrung: Ein Messzeitraum von anderthalb Werktagen bleibt schief, egal wie viele Besucher er enthält. Und bei sehr seltenen Signalen, etwa 0 gegenüber 7 Klicks, ist die Basis zu klein für eine Aussage, selbst wenn die Intervalle sich nicht überschneiden.
Nein. Die nötige Zahl hängt vom erwarteten Anteil, der geforderten Genauigkeit und der Zahl der Varianten ab und wird für jeden Test berechnet.
Weil eine falsche Preisentscheidung teurer und schwerer umkehrbar ist. Deshalb wird dort eine engere Fehlerspanne angesetzt, was mehr Besucher erfordert.
Nur durch weitere Daten nach einer vorab festgelegten Regel. Beliebiges Verlängern, bis ein Ergebnis passt, verzerrt das Ergebnis.
Bringen Sie Ihre Entscheidungsfrage mit, wir skizzieren ein mögliches Testdesign.
Sie sprechen mit Daniel Putsche
Gründer & CEO, 30 Minuten