Datenschutz, kurz und ehrlich. Wir messen nur anonym, welche Seiten ankommen. Cookieless, ohne Werbe-Cookies, ohne Tracker, ohne Weiterverkauf. Du entscheidest, ob die Statistik mitläuft. Details in der Datenschutzerklärung.

    Glossar / Begriff

    A/B-Test-Signifikanz, im Tracking-Kontext.

    Signifikanz beziffert, wie wahrscheinlich ein beobachteter Unterschied auch bei reinem Zufall entstünde. Sie ersetzt kein Urteil über die Relevanz.

    Statistische Signifikanz beantwortet in einem A/B-Test genau eine Frage: Wie wahrscheinlich wäre ein mindestens so großer Unterschied, wenn beide Varianten in Wahrheit gleich gut wären? Diese Wahrscheinlichkeit ist der p-Wert. Liegt er unter dem vorab gewählten Niveau, meist 0,05, wird die Nullhypothese verworfen. Falsch ist die verbreitete Lesart, ein p-Wert von 0,05 bedeute 95 Prozent Wahrscheinlichkeit, dass die Variante besser ist. Vor dem Start gehören drei Größen festgelegt: der kleinste geschäftlich relevante Unterschied, die Teststärke und daraus die nötige Fallzahl. Wer währenddessen wiederholt hineinschaut und beim ersten grünen Ergebnis abbricht, erhöht die Fehlerrate erheblich.

    Beispiele aus dem Mittelstand

    • Ein Onlineshop legt vor dem Test fest, dass erst zwei Prozentpunkte mehr Kaufquote eine Umstellung rechtfertigen, und berechnet daraus die nötige Besucherzahl.
    • Ein B2B-Anbieter bricht einen Test nach vier Tagen nicht ab, obwohl die Variante führt, weil die vorab berechnete Fallzahl erst nach drei Wochen erreicht ist.

    Folge-Fragen

    Reicht ein Ergebnis von 95 Prozent Konfidenz?

    Das Niveau ist eine Konvention, kein Naturgesetz. Bei teuren oder schwer umkehrbaren Änderungen ist ein strengeres Niveau und eine höhere Teststärke sinnvoll.

    Warum darf ich nicht früher abbrechen?

    Weil wiederholtes Prüfen bei laufendem Test die Wahrscheinlichkeit eines Zufallstreffers stark erhöht. Wer laufend auswerten will, braucht dafür ausgelegte Verfahren wie sequenzielle Tests.

    Was tue ich bei zu wenig Traffic?

    Größere Änderungen testen, Testdauer verlängern oder auf qualitative Verfahren ausweichen. Ein unterbesetzter Test liefert keine belastbare Aussage, egal wie hübsch das Werkzeug rechnet.

    Sind A/B-Tests datenschutzrechtlich unproblematisch?

    Nicht automatisch. Sobald Varianten über Cookies zugewiesen und Nutzer wiedererkannt werden, gilt die Einwilligungspflicht. Serverseitige Zuweisung ohne Wiedererkennung ist die datensparsamere Variante.

    A/B-Test-Signifikanz in der Praxis.

    Wo dieser Begriff in deinem Geschäft konkret wird, beginnt die Arbeit. Wir nennen klar, ob die Idee in unser Studio passt.

    Data Science