Daten & Analyse
A/B Test Setup
Anleitung zur Planung, Durchführung und Auswertung statistisch sauberer A/B-Tests
Dieser Skill liefert eine strukturierte Vorgehensweise für die Planung von A/B-Tests, von der Hypothesenbildung über die Berechnung der nötigen Stichprobengröße bis zur Interpretation der Ergebnisse. Er unterscheidet zwischen A/B-, A/B/n- und multivariaten Tests, erklärt Traffic-Verteilung sowie client- und serverseitige Implementierungsansätze und stellt Vorlagen für Testpläne und Ergebnisdokumentation bereit. Referenziert werden dabei bekannte externe Rechner wie die von Evan Miller und Optimizely als reine Lesehinweise für Stichprobengrößen.
Statt fertiger Skripte enthält der Skill ausschließlich eine gut strukturierte SKILL.md, die den Agent anleitet, gezielte Rückfragen zu Baseline-Conversion, Traffic und Testkontext zu stellen, bevor ein Testdesign vorgeschlagen wird. Besonderer Wert liegt auf Fehlervermeidung: typische Probleme wie das vorzeitige Abbrechen von Tests, unklare Hypothesen oder das Verwechseln von statistischer und praktischer Signifikanz werden explizit adressiert. Der Skill richtet sich an Produkt-, Marketing- und Growth-Teams, die Experimente methodisch fundiert aufsetzen und auswerten wollen.
FAQ
Häufige Fragen zu A/B Test Setup
- Enthält der Skill ausführbaren Code, etwa einen Stichprobengrößen-Rechner?
- Nein. Der Skill besteht ausschließlich aus einer SKILL.md mit Anleitungstext. Er enthält eine Referenztabelle für grobe Schätzungen sowie Links zu externen Rechnern (Evan Miller, Optimizely), führt die eigentliche statistische Berechnung aber nicht selbst durch. Für exakte Stichprobengrößen muss weiterhin ein separates Tool herangezogen werden.
- Ersetzt dieser Skill ein A/B-Testing-Tool wie Optimizely oder PostHog?
- Nein. Der Skill deckt Planung, Hypothesenbildung, Metrikauswahl und Auswertungslogik ab, nicht die technische Umsetzung. Er beschreibt client- und serverseitige Implementierungsansätze konzeptionell und nennt gängige Tools als Beispiele, liefert aber keinen Code zur Anbindung. Ein tatsächliches Testing-Tool oder Feature-Flag-System wird weiterhin benötigt.
- Für wen lohnt sich der Skill nicht?
- Wer nur schnell eine Idee ausprobieren will, ohne Hypothese, Stichprobenplanung oder Guardrail-Metriken, wird den Skill eher als Bremse empfinden – er ist bewusst auf methodische Sorgfalt und Fehlervermeidung (z. B. vorzeitiges Abbrechen) ausgelegt. Für Teams mit sehr geringem Traffic, bei denen A/B-Tests statistisch ohnehin kaum aussagekräftig sind, bietet der Skill vor allem Transparenz über diese Einschränkung, aber keine Abkürzung.
- Wie unterscheidet sich der Skill vom verwandten „analytics-tracking
- Laut Beschreibung im SKILL.md ist analytics-tracking der Ansprechpartner für die konkrete Implementierung von Tracking, während dieser Skill sich auf Testdesign, Hypothesen, Sample-Size-Logik und Ergebnisinterpretation konzentriert. Beide Skills ergänzen sich also, decken aber unterschiedliche Phasen eines Experiments ab.