Was ist ein A/B-Test im E-Mail-Marketing?
Ein A/B-Test teilt geeignete Empfänger zufällig auf zwei Varianten auf. Die Varianten unterscheiden sich in der Variable, deren Wirkung du untersuchen willst. Betreff A gegen Betreff B ist ein solcher Test. Ein anderer Betreff plus anderer Absender plus andere Versandzeit ist kein eindeutiger A/B-Test, weil du den Unterschied keiner einzelnen Änderung zuordnen kannst.
Vor dem Versand legst du fünf Dinge fest:
- Hypothese: Welche Änderung soll welche Zielmetrik beeinflussen – und warum?
- Population: Welche Empfänger dürfen in den Test gelangen?
- Zielmetrik: Öffnungen, eindeutige Klicker, zugeordnete Käufe oder Deckungsbeitrag?
- Stichprobe: Wie viele Empfänger braucht jede Variante für den kleinsten Unterschied, der eine Entscheidung ändern würde?
- Testende: Wann wird einmalig ausgewertet?
Quellen und Datenstand
Geprüft am 9. Juli 2026: Mailchimp erklärt die zufällige Variantenverteilung und mögliche Siegerkriterien. Die KlickTipp-Anleitung zum Newsletter-Splittest dokumentiert Testgröße, Testzeitraum und Gewinnerauswahl. Die KlickTipp-Preisseite führt Newsletter-Splittests im Premium-Tarif. Produktquellen belegen Funktionen, nicht die Wirkung auf deine Liste.
Die Hypothese verbindet Änderung und Messwert
„Variante B ist besser“ ist keine Hypothese. Schreibe stattdessen:
Wenn der Betreff den konkreten Nutzen nennt statt nur das Thema, steigt der Anteil eindeutiger Öffner, weil der Empfänger vor dem Öffnen erkennt, welche Aufgabe die E-Mail löst.
Damit sind Variable und unmittelbare Zielmetrik benannt. Ob zusätzliche Öffnungen später auch mehr Klicks oder Käufe erzeugen, ist eine zweite Frage. Ein Betreff-Test darf deshalb Öffnungen als Primärmetrik und Klicks oder Käufe als nachgelagerte Diagnose erfassen. Er beweist keinen Umsatzanstieg, wenn dafür die Ereignisse oder die Stichprobe fehlen.
| Untersuchte Variable | Unmittelbare Zielmetrik | Nachgelagerte Kontrolle |
|---|---|---|
| Betreff oder Absender | eindeutige Öffner ÷ zugestellte E-Mails | eindeutige Klicker, Abmeldungen |
| Preheader oder Einstieg | eindeutige Klicker ÷ eindeutige Öffner | Zielseitenbesuche |
| CTA-Text oder CTA-Position | eindeutige Klicker ÷ zugestellte E-Mails | zugeordnete Käufe |
| Angebot oder Preisargument | zugeordnete Käufe ÷ eindeutige Klicker | Deckungsbeitrag, Stornos |
| Versandzeit | Zielmetrik je zufällig zugewiesener Versandzeit | Ergebnis in einem weiteren Versand prüfen |
Verwende für beide Varianten denselben Zähler, Nenner und Zeitraum. „Alle Klicks“ in A gegen „eindeutige Klicker“ in B ist kein Vergleich.
Warum es keine feste Mindestgröße gibt
Eine pauschale Regel wie „ab 500 Kontakten ist der Test belastbar“ ignoriert die entscheidenden Parameter. Der benötigte Umfang pro Variante hängt ab von:
- der bisherigen Rate der Zielmetrik;
- dem kleinsten Unterschied, der deine Entscheidung verändern würde;
- dem akzeptierten Risiko eines falschen Alarms;
- der gewünschten Wahrscheinlichkeit, einen vorhandenen Unterschied zu erkennen;
- der Anzahl der Varianten.
Ein großer Unterschied in einer häufigen Zielmetrik braucht weniger Beobachtungen als ein kleiner Unterschied bei seltenen Käufen. Plane den Stichprobenumfang deshalb vor dem Versand mit einem Rechner für zwei Anteile und speichere die Eingaben zusammen mit der Hypothese.
Reicht die Liste nicht für den geplanten Unterschied, hast du drei ehrliche Optionen:
- alle geeigneten Empfänger zufällig auf A und B verteilen und das Ergebnis als explorativ dokumentieren;
- den kleinsten relevanten Unterschied neu begründen, ohne ihn nachträglich an das Resultat anzupassen;
- den Test nicht als Gewinnerwahl verwenden und zuerst mehr Beobachtungen sammeln.
„Kein eindeutiger Unterschied“ bedeutet nicht, dass beide Varianten gleich sind. Es bedeutet, dass deine Daten unter dem gewählten Testdesign keine ausreichend genaue Entscheidung tragen.
Testgruppe plus Gewinner oder die ganze Liste aufteilen?
Beim Testgruppe-plus-Gewinner-Modell erhalten zunächst Teilgruppen A und B. Nach dem festgelegten Testfenster geht die führende Variante an den Rest. Das nutzt eine mögliche Verbesserung noch im selben Versand, aber die restliche Gruppe gehört nicht mehr zum ursprünglichen Vergleich.
Beim vollständigen Split wird die gesamte geeignete Liste zufällig auf A und B verteilt. Du erhältst mehr Beobachtungen für den Vergleich, verschickst aber keine nachträgliche Gewinnervariante an einen Restbestand. Mailchimp nennt diesen Weg ausdrücklich für kleine Zielgruppen oder Versandzeit-Tests.
Wähle das Modell vor dem Start. Ein Wechsel während des Tests verändert Population und Auswertungslogik.
Das Testfenster folgt dem Ereignis, nicht einer Universalzahl
Eine Betreffzeile kann früher auswertbar sein als ein Kauf mit längerer Entscheidungszeit. Lege das Fenster anhand deiner eigenen Verzögerungsverteilung fest:
- Exportiere für vergleichbare frühere Kampagnen, wann Öffnungen, Klicks und Käufe nach dem Versand eintrafen.
- Wähle ein Fenster, das den für die Zielmetrik vorgesehenen Anteil der Reaktionen abdeckt.
- Halte den Zeitpunkt vor dem Versand fest.
- Werte nicht bei jedem Zwischenstand neu aus.
Wer den Test beim ersten Vorsprung beendet, erhöht die Chance, eine zufällige Schwankung als Gewinner zu behandeln. Wenn dein Tool eine automatische Gewinnerwahl anbietet, trage dort das vorab gewählte Fenster und die Primärmetrik ein.
A/B-Test einrichten: ein reproduzierbares Protokoll
1. Population festlegen
Dokumentiere Ein- und Ausschlüsse. Neue Kontakte, Bestandskunden und inaktive Empfänger können unterschiedlich reagieren. Wenn beide Varianten dieselbe Population untersuchen sollen, muss die zufällige Zuweisung innerhalb dieser Population erfolgen.
2. Nur die untersuchte Variable ändern
Kopiere die Kontrollvariante. Ändere dann nur das geplante Element. Absenderdomain, Versandtechnik, Zielseite und übriger Inhalt bleiben identisch, soweit sie nicht selbst die Testvariable sind.
3. Ereigniskette testen
Sende vor dem Live-Test technische Testmails an kontrollierte Adressen. Prüfe Darstellung, Links, Kampagnenkennung und Zielseite. Bei Kaufmessung führst du einen Testkauf aus und kontrollierst, ob Klick, Kaufwert und Storno demselben Test zugeordnet werden können.
4. Zufällige Zuweisung und Stichprobe speichern
Notiere geplante Empfänger je Variante, tatsächliche Zustellungen und Ausschlüsse. Vergleiche keine Varianten, wenn eine Gruppe durch einen Import-, Zustell- oder Segmentfehler eine andere Population erhalten hat.
5. Einmalig auswerten
Berechne pro Variante Zähler, Nenner und Rate. Ergänze den absoluten Unterschied, ein Konfidenzintervall und die wirtschaftliche Auswirkung. Ein statistisch erkennbarer, aber wirtschaftlich unbedeutender Unterschied rechtfertigt keine aufwendige Umstellung.
6. Entscheidung dokumentieren
Speichere auch uneindeutige und negative Resultate. Die Testakte braucht mindestens Datum, Population, Hypothese, Variable, Varianten, Zielmetrik, Stichprobenplan, Testfenster, Rohzahlen, Unsicherheit und Entscheidung.
Zehn Testideen ohne erfundenes Effektversprechen
| Test | Variante A | Variante B | Primärmetrik |
|---|---|---|---|
| Betreff-Nutzen | Thema nennen | konkreten Leserjob nennen | eindeutige Öffner |
| Betreff-Form | Aussage | Frage mit gleichem Inhalt | eindeutige Öffner |
| Absender | Firmenname | Person plus Firma | eindeutige Öffner |
| Preheader | E-Mail-Anfang automatisch | eigenständige Ergänzung | eindeutige Öffner |
| Einstieg | Problem zuerst | Ergebnis zuerst | eindeutige Klicker |
| CTA-Text | Handlung benennen | Ergebnis benennen | eindeutige Klicker |
| CTA-Position | nach der Erklärung | zusätzlich nach der Zusammenfassung | eindeutige Klicker |
| Format | Textstruktur | Bild plus Text | eindeutige Klicker |
| Zielseite | allgemeine Seite | zur E-Mail passende Seite | zugeordnete Käufe |
| Versandzeit | Zeitpunkt A | Zeitpunkt B | vorher definierte Zielmetrik |
Die Tabelle priorisiert keine Variante und nennt keine erwartete Prozentsteigerung. Das Ergebnis hängt von Liste, Angebot, Versandtechnik und Kontext ab.
Wirtschaftliche Relevanz getrennt rechnen
Ein A/B-Test beantwortet zuerst die Hypothese. Ob die Änderung Geld wert ist, hängt zusätzlich von Klicks, Käufen, Bestellwert, Kosten und Stornos ab. Der Rechner macht diese Kette mit deinen eigenen Eingaben sichtbar; seine voreingestellten Werte sind Beispiele, keine Benchmarks.
Wie wirken Öffnungen, Klicks und Käufe zusammen?
Eine Öffnungsrate allein sagt nicht, wie viel Umsatz eine Kampagne erzeugt. Erst deine Versandhäufigkeit, Klick-zu-Öffnungs-Rate, Kaufrate und dein durchschnittlicher Bestellwert ergeben ein prüfbares Szenario.
Trage deine eigenen Werte ein. Der Rechner vergleicht dein Ausgangsszenario mit einer frei wählbaren Öffnungsrate. Er prognostiziert keine künftigen Verkäufe.
Deine Messwerte und Annahmen
Beispielwerte sind voreingestellt. Ersetze sie durch Werte aus deinem Newsletter- und Verkaufssystem.
Durchschnitt der erfolgreich zugestellten Nachrichten je betrachteter Kampagne. Addiere die Zustellungen und teile durch die Anzahl dieser Kampagnen.
Anzahl der Kampagnen im betrachteten Monat. Automationen separat rechnen, wenn sie andere Empfänger oder Kaufpfade haben.
Zugeordneter Bruttoumsatz geteilt durch zugeordnete Käufe im selben Zeitraum. So gehen alle Bestellungen mit ihrem tatsächlichen Bestellwert ein; ein einfacher Mittelwert der Produktpreise wäre bei unterschiedlichen Verkaufszahlen falsch.
Teile die Summe der eindeutigen Öffner durch die Summe der zugestellten Nachrichten aller betrachteten Kampagnen. Ein einfacher Mittelwert mehrerer Prozentsätze verzerrt das Ergebnis bei unterschiedlich großen Sendungen.
Frei wählbare Vergleichsannahme. Berechne sie mit derselben Methode wie die aktuelle Öffnungsrate und nutze eine vergleichbare Kampagne oder Testvariante.
Summe der eindeutigen Klicker geteilt durch die Summe der eindeutigen Öffner aller betrachteten Kampagnen.
Summe der zugeordneten Käufe geteilt durch die Summe der eindeutigen Klicker aller betrachteten Kampagnen. Ohne gemeinsames Kampagnen- oder Klick-Kennzeichen ist dieser Wert eine Annahme, kein gemessener Effekt.
Beide Szenarien ergeben bei identischen Eingaben 240 Euro Umsatz pro Monat.
So wird gerechnet
Alle Faktoren stammen aus deinen Eingaben. Beispielwerte sind keine Branchen-Benchmarks und keine Prognose.
| Ø zugestellt je Versand | 1.000 |
|---|---|
| E-Mails pro Monat | 4 |
| Öffnungsrate | 20% |
| Öffner pro Monat | 800 |
| Klick-zu-Öffnungs-Rate | 15% |
| Klicks pro Monat | 120 |
| Conversion-Rate | 2% |
| Käufer pro Monat | 2,4 |
| × Ø Bestellwert | 100 € |
| = Monatsumsatz | 240 € |
So findest du den verantwortlichen Hebel
Einordnung: Das Ergebnis ist das Produkt deiner Eingaben. Für eine Umsatzbewertung brauchst du gemessene Klicks und Käufe mit derselben Kampagnen- oder Klick-Kennung. Kosten, Stornos, Abmeldungen und Wiederkäufe sind hier nicht enthalten.
Methode: Recherche- und Bewertungslogik
Newsletter-Splittest mit KlickTipp einordnen
Die KlickTipp-Preisseite führt A/B-Tests für Newsletter im Premium-Tarif. Die Wissensdatenbank beschreibt, wie Testgröße, Zeitraum und Gewinnerkriterium gewählt werden. Für klickbasierte Splittests nennt sie einen einstellbaren Zeitraum und die Auswahl der Variante mit den meisten Klicks.
Das Tool nimmt dir die fachliche Planung nicht ab. Vor dem Tarifvergleich brauchst du weiterhin:
- eine definierte Population;
- eine berechnete Stichprobe;
- eine Zielmetrik, die zur veränderten Variable passt;
- eine dokumentierte Kaufzuordnung, wenn Umsatz gewinnen soll;
- ein vorab festgelegtes Testende.
Fazit: Der Messplan kommt vor der Variante
Ein A/B-Test im E-Mail-Marketing ist kein Ideenwettbewerb. Er ist ein vorab definierter Vergleich zufällig zugewiesener Varianten. Die belastbare Reihenfolge lautet: Hypothese formulieren, Zielmetrik und kleinsten relevanten Unterschied festlegen, Stichprobe planen, Ereigniskette testen, Testende fixieren und erst dann versenden.
Wenn das Ergebnis uneindeutig bleibt, dokumentierst du genau das. Eine erfundene Mindestgröße, ein nachträglich gewähltes Zeitfenster oder ein Prozentversprechen macht aus wenigen Daten keinen Beweis.
A/B-Test starten oder erst Messplan klären?
Starte erst, wenn Hypothese, Zielmetrik, kleinster relevanter Unterschied, Stichprobe und Auswertungszeitpunkt schriftlich feststehen.
- Startpunkt
- Hypothese + Zielmetrik
- Stichprobe
- vor Versand berechnen
- Tool-Grenze
- Splittests ab Premium
Geeignet für
- +Du kannst Kontakte zufällig auf Varianten verteilen und dieselbe Zielmetrik erfassen.
- +Du dokumentierst auch uneindeutige Ergebnisse und prüfst wirtschaftliche Relevanz getrennt.
Nicht geeignet für
- -Du kennst Ausgangsrate oder kleinsten relevanten Unterschied nicht und hast die Stichprobe nicht geplant.
- -Du willst während des Tests laufend nachsehen und beim ersten Vorsprung abbrechen.
Veröffentlicht am . Recherche und Einordnung folgen der Methodik; Zahlen, Tool-Claims und Grenzen stehen im Quellenverzeichnis. Die thematische Einordnung erfolgt im E-Mail-Marketing-Hub.