Was ist inkrementeller ROAS?
Inkrementeller ROAS, kurz iROAS, misst den kausalen zusätzlichen Wert einer Werbemaßnahme je zusätzlichem Werbe-Euro. „Kausal“ bedeutet: Das Ergebnis der beworbenen Testgruppe wird mit einem glaubwürdigen Schätzwert dafür verglichen, was mit denselben Einheiten ohne die Maßnahme passiert wäre. Dieser nicht gleichzeitig beobachtbare Zustand heißt Gegenfaktum.
Ein Experiment nähert das Gegenfaktum durch eine Kontrollgruppe an. Werden Zielpersonen, Haushalte, Accounts oder Regionen zufällig zugeteilt und unterscheiden sich die Gruppen nur durch die untersuchte Werbung, kann die Ergebnisdifferenz als Lift interpretiert werden. Die Belastbarkeit hängt jedoch von Randomisierung, Stichprobe, Messfenster, Datenvollständigkeit und möglicher Kontamination ab.
iROAS ist weder eine Garantie für künftige Kampagnen noch automatisch eine Gewinnkennzahl. Ein umsatzbasierter iROAS ignoriert Warenkosten, Rabatte, Retouren und variable Fulfillment-Kosten. Deshalb muss der Report sagen, ob der Zähler Umsatz, Bruttogewinn oder Deckungsbeitrag ist.
Zähler und Nenner vorab definieren
Die Bezeichnung „iROAS“ allein ist unvollständig. Zwei Teams können mit demselben Experiment unterschiedliche Werte berichten, wenn eines Bruttoumsatz und das andere Deckungsbeitrag verwendet. Ein Messvertrag macht die Ergebnisse reproduzierbar:
Was ist das Ergebnis?
Brutto- oder Nettoumsatz, Bruttogewinn oder Deckungsbeitrag. Steuern, Rabatte, Retouren und variable Kosten werden explizit behandelt.
Was ist zusätzlich?
Nur der Spend-Unterschied zwischen Test und Kontrolle oder der gesamte Test-Spend – passend zur Intervention und Analyse.
Wer wird randomisiert?
Person, Haushalt, Account oder Region. Auswertung und Zuordnung folgen derselben Einheit; Cross-Device-Duplikate werden dokumentiert.
Wann zählt der Effekt?
Testfenster, Conversion-Lag und gegebenenfalls Nachlauf werden vorab festgelegt, nicht nach Sichtung des Ergebnisses verlängert.
Bei einem Umsatz-Lift von 40.000 € und 20.000 € inkrementellem Spend beträgt der Revenue-iROAS 2,0. Verbleiben nach direkt variablen Kosten 16.000 € inkrementeller Deckungsbeitrag, beträgt der Contribution-iROAS 0,8. Beide Werte sind rechnerisch richtig, beantworten aber andere Entscheidungen.
iROAS von anderen ROAS-Varianten abgrenzen
| Kennzahl | Zähler | Kernfrage | Kausal? |
|---|---|---|---|
| Plattform-ROAS | Von einer Plattform attribuierter Umsatz | Welche Conversions schreibt sich die Plattform zu? | Nein |
| Attributions-ROAS | Umsatz nach gewähltem Attributionsmodell | Wie werden beobachtete Touchpoints verteilt? | Nein |
| Blended ROAS | Gesamtumsatz ÷ gesamter Ad Spend | Wie entwickelt sich das Gesamtverhältnis? | Nein |
| True ROAS | Bereinigter oder wirtschaftlich definierter Umsatz | Welche Kosten- und Datenkorrekturen gelten? | Nicht automatisch |
| Inkrementeller ROAS | Experimentell geschätzter zusätzlicher Wert | Was verursachte die Maßnahme zusätzlich? | Bei gültigem Design |
ROAS und True ROAS können operative Sichtweisen auf attribuierten oder bereinigten Umsatz liefern. Blended ROAS reduziert Kanal-Doppelzählungen durch eine Gesamtbetrachtung. Keine dieser Kennzahlen erzeugt allein ein Gegenfaktum; sie ergänzen ein Experiment, ersetzen es aber nicht.
Randomisierten Holdout-Test planen
- Entscheidung und Intervention festlegen: Definieren Sie Kanal, Kampagne, Budgetänderung und die spätere Entscheidung, bevor Daten betrachtet werden.
- Primärmetrik wählen: Benennen Sie Umsatz oder Deckungsbeitrag, Analyseeinheit, Conversion-Fenster und Datenquelle.
- Power planen: Erwarteten Baseline-Wert, Streuung, kleinsten relevanten Effekt, Signifikanzniveau und gewünschte Teststärke dokumentieren. Die nötige Stichprobe folgt daraus – nicht aus einer universellen Prozentregel.
- Zufällig zuordnen: Teilen Sie geeignete Einheiten reproduzierbar in Test und Kontrolle. Bei Bedarf wird nach wichtigen Merkmalen stratifiziert.
- Exposition prüfen: Messen Sie, ob Testeinheiten die Maßnahme erhalten und Kontrollfälle ausgeschlossen bleiben, ohne Gruppen nachträglich umzudefinieren.
- Nach Plan auswerten: Berichten Sie Lift, iROAS, Intervall, Stichprobengröße, Ausfälle und Abweichungen vom Analyseplan.
Eine Intention-to-treat-Auswertung vergleicht die ursprünglich zugeteilten Gruppen, auch wenn einzelne Testfälle keine Anzeige sehen. Sie misst den Effekt der angebotenen Werbemaßnahme unter realen Auslieferungsbedingungen und bewahrt den Vorteil der Randomisierung. Eine nachträgliche Auswahl nur tatsächlich Exponierter kann Selbstselektion einführen.
Baseline, Lift und Unsicherheit
Bei gleich großen randomisierten Gruppen ist der rohe Lift die Differenz der durchschnittlichen Ergebnisse. Bei ungleichen Gruppengrößen wird auf eine gemeinsame Einheit skaliert, etwa Umsatz je randomisierter Person. Vorperiodendaten können als Kovariate die Präzision erhöhen, sofern die Methode vorab festgelegt wird.
Ein positiver Punktschätzer allein ist keine hinreichende Evidenz. Ein Konfidenzintervall zeigt, welche Effektgrößen mit Daten und Modell vereinbar sind. Umfasst das Intervall sowohl wirtschaftlich negative als auch attraktive Effekte, ist die Entscheidung unsicher – selbst wenn der Mittelwert positiv ist. „Nicht statistisch signifikant“ bedeutet nicht automatisch „kein Effekt“; der Test kann zu wenig Power haben.
Teams sollten vorab einen kleinsten wirtschaftlich relevanten Effekt bestimmen. Das verhindert, dass eine große Stichprobe einen winzigen, aber unbrauchbaren Effekt als statistisch auffällig erscheinen lässt oder eine kleine Stichprobe zu einer scheinbar präzisen Budgetentscheidung führt.
Vollständiges Rechenbeispiel
Ein randomisierter Test ordnet je 50.000 geeignete Kunden einer Test- und Kontrollgruppe zu. Die Testgruppe erhält die Kampagne und erzeugt im Messfenster 520.000 € Nettoumsatz; die Kontrolle ohne Kampagne erzeugt 480.000 €. Der Test-Spend beträgt 20.000 €, der Kontroll-Spend für die untersuchte Maßnahme 0 €.
Der umsatzbasierte Wert sagt, dass je zusätzlichem Werbe-Euro im Test zwei Euro zusätzlicher Nettoumsatz beobachtet wurden. Der Contribution-iROAS zeigt zugleich, dass der inkrementelle Deckungsbeitrag den zusätzlichen Spend in diesem Messfenster nicht vollständig deckt. Ob die Maßnahme dennoch sinnvoll ist, hängt unter anderem von Folgekäufen, Cash-Timing, Unsicherheit und dem vorab definierten Entscheidungskriterium ab.
Zum Ergebnis gehören außerdem das Konfidenzintervall des Lifts, die Anzahl analysierter Einheiten und die Compliance mit der Zuteilung. Ohne diese Angaben wirkt die Dezimalzahl präziser, als das Experiment erlaubt.
Geo-Lift- und Matched-Market-Tests
Wenn individuelle Randomisierung nicht möglich ist, können Regionen als Testeinheiten dienen. Historische Daten werden genutzt, um Regionen mit ähnlichem Niveau und Verlauf zu matchen oder eine synthetische Kontrolle zu bilden. Anschließend wird Spend nur in den Testregionen verändert und die Abweichung vom geschätzten Kontrollverlauf gemessen.
| Prüfpunkt | Risiko | Kontrolle |
|---|---|---|
| Pre-Period-Fit | Regionen folgen bereits vor dem Test anderen Trends | Mehrere Vorperioden, Placebo-Tests, Fit-Metrik |
| Spillover | Kontrollregion sieht Werbung oder kauft im Testgebiet | Geografische Puffer, Auslieferungsprüfung, Sensitivität |
| Lokale Schocks | Wetter, Feiertag, Wettbewerb oder Store-Ereignis | Ereignisprotokoll und robuste Vergleichsmodelle |
| Wenige Cluster | Unsicherheit wird unterschätzt | Cluster-gerechte Inferenz und vorsichtige Interpretation |
| Budgetverschiebung | Plattform liefert Spend in andere Regionen um | Tatsächliche regionale Exposition und Spend prüfen |
Ein Geo-Test ist nicht automatisch robuster als Attribution. Ohne parallele Trends oder plausibles Kontrollmodell kann ein regionaler Unterschied fälschlich der Werbung zugeschrieben werden. Testregionen sollten daher nicht nach dem beobachteten Ergebnis gewählt oder ausgetauscht werden.
Kontamination und typische Analysefehler
- Kontrollgruppe wird exponiert: Organische Shares, andere Kampagnen oder Cross-Device-Auslieferung verkleinern den gemessenen Kontrast.
- Testgruppe wird nicht erreicht: Niedrige Auslieferung misst den Effekt des Assignments, nicht zwingend den Effekt einer vollständigen Exposition.
- Parallelmaßnahmen ändern sich: Preis, Promotion, E-Mail oder Bestand dürfen nicht systematisch nur in einer Gruppe variieren.
- Zwischenstände steuern das Ende: Wiederholtes Prüfen und Stoppen bei einem günstigen Wert erhöht Fehlentscheidungen, wenn es der Analyseplan nicht berücksichtigt.
- Novelty und Carryover: Ein kurzer Test kann Einführungs- oder Verzögerungseffekte überzeichnen. Mess- und Nachlaufzeit folgen der Customer Journey.
- Mehrere Zielgrößen: Viele Segmente und Outcomes erhöhen die Chance zufälliger Treffer. Primärmetrik und Korrekturregeln werden vorab festgelegt.
iROAS für Budgetentscheidungen nutzen
- Wirtschaftliche Schwelle definieren: Leiten Sie sie aus Wertbasis, Marge, Cash-Timing und Opportunitätskosten ab, nicht aus einer pauschalen Branchenzahl.
- Intervall statt Punkt lesen: Prüfen Sie, welche Entscheidungen über den plausiblen Wertebereich robust bleiben.
- Gültigkeit begrenzen: Das Ergebnis gilt zunächst für getestete Zielgruppe, Kanal, Creative, Budgetniveau und Zeitraum.
- Skalierung separat testen: Durchschnittlicher iROAS eines Budgets ist nicht automatisch der marginale iROAS des nächsten Budgetschritts.
- Mit operativen Kennzahlen verbinden: Nutzen Sie Plattform- und Blended-ROAS für Diagnose und Monitoring, ohne sie als Kausalbeweis umzudeuten.
- Replikation planen: Wiederholen Sie entscheidungsrelevante Tests, wenn Saison, Creative, Zielgruppe oder Marktstruktur sich materiell ändern.
Ein Experiment reduziert Unsicherheit, beseitigt sie aber nicht. Die beste Entscheidung dokumentiert Schätzwert, Intervall, Testgrenzen und die Konsequenz eines Fehlers – und legt fest, welche neue Evidenz eine Budgetentscheidung ändern würde.
Häufige Fragen
Was ist inkrementeller ROAS?
Inkrementeller ROAS, kurz iROAS, setzt den durch Werbung kausal zusätzlich erzeugten Umsatz oder Deckungsbeitrag ins Verhältnis zu den dafür zusätzlich eingesetzten Werbeausgaben. Die gewählte Wertbasis muss im Namen und Report ausdrücklich genannt werden.
Wie lautet die iROAS-Formel?
Revenue-iROAS = inkrementeller Umsatz geteilt durch inkrementelle Werbeausgaben. Contribution-iROAS = inkrementeller Deckungsbeitrag geteilt durch inkrementelle Werbeausgaben. Der Lift wird aus der Differenz zwischen Test- und Kontrollszenario nach einer vorab definierten Skalierung oder Modellierung bestimmt.
Wie unterscheidet sich iROAS vom Plattform-ROAS?
Plattform-ROAS verwendet von einer Werbeplattform attribuierten Umsatz. iROAS schätzt mit einem Gegenfaktum, wie viel Umsatz oder Deckungsbeitrag ohne die getestete Werbung entstanden wäre, und misst nur die Differenz. Attribution und Kausalität sind daher nicht austauschbar.
Wie funktioniert ein randomisierter Holdout-Test?
Geeignete Einheiten werden vor Testbeginn zufällig einer Test- und einer Kontrollgruppe zugeordnet. Nur die Testgruppe erhält die untersuchte Werbemaßnahme. Nach einem vorab festgelegten Zeitraum werden Ergebnis und Spend der Gruppen nach der gewählten Analyse verglichen; Abbrüche und Ausschlüsse werden dokumentiert.
Wann ist ein Geo-Test sinnvoll?
Ein Geo-Test kann sinnvoll sein, wenn eine individuelle Randomisierung technisch nicht möglich ist oder Kanäle regional schaltbar sind. Regionen sollten aus stabilen Vorperioden gematcht werden. Spillover, kleine Fallzahlen, lokale Ereignisse und unterschiedliche Trends begrenzen die Aussagekraft.
Was ist ein guter inkrementeller ROAS?
Es gibt keinen universellen guten iROAS. Die Entscheidungsschwelle hängt von der verwendeten Wertbasis, Bruttomarge, variablen Kosten, Cash-Timing, Risikotoleranz und alternativen Budgetverwendung ab. Ein Punktschätzer sollte zusammen mit Unsicherheit und Testdesign gelesen werden.