Zum Inhalt springen

Glossar · Marketing Effectiveness

Inkrementellen ROAS belastbar messen

iROAS fragt nicht, welcher Umsatz einer Anzeige zugeschrieben wurde, sondern welcher zusätzliche wirtschaftliche Wert durch die getestete Werbung entstand. Dafür braucht es ein Gegenfaktum, ein vorab definiertes Experiment und eine explizite Wertbasis.

Ritik Namdev10 Min. Lesezeit
Randomisierter HoldoutKausaler LiftGeo-Test
Formeln auf einen BlickInkrementeller Lift = Ergebnis Test − erwartetes Ergebnis ohne MaßnahmeRevenue-iROAS = inkrementeller Umsatz ÷ inkrementelle WerbeausgabenContribution-iROAS = inkrementeller Deckungsbeitrag ÷ inkrementelle Werbeausgaben

Was ist inkrementeller ROAS?

Inkrementeller ROAS, kurz iROAS, misst den kausalen zusätzlichen Wert einer Werbemaßnahme je zusätzlichem Werbe-Euro. „Kausal“ bedeutet: Das Ergebnis der beworbenen Testgruppe wird mit einem glaubwürdigen Schätzwert dafür verglichen, was mit denselben Einheiten ohne die Maßnahme passiert wäre. Dieser nicht gleichzeitig beobachtbare Zustand heißt Gegenfaktum.

Ein Experiment nähert das Gegenfaktum durch eine Kontrollgruppe an. Werden Zielpersonen, Haushalte, Accounts oder Regionen zufällig zugeteilt und unterscheiden sich die Gruppen nur durch die untersuchte Werbung, kann die Ergebnisdifferenz als Lift interpretiert werden. Die Belastbarkeit hängt jedoch von Randomisierung, Stichprobe, Messfenster, Datenvollständigkeit und möglicher Kontamination ab.

iROAS ist weder eine Garantie für künftige Kampagnen noch automatisch eine Gewinnkennzahl. Ein umsatzbasierter iROAS ignoriert Warenkosten, Rabatte, Retouren und variable Fulfillment-Kosten. Deshalb muss der Report sagen, ob der Zähler Umsatz, Bruttogewinn oder Deckungsbeitrag ist.

Zähler und Nenner vorab definieren

Die Bezeichnung „iROAS“ allein ist unvollständig. Zwei Teams können mit demselben Experiment unterschiedliche Werte berichten, wenn eines Bruttoumsatz und das andere Deckungsbeitrag verwendet. Ein Messvertrag macht die Ergebnisse reproduzierbar:

Wertbasis

Was ist das Ergebnis?

Brutto- oder Nettoumsatz, Bruttogewinn oder Deckungsbeitrag. Steuern, Rabatte, Retouren und variable Kosten werden explizit behandelt.

Spend-Basis

Was ist zusätzlich?

Nur der Spend-Unterschied zwischen Test und Kontrolle oder der gesamte Test-Spend – passend zur Intervention und Analyse.

Einheit

Wer wird randomisiert?

Person, Haushalt, Account oder Region. Auswertung und Zuordnung folgen derselben Einheit; Cross-Device-Duplikate werden dokumentiert.

Zeit

Wann zählt der Effekt?

Testfenster, Conversion-Lag und gegebenenfalls Nachlauf werden vorab festgelegt, nicht nach Sichtung des Ergebnisses verlängert.

Bei einem Umsatz-Lift von 40.000 € und 20.000 € inkrementellem Spend beträgt der Revenue-iROAS 2,0. Verbleiben nach direkt variablen Kosten 16.000 € inkrementeller Deckungsbeitrag, beträgt der Contribution-iROAS 0,8. Beide Werte sind rechnerisch richtig, beantworten aber andere Entscheidungen.

iROAS von anderen ROAS-Varianten abgrenzen

Messlogik der ROAS-Varianten
KennzahlZählerKernfrageKausal?
Plattform-ROASVon einer Plattform attribuierter UmsatzWelche Conversions schreibt sich die Plattform zu?Nein
Attributions-ROASUmsatz nach gewähltem AttributionsmodellWie werden beobachtete Touchpoints verteilt?Nein
Blended ROASGesamtumsatz ÷ gesamter Ad SpendWie entwickelt sich das Gesamtverhältnis?Nein
True ROASBereinigter oder wirtschaftlich definierter UmsatzWelche Kosten- und Datenkorrekturen gelten?Nicht automatisch
Inkrementeller ROASExperimentell geschätzter zusätzlicher WertWas verursachte die Maßnahme zusätzlich?Bei gültigem Design

ROAS und True ROAS können operative Sichtweisen auf attribuierten oder bereinigten Umsatz liefern. Blended ROAS reduziert Kanal-Doppelzählungen durch eine Gesamtbetrachtung. Keine dieser Kennzahlen erzeugt allein ein Gegenfaktum; sie ergänzen ein Experiment, ersetzen es aber nicht.

Randomisierten Holdout-Test planen

  1. Entscheidung und Intervention festlegen: Definieren Sie Kanal, Kampagne, Budgetänderung und die spätere Entscheidung, bevor Daten betrachtet werden.
  2. Primärmetrik wählen: Benennen Sie Umsatz oder Deckungsbeitrag, Analyseeinheit, Conversion-Fenster und Datenquelle.
  3. Power planen: Erwarteten Baseline-Wert, Streuung, kleinsten relevanten Effekt, Signifikanzniveau und gewünschte Teststärke dokumentieren. Die nötige Stichprobe folgt daraus – nicht aus einer universellen Prozentregel.
  4. Zufällig zuordnen: Teilen Sie geeignete Einheiten reproduzierbar in Test und Kontrolle. Bei Bedarf wird nach wichtigen Merkmalen stratifiziert.
  5. Exposition prüfen: Messen Sie, ob Testeinheiten die Maßnahme erhalten und Kontrollfälle ausgeschlossen bleiben, ohne Gruppen nachträglich umzudefinieren.
  6. Nach Plan auswerten: Berichten Sie Lift, iROAS, Intervall, Stichprobengröße, Ausfälle und Abweichungen vom Analyseplan.

Eine Intention-to-treat-Auswertung vergleicht die ursprünglich zugeteilten Gruppen, auch wenn einzelne Testfälle keine Anzeige sehen. Sie misst den Effekt der angebotenen Werbemaßnahme unter realen Auslieferungsbedingungen und bewahrt den Vorteil der Randomisierung. Eine nachträgliche Auswahl nur tatsächlich Exponierter kann Selbstselektion einführen.

Baseline, Lift und Unsicherheit

Bei gleich großen randomisierten Gruppen ist der rohe Lift die Differenz der durchschnittlichen Ergebnisse. Bei ungleichen Gruppengrößen wird auf eine gemeinsame Einheit skaliert, etwa Umsatz je randomisierter Person. Vorperiodendaten können als Kovariate die Präzision erhöhen, sofern die Methode vorab festgelegt wird.

Lift je Einheit = durchschnittliches Ergebnis Test − durchschnittliches Ergebnis Kontrolle

Ein positiver Punktschätzer allein ist keine hinreichende Evidenz. Ein Konfidenzintervall zeigt, welche Effektgrößen mit Daten und Modell vereinbar sind. Umfasst das Intervall sowohl wirtschaftlich negative als auch attraktive Effekte, ist die Entscheidung unsicher – selbst wenn der Mittelwert positiv ist. „Nicht statistisch signifikant“ bedeutet nicht automatisch „kein Effekt“; der Test kann zu wenig Power haben.

Teams sollten vorab einen kleinsten wirtschaftlich relevanten Effekt bestimmen. Das verhindert, dass eine große Stichprobe einen winzigen, aber unbrauchbaren Effekt als statistisch auffällig erscheinen lässt oder eine kleine Stichprobe zu einer scheinbar präzisen Budgetentscheidung führt.

Vollständiges Rechenbeispiel

Ein randomisierter Test ordnet je 50.000 geeignete Kunden einer Test- und Kontrollgruppe zu. Die Testgruppe erhält die Kampagne und erzeugt im Messfenster 520.000 € Nettoumsatz; die Kontrolle ohne Kampagne erzeugt 480.000 €. Der Test-Spend beträgt 20.000 €, der Kontroll-Spend für die untersuchte Maßnahme 0 €.

Baseline ohne Maßnahme480.000 €
Inkrementeller Umsatz520.000 − 480.000 = 40.000 €
Revenue-iROAS40.000 ÷ 20.000 = 2,0
Inkrementeller Deckungsbeitrag16.000 € nach definierten variablen Kosten
Contribution-iROAS16.000 ÷ 20.000 = 0,8

Der umsatzbasierte Wert sagt, dass je zusätzlichem Werbe-Euro im Test zwei Euro zusätzlicher Nettoumsatz beobachtet wurden. Der Contribution-iROAS zeigt zugleich, dass der inkrementelle Deckungsbeitrag den zusätzlichen Spend in diesem Messfenster nicht vollständig deckt. Ob die Maßnahme dennoch sinnvoll ist, hängt unter anderem von Folgekäufen, Cash-Timing, Unsicherheit und dem vorab definierten Entscheidungskriterium ab.

Zum Ergebnis gehören außerdem das Konfidenzintervall des Lifts, die Anzahl analysierter Einheiten und die Compliance mit der Zuteilung. Ohne diese Angaben wirkt die Dezimalzahl präziser, als das Experiment erlaubt.

Geo-Lift- und Matched-Market-Tests

Wenn individuelle Randomisierung nicht möglich ist, können Regionen als Testeinheiten dienen. Historische Daten werden genutzt, um Regionen mit ähnlichem Niveau und Verlauf zu matchen oder eine synthetische Kontrolle zu bilden. Anschließend wird Spend nur in den Testregionen verändert und die Abweichung vom geschätzten Kontrollverlauf gemessen.

Prüfpunkte für einen Geo-Test
PrüfpunktRisikoKontrolle
Pre-Period-FitRegionen folgen bereits vor dem Test anderen TrendsMehrere Vorperioden, Placebo-Tests, Fit-Metrik
SpilloverKontrollregion sieht Werbung oder kauft im TestgebietGeografische Puffer, Auslieferungsprüfung, Sensitivität
Lokale SchocksWetter, Feiertag, Wettbewerb oder Store-EreignisEreignisprotokoll und robuste Vergleichsmodelle
Wenige ClusterUnsicherheit wird unterschätztCluster-gerechte Inferenz und vorsichtige Interpretation
BudgetverschiebungPlattform liefert Spend in andere Regionen umTatsächliche regionale Exposition und Spend prüfen

Ein Geo-Test ist nicht automatisch robuster als Attribution. Ohne parallele Trends oder plausibles Kontrollmodell kann ein regionaler Unterschied fälschlich der Werbung zugeschrieben werden. Testregionen sollten daher nicht nach dem beobachteten Ergebnis gewählt oder ausgetauscht werden.

Kontamination und typische Analysefehler

  • Kontrollgruppe wird exponiert: Organische Shares, andere Kampagnen oder Cross-Device-Auslieferung verkleinern den gemessenen Kontrast.
  • Testgruppe wird nicht erreicht: Niedrige Auslieferung misst den Effekt des Assignments, nicht zwingend den Effekt einer vollständigen Exposition.
  • Parallelmaßnahmen ändern sich: Preis, Promotion, E-Mail oder Bestand dürfen nicht systematisch nur in einer Gruppe variieren.
  • Zwischenstände steuern das Ende: Wiederholtes Prüfen und Stoppen bei einem günstigen Wert erhöht Fehlentscheidungen, wenn es der Analyseplan nicht berücksichtigt.
  • Novelty und Carryover: Ein kurzer Test kann Einführungs- oder Verzögerungseffekte überzeichnen. Mess- und Nachlaufzeit folgen der Customer Journey.
  • Mehrere Zielgrößen: Viele Segmente und Outcomes erhöhen die Chance zufälliger Treffer. Primärmetrik und Korrekturregeln werden vorab festgelegt.

iROAS für Budgetentscheidungen nutzen

  1. Wirtschaftliche Schwelle definieren: Leiten Sie sie aus Wertbasis, Marge, Cash-Timing und Opportunitätskosten ab, nicht aus einer pauschalen Branchenzahl.
  2. Intervall statt Punkt lesen: Prüfen Sie, welche Entscheidungen über den plausiblen Wertebereich robust bleiben.
  3. Gültigkeit begrenzen: Das Ergebnis gilt zunächst für getestete Zielgruppe, Kanal, Creative, Budgetniveau und Zeitraum.
  4. Skalierung separat testen: Durchschnittlicher iROAS eines Budgets ist nicht automatisch der marginale iROAS des nächsten Budgetschritts.
  5. Mit operativen Kennzahlen verbinden: Nutzen Sie Plattform- und Blended-ROAS für Diagnose und Monitoring, ohne sie als Kausalbeweis umzudeuten.
  6. Replikation planen: Wiederholen Sie entscheidungsrelevante Tests, wenn Saison, Creative, Zielgruppe oder Marktstruktur sich materiell ändern.

Ein Experiment reduziert Unsicherheit, beseitigt sie aber nicht. Die beste Entscheidung dokumentiert Schätzwert, Intervall, Testgrenzen und die Konsequenz eines Fehlers – und legt fest, welche neue Evidenz eine Budgetentscheidung ändern würde.

Häufige Fragen

Was ist inkrementeller ROAS?

Inkrementeller ROAS, kurz iROAS, setzt den durch Werbung kausal zusätzlich erzeugten Umsatz oder Deckungsbeitrag ins Verhältnis zu den dafür zusätzlich eingesetzten Werbeausgaben. Die gewählte Wertbasis muss im Namen und Report ausdrücklich genannt werden.

Wie lautet die iROAS-Formel?

Revenue-iROAS = inkrementeller Umsatz geteilt durch inkrementelle Werbeausgaben. Contribution-iROAS = inkrementeller Deckungsbeitrag geteilt durch inkrementelle Werbeausgaben. Der Lift wird aus der Differenz zwischen Test- und Kontrollszenario nach einer vorab definierten Skalierung oder Modellierung bestimmt.

Wie unterscheidet sich iROAS vom Plattform-ROAS?

Plattform-ROAS verwendet von einer Werbeplattform attribuierten Umsatz. iROAS schätzt mit einem Gegenfaktum, wie viel Umsatz oder Deckungsbeitrag ohne die getestete Werbung entstanden wäre, und misst nur die Differenz. Attribution und Kausalität sind daher nicht austauschbar.

Wie funktioniert ein randomisierter Holdout-Test?

Geeignete Einheiten werden vor Testbeginn zufällig einer Test- und einer Kontrollgruppe zugeordnet. Nur die Testgruppe erhält die untersuchte Werbemaßnahme. Nach einem vorab festgelegten Zeitraum werden Ergebnis und Spend der Gruppen nach der gewählten Analyse verglichen; Abbrüche und Ausschlüsse werden dokumentiert.

Wann ist ein Geo-Test sinnvoll?

Ein Geo-Test kann sinnvoll sein, wenn eine individuelle Randomisierung technisch nicht möglich ist oder Kanäle regional schaltbar sind. Regionen sollten aus stabilen Vorperioden gematcht werden. Spillover, kleine Fallzahlen, lokale Ereignisse und unterschiedliche Trends begrenzen die Aussagekraft.

Was ist ein guter inkrementeller ROAS?

Es gibt keinen universellen guten iROAS. Die Entscheidungsschwelle hängt von der verwendeten Wertbasis, Bruttomarge, variablen Kosten, Cash-Timing, Risikotoleranz und alternativen Budgetverwendung ab. Ein Punktschätzer sollte zusammen mit Unsicherheit und Testdesign gelesen werden.

Ritik Namdev

Über den Autor

Ritik Namdev

Growth Marketing Manager, Fairview

Growth-Marketer mit fünf Jahren Erfahrung in Analytics, Conversion und programmatischem SEO für contentgetriebene SaaS-Unternehmen.

Redaktionell geprüft von Akshay VR