Google Ads · Versuchsplanung · Stand: 14. September 2026
1. Ein Experiment beginnt mit der Entscheidung danach
Google-Ads-Experimente helfen Ihnen, eine konkrete Änderung gleichzeitig gegen die bisherige Kampagneneinstellung zu prüfen. Aussagekräftig wird der Vergleich erst, wenn Hypothese, Messung, Zuteilung, Laufzeit und Entscheidungsregel vor dem Start zusammenpassen. Ein grüner Ergebniswert allein beantwortet noch keine Geschäftsfrage.
Vielleicht möchten Sie eine andere Gebotsstrategie einsetzen, ein Formular vereinfachen oder eine neue Ausrichtung prüfen. Die erste Frage lautet: Welche Entscheidung würde ein überzeugendes Ergebnis auslösen? Wenn Sie die Variante unabhängig vom Ausgang ohnehin übernehmen müssen, benötigen Sie möglicherweise eine kontrollierte Einführung mit Überwachung. Für einen Vergleich, dessen Ergebnis eine echte Wahl ermöglicht, lohnt sich ein Versuchsplan.
Das Ergebnis muss eine Handlung tragen
Dieser Leitfaden konzentriert sich auf benutzerdefinierte Search-Experimente für kleine und mittlere Unternehmen. Sein Arbeitsinstrument ist das Google-Ads-Versuchsprotokoll: eine ausfüllbare Verbindung aus Fragestellung, Messvertrag, Kalender und Freigabe. Sie können die Tabellen in Ihr eigenes Dokument übernehmen. Die vorgeschlagenen Felder und betrieblichen Schwellen sind eine redaktionelle Arbeitshilfe, keine zusätzliche Google-Funktion.
Am Ende stehen vier verständliche Ergebnisse: Variante übernehmen, Variante verwerfen, Frage noch nicht entschieden oder Versuch wegen einer Störung nicht interpretierbar. Auch die letzten beiden Ausgänge sind brauchbar, wenn sie verhindern, dass ein unsicherer Befund zum dauerhaften Kampagnenstandard wird.
2. Wählen Sie das Experiment passend zur Frage
Ein Vorher-nachher-Vergleich vermischt Ihre Änderung mit allem, was zwischen den Zeiträumen passiert: Nachfrage, Wettbewerb, Feiertage oder Vertriebsbesetzung. Ein gleichzeitig laufender Versuch reduziert solche Zeitunterschiede. Er löst jedoch keine unklare Messdefinition und repariert keine technisch fehlerhafte Variante.
Google bietet mehrere Experimentwege, darunter Anzeigenvariationen und unterschiedliche Kampagnenexperimente. Die Übersicht der Experimenttypen hilft bei der Zuordnung. Eine Aussage zu Search lässt sich nicht ohne Prüfung auf Performance Max, Demand Gen oder Video übertragen. Deren Voraussetzungen, Auswertungen und Übernahmemöglichkeiten können abweichen.
Prüfen Sie zuerst, ob die Änderung getrennt ausspielbar ist
Die aktive Ursprungskampagne muss den vorgesehenen Vergleich ermöglichen und währenddessen weiterlaufen. Gemeinsame Budgets oder nicht unterstützte ältere Anzeigenformate können die Einrichtung blockieren. Klären Sie solche Hindernisse vor der Terminfreigabe. Eine verspätete Anzeigenfreigabe kann außerdem bewirken, dass der geplante Start noch nicht der tatsächliche Beginn eines vergleichbaren Tests ist.
Bei einer Landingpage-Änderung brauchen Sie zwei eindeutig erreichbare Zustände. Prüfen Sie, ob die gewählte Experimentart die Zuordnung sauber abbildet und ob eine Anzeigenänderung versehentlich beide Varianten betrifft. Ein Paket aus neuem Formular, neuer Überschrift und anderem Angebot wäre ein Pakettest: Sie könnten seinen Gesamteffekt untersuchen, aber keine einzelne Komponente als Ursache auszeichnen.
3. Formulieren Sie eine überprüfbare Hypothese
„Wir testen Optimierungen“ lässt offen, was sich ändern soll und woran Sie Erfolg erkennen. Eine brauchbare Hypothese verbindet eine beobachtete Hürde mit genau einer geplanten Änderung, einem plausiblen Wirkmechanismus und einer wirtschaftlich relevanten Kennzahl. Die Begründung erklärt Ihre Erwartung; sie ist noch kein Beweis dafür.
Ein konkretes Lehrbeispiel für einen B2B-Anbieter
Die fiktive Rheinbogen Industrietechnik erhält Anfragen für betriebliche Wartung. Sie vermutet, dass zwei zusätzliche Pflichtfelder geeignete Interessenten abschrecken. Der Versuch soll nur diese beiden Felder freiwillig machen: vier statt sechs Pflichtfelder, bei gleichem Angebot und unveränderter Definition einer vertrieblich qualifizierten Anfrage. Es handelt sich um ein erfundenes Lehrbeispiel, nicht um Salestudia-Kundendaten.
Hypothese: „Vier statt sechs Pflichtfelder senken die Kosten je qualifizierter Anfrage um mindestens 10 %, weil geeignete Interessenten seltener abbrechen. Das qualifizierte Anfragevolumen und die Bearbeitungsqualität müssen unsere vorher vereinbarten Schutzgrenzen einhalten.“
Die Geschäftsleitung legt die 10 % selbst fest. Bei einem reifen Ausgangs-CPA von 200 € entspricht das mindestens 20 € weniger Werbekosten je qualifizierter Anfrage. Bei rechnerisch konstanten 100 Anfragen wären es 2.000 €. Das konstante Volumen ist eine Vergleichsannahme, keine Prognose. Wenn die Umsetzung und der zusätzliche Prüfaufwand diesen Nutzen aufzehren, ist die Schwelle zu niedrig angesetzt.
4. Füllen Sie das Google-Ads-Versuchsprotokoll aus
Erstellen Sie vor der Einrichtung eine freigegebene Version. Die zweite Spalte enthält die Angaben, die Sie für Ihren eigenen Versuch ersetzen. Die Beispielspalte zeigt den Zusammenhang, ohne Ihnen allgemeingültige Grenzwerte vorzugeben. Ergänzen Sie anschließend die Kennzahlentabelle, den Kalender und die Abschlussentscheidung aus den folgenden Abschnitten.
Ein Dokument verbindet Geschäft, Konto und Auswertung
| Baustein | Ihr Eintrag | Beispiel Rheinbogen | Nachweis | Verantwortung | Freigabeprüfung |
|---|---|---|---|---|---|
| Identität | [ID, Version, Datum, Kampagnen] | RB-FORM-01, Version 1, Search Wartung | Kontonamen und Kampagnen-IDs | Kontobetreuung | Testweg und Ursprung eindeutig? |
| Ausgangsbefund | [Beobachtung, Referenzzeitraum, Saison] | Abbrüche am Formular; reifer CPA 200 € | Formularanalyse und gereifte Ads-Daten | Analytics | Keine ungeklärte Messstörung? |
| Fragestellung | [Änderung, Mechanismus, Entscheidung] | Zwei Pflichtfelder werden freiwillig | Dokumentierte Formularvarianten | Website-Verantwortliche | Nur die geplante Änderung? |
| Vergleich | [Zustand A, Zustand B, Umsetzung] | Sechs gegen vier Pflichtfelder; Rest gleich | Getrennt geprüfte Seitenzustände | Website-Verantwortliche | Beide Arme tatsächlich verschieden? |
| Messung | [Aktion, Formel, Filter, Attribution, Zeitzone, Währung] | CPA einer qualifizierten Anfrage, Euro | CRM-Definition und Ads-Konfiguration | Vertrieb und Analytics | In beiden Armen gleich? |
| Zuteilung | [Methode, Einheit, Split, Budget] | Cookie-basiert, 50/50 geplant | Gespeicherte Einrichtung | Kontobetreuung | Geteilte Ressourcen geprüft? |
| Wirtschaftlichkeit | [Schwelle und Herleitung] | Mindestens 10 % weniger CPA | 200 € Ausgangs-CPA, Aufwandsschätzung | Geschäftsleitung | Nutzen nach Zusatzaufwand? |
| Schutzkennzahlen | [Grenzen, Quelle, Reife, Zuständigkeit] | Volumen, Bearbeitbarkeit und Versuchskosten | Ausgefüllter Kennzahlenvertrag | Vertrieb und Kontobetreuung | Konkrete Grenzen freigegeben? |
| Machbarkeit | [Volumen je Arm, Streuung, Präzision, Zeit- und Kostenlimit] | Reife Historie vor Kalenderfreigabe prüfen | Volumenprognose mit benannten Annahmen | Analytics | Frage mit diesem Datenbudget tragfähig? |
| Statistik | [Methode, Niveau, gegebenenfalls Power-Annahmen] | Experimentbericht; 95 % vorab gewählt | Berichtseinstellung und Planungsnotiz | Analytics | Verfahren passt zur Kennzahl? |
| Kalender | [Start, Anlauf, Messphase, Stichtag] | Erst nach Volumen- und Reifeprüfung | Historie und Conversion-Verzögerung | Analytics | Auch maximal bezahlbare Dauer? |
| Eingriffsregeln | [Wartung, Journal, Stopp, Verlängerung, Neustart] | Formularausfall sofort behandeln | Vorab vereinbarter Störungsablauf | Benannte Entscheidungsvertretung | Stopp auch bei Abwesenheit möglich? |
| Entscheidungsregel | [Nutzen, Unsicherheit, Schutz, Entscheidungstermin] | Ungünstiger CPA-Intervallrand höchstens −10 %; Schutz bestanden | Geschäftliche Freigaberegel | Geschäftsleitung | Kein nachträglicher Maßstabwechsel? |
| Abschluss | [Ist-Zeitraum, Reife, Kosten, Effekt, Abweichungen, Entscheidung, Nachkontrolle] | Ausgefüllter Befund samt Übernahmeweg | Berichtsexport und Abschlussvermerk | Analytics und Geschäftsleitung | Freigabe und Nachkontrolltermin benannt? |
Notieren Sie zusätzlich Zeitzone, Währung, Attribution und den vollständig gereiften Referenzzeitraum. Ein Link zum Konto ersetzt diese Angaben nicht: Einstellungen und Berichte können sich später ändern. Halten Sie auch fest, wer eine Verlängerung genehmigen darf und welche Beobachtung einen neuen Versuch statt einer Fortsetzung verlangt.
5. Sorgen Sie für dieselbe Messung auf beiden Seiten
Im Beispiel muss eine qualifizierte Anfrage vor und während des Tests dasselbe bedeuten. Bleibt die bisherige Variante streng geprüft, während das kürzere Formular ungeprüfte Anfragen als Erfolg meldet, vergleichen Sie zwei Definitionen. Die größere Zahl wäre dann keine nachgewiesene Verbesserung der Leadgewinnung.
Berichtskennzahl und Gebotsziel sind verschiedene Einstellungen
Eine im Experiment hervorgehobene Erfolgskennzahl legt nicht automatisch fest, welche Conversion Actions für Gebote verwendet werden. Primäre Aktionen eines ausgewählten Standardziels gehen normalerweise in „Conversions“ und die Gebotssteuerung ein; sekundäre dienen üblicherweise der Beobachtung. Bei ausgewählten benutzerdefinierten Zielen können jedoch auch als sekundär markierte Aktionen für Gebote verwendet werden. Prüfen Sie diese Regeln zu primären und sekundären Conversion Actions im tatsächlichen Kampagnenziel.
Für die Einrichtung hilft die getrennte Übersicht zu Google-Ads-Conversion-Zielen und ihrer Verwendung. Im Versuch bleiben Aktion, Zählweise, Werte und fachliche Qualifikation konsistent. Kontrollieren Sie beide Formularwege bis zum CRM und zur vorgesehenen Rückmeldung. Auch Fehlerseiten, doppelte Übermittlungen und fehlende Kennungen gehören in diesen Funktionstest.
Vereinbaren Sie außerdem, wie lange der Vertrieb für die Einstufung benötigt. Wenn Anfragen einer Variante zufällig häufiger am Freitag eintreffen, kann eine frühe Montagsauswertung deren Qualität unterschätzen. Vergleichen Sie gereifte Ergebnisse derselben Interaktionszeiträume und dokumentieren Sie ungeklärte Fälle, statt sie stillschweigend als ungeeignet einzustufen.
6. Entscheiden Sie Zuteilung und Split vor dem Start
Bei benutzerdefinierten Search-Experimenten empfiehlt Google eine Aufteilung von 50/50. Sie lässt unter vergleichbaren Bedingungen viel Information in beide Arme fließen. Die Anleitung zur Einrichtung unterscheidet außerdem eine Cookie-basierte und eine suchbasierte Zuteilung.
Wiederholte Kontakte verändern die passende Methode
Cookie-basiert wird ein Nutzer anhand des Cookies einer Variante zugeordnet. Das kann hilfreich sein, wenn wiederholte Besuche mit verschiedenen Formularen die Frage verwischen würden. Daraus folgt keine garantierte Identität über Geräte, Browser und Einwilligungszustände hinweg. Bei suchbasierter Zuteilung entscheidet jede Suche erneut; dieselbe Person kann daher beide Varianten erleben. Dieser Unterschied gehört zur Versuchsfrage, nicht erst zur Ergebnisdiskussion.
50/50 bedeutet außerdem keine Garantie für identische Tagesausgaben, Impressionen oder Conversions. Die Zuteilung findet auf Ebene geeigneter Auktionen vor der weiteren Ausrichtung statt. Varianten können unterschiedliche Auslieferung und Kosten entwickeln. Pausieren Sie deshalb nicht eigenmächtig den teureren Arm, um die Buchhaltung symmetrisch aussehen zu lassen.
Dokumentieren Sie Traffic-Aufteilung und Budgeteinstellung getrennt. Prüfen Sie auffällige Unterschiede auf Freigaben, Einschränkungen, Gebote und Tracking. Ein erklärbarer Unterschied kann zum untersuchten Effekt gehören; ein technischer Ausfall kann den Vergleich beschädigen. Bei wiederkehrenden Nutzern sollten Sie auch Überschneidungen mit anderen laufenden Änderungen im Konto und auf der Website berücksichtigen.
7. Ein Änderungsstopp schützt die Vergleichbarkeit
Ein laufender Versuch braucht einen ruhigen Betrieb. Wenn Sie gleichzeitig Keywords ergänzen, Anzeigen ändern, neue Zielgebiete öffnen und das Formular testen, wird die Interpretation unklar. Notwendige Wartung bleibt möglich, muss aber festgelegt, nachvollziehbar und hinsichtlich ihrer Wirkung auf beide Arme bewertet sein.
Sync ist kein Ersatz für ein eigenes Änderungsjournal
Die Experiment-Synchronisierung übernimmt Änderungen aus der Ursprungskampagne in die Testkampagne. Sie ist bei der Erstellung standardmäßig eingeschaltet; die Entscheidung wird dort festgelegt. Änderungen aus dem Test fließen nicht zurück. Synchronisierung überträgt Änderungen, garantiert aber keinen vollständig identischen Zustand aller Einstellungen.
Google weist außerdem darauf hin, dass synchronisierte Änderungen nicht als solche im Änderungsverlauf erscheinen und ein Synchronisierungsfehler weitere Übernahmen stoppen kann. Notieren Sie deshalb Datum, Verantwortliche, Anlass, betroffene Einstellung und tatsächlichen Zustand beider Arme in Ihrem eigenen Journal.
Anzeigen können zwischen den Varianten geteilt sein. Eine Bearbeitung der Kontrollanzeige oder bestimmte Massenänderungen können auch bei ausgeschaltetem Sync beide Seiten betreffen. Prüfen Sie die tatsächliche Ressourcenbeziehung, bevor Sie aus „Sync aus“ eine vollständige Trennung ableiten.
Im Rheinbogen-Beispiel werden deshalb beide Formularzustände technisch geprüft und eindeutig versioniert. Angebot, Preis, Qualifikationsregel und Vertriebsprozess bleiben fest. Muss das Unternehmen eines davon wesentlich ändern, entscheidet die zuständige Person über Abbruch oder Neuplanung. Ein unbemerkter Mischversuch soll nicht bis zum vorgesehenen Enddatum weiterlaufen.
8. Trennen Sie Hauptkennzahl, Schutz und Diagnose
Die Hauptkennzahl beantwortet die ursprüngliche Frage. Schutzkennzahlen begrenzen Schäden. Diagnosewerte erklären Auffälligkeiten und liefern nächste Hypothesen. Diese Rollen verhindern, dass Sie nachträglich die einzige positive Zahl zum eigentlichen Ziel erklären.
Ein kleiner Messvertrag ist wirksamer als zwanzig Erfolgskriterien
| Rolle | Kennzahl | Definition | Quelle | Regel im Beispiel | Typischer Fehler |
|---|---|---|---|---|---|
| Hauptkennzahl | Qualifizierter CPA | Werbekosten / qualifizierte Anfragen | Ads mit festgelegter CRM-Aktion | Mindestens 10 % Verbesserung | Alle Formulare statt qualifizierter Anfragen |
| Schutz | Qualifiziertes Volumen | Gereifte Anfragen je Vergleichsarm | Ads und CRM-Abgleich | Vorab vereinbarte Verlustgrenze einhalten | Günstigen CPA trotz starkem Volumenverlust feiern |
| Schutz | Bearbeitbarkeit | Anteil fachlich nicht bearbeitbarer Anfragen | Gleiche CRM-Prüfung beider Arme | Zulässige Quote vor Start eintragen | Offene Einstufungen als schlechte Leads zählen |
| Schutz | Versuchskosten | Ausgaben beider Arme im vereinbarten Zeitraum | Konto und Budgetfreigabe | Euro-Grenze und Eingriffsrecht eintragen | Eine Budgetüberschreitung als Statistikfrage behandeln |
| Diagnose | Klicks und Formularstarts | Definierte Interaktionen, separat betrachtet | Ads und Website-Analyse | Erklären, keinen Gewinner bestimmen | Mehr Starts mit mehr geeigneten Kunden verwechseln |
Die offenen Schutzwerte sind Pflichtfelder Ihres eigenen Protokolls. Legen Sie Zahlen, Mindestdatenreife und zuständige Personen fest, bevor Ausgaben entstehen. Ein Vertrieb mit wenig Kapazität benötigt andere Grenzen als ein Unternehmen, das bewusst zusätzliche qualifizierte Nachfrage einkauft.
Für den qualifizierten CPA muss „Conversions“ im verwendeten Vergleich tatsächlich die vereinbarte qualifizierte Aktion abbilden. Ein gemischter Kosten-pro-Conversion-Wert aus Formularen, Telefonklicks und qualifizierten Anfragen erfüllt diesen Vertrag nicht. Liegt die Qualifikation nur außerhalb von Google Ads vor, berechnet der Experimentbericht nicht automatisch ein Intervall für Ihre externe CRM-Kennzahl. Dafür benötigen Sie eine gesonderte, methodisch passende Auswertung.
Prüfen Sie stattdessen eine wertbasierte Gebotsstrategie, müssen Conversion-Stufe und Wertmodell während dieses Strategievergleichs bestehen bleiben. Die vorherige Anleitung zur Berechnung belastbarer Leadwerte behandelt diese Vorarbeit. Wertmodell und Gebotsstrategie gleichzeitig auszutauschen würde eine andere, schwerer zuzuordnende Frage erzeugen.
9. Prüfen Sie, ob Ihr Datenvolumen die Frage tragen kann
Eine kleine Kampagne kann technisch einen Versuch starten und trotzdem zu wenig Information für die gewünschte Entscheidung liefern. Zehn Prozent Verbesserung zu unterscheiden ist unter sonst gleichen Bedingungen anspruchsvoller als einen sehr großen Effekt zu erkennen. Die benötigte Information hängt auch von Streuung, Abhängigkeiten, Zuteilung und Kennzahl ab.
Geschäftliche Relevanz ist keine statistische Mindestgröße
Stellen Sie reifes Ausgangsvolumen, voraussichtliches Volumen je Arm und maximal bezahlbare Dauer gegenüber. Wenn nur wenige qualifizierte Anfragen pro Woche entstehen, darf die Planung nicht so tun, als werde eine feine CPA-Differenz nach einem kurzen Zeitraum sicher erkennbar. Eine größere, fachlich begründete Änderung oder ein späterer Versuch kann sinnvoller sein.
Campaign Guidance schätzt die Teststärke anhand von Historie, angenommenem Effekt und Dauer. Google beschreibt die Funktion für Performance-Max-Experimente und Broad-Match-Experimente in Search. Sie steht damit nicht automatisch in jedem benutzerdefinierten Search-Test zur Verfügung.
Power beschreibt die Chance, einen angenommenen Effekt mit dem gewählten Verfahren zu erkennen. Sie ist weder die Wahrscheinlichkeit eines profitablen Rollouts noch das Konfidenzniveau des späteren Intervalls. Eine externe Planung muss ihre Annahmen nennen; eine einfache Rechnung mit zwei Conversion-Raten ist nicht automatisch für CPA, ROAS oder wiederholte Nutzerkontakte geeignet. Lassen Sie einen Versuch aus, wenn sein realistisches Datenbudget die eigentliche Frage nicht beantworten kann.
10. Planen Sie Anlauf, Messphase und Datenreife getrennt
Es gibt keine seriöse universelle Antwort „Jeder Google-Ads-Test dauert 14 Tage“. Der Kalender hängt von Experimenttyp, Änderung, Volumen, Wochenrhythmus und Verzögerung der Ergebnisse ab. Eine Anzeigenfreigabe, die Anpassung einer Gebotsstrategie und die spätere Qualifikation eines Leads sind verschiedene Vorgänge.
Der konkrete VBB-Zeitplan ist ein eigener Anwendungsfall
Für Experimente mit wertbasierten Geboten setzt Google bereits gemessene Conversion-Werte voraus: mindestens zwei unterschiedliche, von null verschiedene Werte. Zusätzlich empfiehlt Google vor der Aufteilung mindestens 50 Kampagnen-Conversions in den vergangenen 30 Tagen. Die Volumenempfehlung ist weder eine allgemeine Zugangshürde für VBB noch eine Garantie ausreichender Teststärke.
- Anlauf von zwei Wochen oder ein bis zwei Conversion-Zyklen einplanen, je nachdem, was länger dauert; diesen Zeitraum ausklammern.
- Danach mindestens 30 Tage ununterbrochen laufen lassen. Ein früher signifikanter Zwischenstand ersetzt diese Phase nicht.
- Junge Auswertungstage mit weniger als 90 % gemeldeten Conversions ausschließen und die zusätzliche Verzögerung wichtiger Werte prüfen.
Bei einem tatsächlich ausreichenden zweiwöchigen Anlauf bedeutet das mindestens 14 plus 30 Tage, zuzüglich der notwendigen Reife am Ende. Längere Conversion-Zyklen verschieben den gesamten Kalender. Übertragen Sie diese Sonderempfehlung nicht ungeprüft auf den Formularversuch.
Untersuchen Sie für Ihren eigenen Kalender die Verzögerung bis zur Conversion. Kosten können bereits vollständig vorliegen, während Ergebnisse noch eintreffen. Ein historisch typischer Nachlauf ist eine Planungshilfe, keine Vollständigkeitsgarantie. Conversion-Fenster, tatsächlicher Abschlussabstand und Upload-Verzögerung bleiben getrennte Angaben.
11. Überwachen Sie den Betrieb ohne tägliche Gewinnerwahl
Täglich nachzusehen ist sinnvoll, wenn Sie Formularausfälle, Anzeigenablehnungen, unterbrochene Rückmeldungen oder unvertretbare Ausgaben erkennen möchten. Täglich den besten Zwischenstand zum Endergebnis zu erklären, ist eine andere Handlung. Trennen Sie deshalb Betriebsüberwachung und die vorab vereinbarte Wirksamkeitsentscheidung.
Definieren Sie zulässige Eingriffe vor den ersten Ergebnissen
Das Journal enthält die Störung, den Zeitpunkt, beide betroffenen Arme und die getroffene Maßnahme. Ein Schutzstopp benötigt keinen Signifikanznachweis. Der Abschluss kann dann „wegen Formularausfall abgebrochen“ lauten. Er darf nicht ohne weitere Grundlage in „Variante ist statistisch schlechter“ umbenannt werden.
Nach den Experiment-FAQ lässt sich der Traffic-Split nach der Einrichtung nicht einfach verändern; eine andere Aufteilung erfordert einen neuen Versuch. Vermeiden Sie außerdem gleichzeitig laufende Änderungen, die sich auf dieselben Kampagnen oder denselben Traffic auswirken. Ein neues Verhältnis mitten im Vergleich schafft keinen unveränderten Test mit lediglich bequemerem Budget.
Vereinbaren Sie eine maximale Dauer und eine sachliche Verlängerungsregel. „Wir warten, bis etwas signifikant wird“ ist keine solche Regel. Wenn das geplante Volumen wegen einer dokumentierten Unterbrechung ausbleibt, prüfen Sie zunächst die Interpretierbarkeit und das verbleibende Zeitfenster. Eine Feiertagsphase oder ein neues Angebot kann die ursprünglich gedachte Vergleichssituation inzwischen verändert haben.
12. Lesen Sie Effekt, Intervall und Nutzen gemeinsam
Beginnen Sie mit tatsächlichem Vergleichszeitraum, Datenreife, absoluten Werten und der relativen Veränderung. Ergänzen Sie das Intervall samt gewähltem Niveau. Die aktuelle Anleitung zur Überwachung beschreibt auswählbare Konfidenzintervalle mit 80 % als Standard. Speichern Sie, was Ihr konkreter Bericht verwendet.
Drei mögliche Befunde sind drei verschiedene Entscheidungen
Die folgende Tabelle enthält frei gewählte alternative Lehrszenarien für Rheinbogen. Die Intervalle sind angenommene Berichtsergebnisse mit einem vorab gewählten 95-%-Konfidenzniveau, keine aus dargestellten Conversion-Summen berechneten Google-Ergebnisse. Dabei bildet „Conversions“ ausschließlich die vereinbarte qualifizierte Aktion ab; nur dann entspricht der verwendete Kosten-pro-Conversion-Wert dem qualifizierten CPA. Ein negatives CPA-Vorzeichen bedeutet Verbesserung. Die Euro-Werte beziehen die Punktschätzung lediglich auf den festen Ausgangswert von 200 €.
| Szenario | CPA-Effekt | Angenommenes Intervall | Rechnerischer CPA | 10-%-Schwelle | Einordnung |
|---|---|---|---|---|---|
| A: erkennbar, klein | −3 % | −5 % bis −1 % | 194 € | Auch günstigster Rand erreicht sie nicht | Nach dieser Geschäftsregel nicht übernehmen |
| B: unentschieden | −10 % | −24 % bis +8 % | 180 € | Punkt erreicht sie; Verschlechterung bleibt möglich | Kein belastbar nachgewiesener wirtschaftlicher Vorteil |
| C: überzeugender | −18 % | −24 % bis −12 % | 164 € | Auch ungünstigerer Rand übertrifft sie | Übernahme bei bestandenen weiteren Prüfungen möglich |
Der Maßstab, dass das gesamte Intervall die wirtschaftliche Schwelle überschreiten soll, ist hier eine konservative betriebliche Freigaberegel. Google schreibt ihn nicht allgemein vor. Eine andere Risikobereitschaft ist möglich, gehört aber vor dem Test dokumentiert. Prüfen Sie zusätzlich Kosten, qualifiziertes Volumen und Bearbeitbarkeit; keine Tabellenzeile ersetzt diese Schutzprüfung.
13. Verwechseln Sie Unsicherheit nicht mit Gleichheit
Ein Intervall, das sowohl negative als auch positive CPA-Effekte umfasst, kann eine relevante Verbesserung und einen Schaden zulassen. Das heißt nicht, dass beide Varianten gleich gut sind. „Nicht entschieden“ ist die passende Aussage, wenn das vorhandene Material die wirtschaftliche Wahl nicht ausreichend eingrenzt. Ein Gleichwertigkeitsnachweis bräuchte eine eigens geplante Prüfung mit vorher festgelegten Grenzen.
Das Intervallniveau gehört sichtbar zum Ergebnis
Die Google-Seite zur statistischen Methodik beschreibt weiterhin 95-%-Intervalle, während die aktuelle Monitoring-Hilfe auswählbare Niveaus und 80 % als Standard nennt. Schreiben Sie deshalb nicht pauschal „Google testet immer mit 95 %“. Dokumentieren Sie Experimenttyp, tatsächlich gewähltes Niveau und verwendeten Bericht.
Ein Konfidenzintervall zeigt einen mit Daten und Verfahren vereinbaren Effektbereich. Es bedeutet nicht „95 % Wahrscheinlichkeit, dass diese Variante gewinnt“. Senken Sie das Niveau nach Sichtung eines unentschiedenen Ergebnisses, erhalten Sie keine zusätzliche Information; Sie verändern den Maßstab Ihrer Entscheidung.
Google beschreibt für seine Methodik gruppierte Daten und ein Jackknife-Verfahren zur Unsicherheitsschätzung. Die dafür erforderlichen gruppierten Beobachtungsdaten liegen Ihnen in gewöhnlichen Kampagnensummen nicht vor. Ein selbst berechneter Test aus zwei Conversion-Zahlen ist daher kein Nachbau des offiziellen Experimentberichts. Nutzen Sie zusätzliche Berechnungen nur mit klar benannter eigener Methode und passenden Annahmen.
14. Treffen Sie eine wirtschaftliche Entscheidung
Statistische Erkennbarkeit und wirtschaftlicher Nutzen beantworten verschiedene Fragen. Eine sehr kleine, gut erkennbare CPA-Verbesserung kann weniger einbringen als die laufende Pflege der neuen Lösung kostet. Umgekehrt kann eine große Punktschätzung attraktiv wirken, während ihr breites Intervall noch einen untragbaren Nachteil zulässt.
Rechnen Sie Aufwand und Nebenwirkungen in dieselbe Entscheidung
Bei Rheinbogen gehört zur Freigabe auch die Vertriebsarbeit. Zwei freiwillige Felder können eine Anfrage erleichtern und gleichzeitig Rückfragen erforderlich machen. Bewerten Sie diesen Zusatzaufwand mit derselben Definition in beiden Armen. Ersetzen Sie die vereinbarte Hauptkennzahl nicht nachträglich, sondern prüfen Sie die vorher festgelegten wirtschaftlichen Grenzen.
Auch ein höherer Gesamtwert bei schlechterem ROAS ist nicht automatisch gut oder schlecht. Das Unternehmen muss vorab festlegen, wie viel zusätzliche Nachfrage es zu welcher Effizienz akzeptiert. Betrachten Sie absolute Größen und die passende Verhältniskennzahl zusammen; ein günstiger Quotient bei stark geschrumpftem Geschäft kann die eigentliche Aufgabe verfehlen.
Ein Variantenvergleich belegt außerdem nicht, wie viele Kunden ohne jede Werbung ausgeblieben wären. Diese andere Frage behandelt ein geeignetes Inkrementalitätsdesign. Google beschreibt dazu Conversion Lift mit einer entsprechenden Kontrollgruppe ohne die untersuchte Werbeexposition. Die Verfügbarkeit muss separat geprüft werden. Ein Search-Strategietest erhält diese Aussagekraft nicht durch eine bessere Ergebnisfarbe.
15. Unterscheiden Sie einen negativen von einem ungültigen Versuch
Eine sauber gemessene Verschlechterung liefert Wissen über die getestete Änderung. Ein ausgefallenes Formular liefert zunächst Wissen über einen technischen Fehler. Wer beides vermischt, verwirft möglicherweise eine brauchbare Idee oder übernimmt eine Variante auf Grundlage eines beschädigten Vergleichs.
Vier Störungen brauchen vorab einen klaren Umgang
Messung unterbrochen
Eine Conversion Action oder CRM-Rückmeldung fehlt. Zeitraum markieren, Ursache beheben und prüfen, ob eine vollständige vergleichbare Rekonstruktion möglich ist.
Variante nicht erreichbar
Formular, Zielseite oder Freigabe blockiert einen Arm. Schutzmaßnahmen auslösen; den Ausfall nicht als nachgewiesenen Effekt des geplanten Inhalts behandeln.
Definition verändert
Qualifikation oder Werte werden währenddessen anders bestimmt. Die ursprüngliche Frage ist möglicherweise nicht mehr identisch; Neustart statt stiller Fortsetzung prüfen.
Schutzgrenze verletzt
Ausgaben oder betriebliche Schäden überschreiten die freigegebene Grenze. Eingreifen, auch ohne Signifikanz, und den tatsächlichen Abbruchgrund festhalten.
Prüfen Sie die Grundlagen einer verlässlichen Messung und Einwilligung bereits vor dem Start. Unterschiedliche Messausfälle zwischen den Varianten können den Bericht verschieben. Einwilligungszustände sind dabei keine Variable, die Sie zur Verbesserung eines Testergebnisses umgehen dürfen.
Entfernen Sie keine ungünstige Woche erst nach Sichtung des Ergebnisses. Dokumentierte Ausschlüsse brauchen einen sachlichen Grund, dieselbe Regel für beide Arme und eine Bewertung, ob der verbleibende Versuch die ursprüngliche Frage noch trägt.
16. Planen Sie die Übernahme als eigenen Arbeitsschritt
Ein freigegebenes Ergebnis setzt sich nicht selbst korrekt um. Exportieren Sie zuerst Bericht, Vergleichsdaten, Einstellungen und Journal. Bereits vor dem Versuchsbeginn müssen Sie prüfen, ob der gewählte Experimenttyp eine automatische Übernahme anbietet. Deren tatsächlicher Zustand muss zur vereinbarten Geschäftsentscheidung passen: Ist eine manuelle Freigabe vorgesehen, darf eine automatische Übernahme ihr nicht zuvorkommen.
Auf Original anwenden oder neue Kampagne erstellen?
Die Anleitung zur Übernahme eines benutzerdefinierten Experiments unterscheidet zwei Wege. Beim Anwenden auf das Original endet der Versuch und die getesteten Änderungen werden übertragen. Beim Umwandeln in eine neue Kampagne wird der Test zur regulären Kampagne und die ursprüngliche pausiert; die resultierende Kampagne erhält deren Budget und Termine. Beide Leistungshistorien bleiben erhalten.
| Schritt | Auf Original anwenden | In neue Kampagne umwandeln | Nachweis | Abschlussprüfung |
|---|---|---|---|---|
| Freigabe | Änderungen ausdrücklich benennen | Künftige Kampagnenidentität benennen | Unterschriebener Entscheidungsvermerk | Nutzen und Schutz bestanden? |
| Umsetzung | Versuch endet; Original übernimmt | Test wird regulär; Original pausiert | Zustand nach der Übernahme | Richtige Kampagne aktiv? |
| Einstellungen | Ziele, Assets und Budget prüfen | Übernommene Budgets und Termine prüfen | Gesicherter Einstellungsvergleich | Keine unbeabsichtigte Zusatzänderung? |
| Nachkontrolle | Auslieferung und Schutzwerte beobachten | Auslieferung und Schutzwerte beobachten | Termin und verantwortliche Person | Vollausspielung betrieblich tragfähig? |
Die Nachkontrolle bleibt notwendig, weil Vollausspielung und ein späterer Marktzeitraum andere Bedingungen mitbringen. Sie ist eine Betriebsbeobachtung nach dem Versuch, kein neuer randomisierter Beweis. Vermeiden Sie gleichzeitig eine weitere große Änderung, wenn Sie zunächst die Umsetzung des freigegebenen Zustands beurteilen möchten.
17. Häufige Fragen zu Google-Ads-Experimenten
Wie lange muss ein Google-Ads-Experiment laufen?
Es gibt keine passende Einheitsfrist für alle Typen. Planen Sie anhand der konkreten Änderung, des Volumens, der Conversion-Zyklen und der nötigen Präzision. Trennen Sie Anlauf, auswertbare Laufzeit und Datenreife. Für den beschriebenen VBB-Anwendungsfall gelten die gesonderten Empfehlungen mit ausgeklammertem Anlauf und anschließend mindestens 30 Tagen. Ein Kalenderdatum allein beweist weder ausreichende Information noch vollständig eingetroffene Ergebnisse.
Brauche ich mindestens 50 Conversions für jeden Test?
Nein. Die hier genannte Empfehlung bezieht sich auf Googles VBB-Kampagnenexperimente: mindestens 50 Kampagnen-Conversions in den 30 Tagen vor der Aufteilung. Sie ist keine allgemeine Mindestzahl für sämtliche Search-Fragen und keine Garantie ausreichender Power. Die wirtschaftlich wichtige Effektgröße, Streuung und Zuteilung bleiben entscheidend. Bei wenig Volumen kann ein Verzicht oder eine andere Fragestellung sinnvoller sein als ein kaum interpretierbarer Vergleich.
Warum geben zwei 50/50-Arme unterschiedlich viel aus?
Die Aufteilung ist keine Zusage gleicher Ausgaben. Zuteilung, Ausrichtung, Teilnahme an Auktionen und erzielte Ergebnisse sind unterschiedliche Schritte. Prüfen Sie Auffälligkeiten auf Freigaben, Einschränkungen und technische Probleme, bevor Sie sie als Fehler bewerten. Erzwingen Sie keine identischen Summen durch spontane Eingriffe. Bei anderen Aufteilungen prüfen Sie außerdem, ob der Bericht Ergebnisse bereits normalisiert; eine zusätzliche Normalisierung könnte den Vergleich verfälschen.
Soll ich Cookie-basiert oder suchbasiert aufteilen?
Die Entscheidung hängt unter anderem davon ab, ob wiederholte Kontakte derselben Person mit beiden Varianten Ihre Frage beeinträchtigen. Cookie-basiert unterstützt eine beständigere Zuordnung anhand des Cookies, garantiert jedoch keine geräteübergreifende Identität. Suchbasiert wird jede Suche neu zugeteilt; wiederkehrende Suchende können beide Varianten erleben. Dokumentieren Sie die gewählte Methode und ihre Grenzen vor dem Start, besonders bei längeren Entscheidungswegen.
Bedeutet ein signifikantes Ergebnis automatisch übernehmen?
Nein. Der Effekt kann erkennbar und trotzdem wirtschaftlich zu klein sein. Außerdem müssen Datenreife, Vergleichbarkeit und Schutzkennzahlen stimmen. Notieren Sie das tatsächlich gewählte Konfidenzniveau; die aktuelle Monitoring-Hilfe nennt auswählbare Intervalle mit 80 % als Standard. Eine Markierung ohne Niveau und Geschäftsregel ist keine vollständige Entscheidungsgrundlage. Prüfen Sie auch Aufwand und Risiken der dauerhaften Umsetzung.
Was tun, wenn nach der geplanten Laufzeit kein Gewinner feststeht?
Archivieren Sie zunächst einen unentschiedenen Befund. Prüfen Sie, welche relevanten Vorteile und Nachteile das Intervall noch zulässt. Eine Verlängerung muss in einen vorher vereinbarten sachlichen Rahmen passen; beliebiges Weiterlaufen bis zur gewünschten Farbe ist keine verlässliche Regel. Gegebenenfalls benötigen Sie eine deutlichere Variante, mehr tragfähiges Volumen oder einen neu geplanten Versuch. Fehlende Signifikanz beweist keine Gleichwertigkeit.
Darf ich während des Experiments Anzeigen oder Ziele ändern?
Solche Änderungen können die ursprüngliche Frage beschädigen und durch Synchronisierung oder geteilte Anzeigen beide Arme betreffen. Legen Sie zulässige Wartung vorher fest und führen Sie ein eigenes Journal. Ein notwendiger Sicherheitsfix ist möglich; anschließend muss die Interpretierbarkeit neu bewertet werden. Besonders eine geänderte Conversion-Stufe oder Wertdefinition macht aus einem reinen Strategietest möglicherweise einen anderen Vergleich.
Beweist der Test, dass Google Ads zusätzliche Kunden bringt?
Ein Variantenexperiment untersucht eine Änderung gegenüber einer anderen Werbekonfiguration. Es beantwortet nicht automatisch die Frage nach zusätzlichem Geschäft gegenüber keiner untersuchten Werbeexposition. Dafür ist ein geeignetes Inkrementalitätsdesign erforderlich. Die entsprechende Produktverfügbarkeit und Messmethode müssen separat geprüft werden. Beschreiben Sie im Abschluss deshalb genau die tatsächlich untersuchte Entscheidung und vermeiden Sie weitergehende Umsatzversprechen.
18. Schließen Sie jeden Versuch mit einem nachvollziehbaren Vermerk
Ein guter Abschluss enthält mehr als „B gewinnt“. Halten Sie tatsächliche Vergleichsdaten, ausgeschlossene Phasen, Reife, Hauptkennzahl, Effekt und Intervallniveau fest. Ergänzen Sie Schutzkennzahlen, Abweichungen und den wirtschaftlichen Grund Ihrer Entscheidung. So bleibt der Befund verständlich, wenn das Konto später anders aussieht.
Aus einem Test wird eine begründete nächste Handlung
Für Rheinbogen könnte der Abschluss lauten: „Die Formularvariante wird übernommen, weil der vollständig geprüfte Vergleich unsere festgelegte Nutzenregel und alle Schutzgrenzen erfüllt. Die Umsetzung wird am benannten Termin kontrolliert.“ Bei einem anderen Befund steht dort ebenso klar „nicht entschieden“ oder „wegen Messausfall nicht interpretierbar“, mit der passenden Folgehandlung.
Bewahren Sie Hypothese und Ergebnis gemeinsam auf. Diagnosebefunde können neue Fragen anstoßen, werden aber nicht nachträglich zur bestätigten Ausgangshypothese. Planen Sie den nächsten überlappenden Versuch in einer sinnvollen Reihenfolge. Ein Experimentprogramm wird durch wiederholbare Entscheidungen wertvoll, nicht durch die Zahl gleichzeitig laufender Tests.
Sie möchten klären, welche Änderung Ihr Konto mit seinem tatsächlichen Volumen belastbar prüfen kann? Die Google-Ads-Betreuung von Salestudia verbindet Messprüfung, Versuchsplanung und wirtschaftliche Auswertung zu einer nachvollziehbaren Entscheidung.