KI-Textmodi: gemeinsamer Text oder Text je Creative

Zuletzt aktualisiert 9. September 2026Read in English

Der KI-Textdialog kennt zwei Modi. Der gewählte Modus entscheidet, ob ein Text für alle Anzeigen wiederverwendet wird oder ob die KI für jedes einzelne Creative eigenen Text schreibt.

Den vollständigen Durchgang durch Dialog und Briefing beschreibt Anzeigentexte mit KI erzeugen.

Wo du den Modus wählst

Oben im Dialog steht ein Feld Mode mit zwei Kacheln:

  • One copy for all creatives. Die Vorgabe. Eine Erzeugung entsteht und gilt für jede Anzeige des Launches.
  • Different copy per creative (Vision). Die KI sieht sich jedes gewählte Creative an und schreibt Text, der zu dem passt, was darauf zu sehen ist.

Die Vision-Kachel schaltet frei, sobald im Creatives-Schritt mindestens ein Video oder ein Bild mit erreichbarer Vorschau gewählt ist. Videos brauchen keine externe Vorschau, weil ihre Daten den Anbieter nie erreichen. Ist nichts Geeignetes gewählt, bleibt die Kachel gesperrt und weist darauf hin. Ein Lauf ist auf 20 geeignete Creatives begrenzt; der Dialog blockt vorher und erklärt die Grenze, bevor irgendein Aufruf hinausgeht.

Modus 1: ein Text für alle

Der schnelle, günstige Weg und meistens der richtige. uplads führt dein Briefing einmal aus und erzeugt Varianten, die für jede Anzeige gelten.

Nimm ihn, wenn:

  • deine Creatives dasselbe Produkt oder denselben Winkel verkaufen,
  • der Text unabhängig vom Bild variieren soll, Metas Optimierung mischt Texte und Creatives ohnehin,
  • Kosten und Zeit niedrig bleiben sollen, es ist ein einziger Aufruf.

Das gesamte Briefing gilt trotzdem: Produkt, Zielgruppe, Probleme, Nutzen, Ton, Vielfalt, Sprache, CTA-Hinweis und die Anzahl je Feld.

Modus 2: Text je Creative (Vision)

Hier sieht sich die KI jedes Bild wirklich an und schreibt Text, der darauf Bezug nimmt. Sie macht einen Aufruf je Creative und kostet damit etwa so viel wie entsprechend viele normale Erzeugungen. Der Dialog zeigt diesen Hinweis vor dem Erzeugen.

Nimm ihn, wenn:

  • jedes Creative ein anderes Produkt, eine andere Szene oder einen anderen Winkel zeigt, den der Text ansprechen soll,
  • Überschriften und Text zum konkreten Bild passen sollen statt allgemein zu bleiben,
  • dir die engere Verbindung zwischen Bild und Text die Mehrkosten wert ist.

Dazu vier Dinge:

  • Dein Modell muss Bilder verstehen, etwa GPT-4o, GPT-4.1 oder Claude Sonnet und Opus. GPT-4o mini und Claude Haiku gehen auch.
  • Videos lassen sich noch nicht Bild für Bild lesen. Sie fallen auf Text aus Briefing und Dateinamen zurück und sind in der Prüfung deutlich markiert.
  • Bilder, deren Vorschau der externe Anbieter nicht öffnen kann, werden vorab ausgeschlossen und nutzen den gemeinsamen Text.
  • Schlagen einzelne Creatives fehl, gelingen die übrigen trotzdem. Du bekommst eine Warnung, keinen gescheiterten Lauf.

Die Prüfung folgt demselben Muster wie der Carousel-Editor: links ein Creative wählen, rechts Medium und den genauen Text ansehen. Ein Video lässt sich dort abspielen, wenn eine Vorschau existiert, und sein Rückfall auf Briefing und Dateinamen ist ausdrücklich benannt.

Übernimmst du die Ergebnisse, behält jedes Creative beim Ausspielen seinen eigenen Text. Im Text-Schritt wechselst du zwischen den Creatives; Endprüfung und Arbeitsprozess lösen jeweils den passenden Text auf.

Briefing und Regler gelten für beide

Egal welcher Modus, dieselben Einstellungen formen das Ergebnis: die Briefing-Felder, das automatisch aus dem Kampagnenziel gewählte interne Vorgehen, Ton, Vielfalt, Sprache, CTA-Hinweis und die Anzahl der Varianten je Feld (0 bis 5).

Dein gespeicherter Markenkontext samt Stimme gilt in beiden Modi. Produkt und Zielgruppe bleiben über den Lauf hinweg gleich; Vision passt dann jeden Textsatz seinem Creative an.

Was soll ich nehmen?

Fang mit dem gemeinsamen Modus an, er ist günstiger, schneller und für die meisten Launches gut genug, bei denen die Creatives dasselbe Angebot tragen. Greif zu Vision, wenn deine Bilder sich wirklich unterscheiden und der Text benennen soll, was auf jedem zu sehen ist.

Hat dir dieser Artikel weitergeholfen?

Passende Artikel