40 Hausversionen eines Addressable-TV-Spots

Anonymisiertes Anwendungsbeispiel. Geprüft am 15. August 2026.

Aufgabentyp
Produktion
Betrieb
Hybrid
Aufwand
Mittel
Zeitrahmen
5 Wochen
Quelle
Anonymisiert; Zielwerte aus Branchendossier Werbeagentur (08/2026)

Aufgabe

Eine Verbundgruppe schaltet Addressable TV; jedes der 40 Häuser soll seinen Spot mit eigenem Namen, Adresse, Aktion und Sprecher-Ansage bekommen. Klassisch sind das 40 Sprecheraufnahmen und 40 Schnittversionen. Regionalisierte Spots scheitern an den Kosten je Version, nicht an der Idee.

Lösungsweg

Der Basisspot wird klassisch produziert. Endcard, Texttafel und Off-Ton liegen als variable Ebenen im Template. Ein Workflow erzeugt je Haus die Endcard, das Voiceover per Stimm-Synthese in einer Stimme, deren Sprecher der KI-Nutzung vertraglich zugestimmt hat, mischt Ton und rendert in den Senderformaten. Eine automatische Gegenprüfung vergleicht die Ansage per Sprache-zu-Text mit dem Soll-Text und prüft die Adresse im Bild; der Producer sichtet Stichproben und Abweichungen. Generierte Bildanteile werden gekennzeichnet.

Kontrollpunkt Ein Mensch prüft oder gibt das Ergebnis frei.

Wie es technisch abläuft

Jeder Schritt bleibt einzeln prüfbar; Komponenten werden nur dort genannt, wo sie festgelegt sind.

  1. 01 Basisspot klassisch produziert
  2. 02 Variablen Endcard, Tafel, Off-Ton
  3. 03 Sprache ElevenLabs, Sprechervertrag
  4. 04 Render Senderformate
  5. 05 Gegenprüfung Speech-to-Text
  6. 06 Sichtung Producer

Vorher und Nachher

Die Veränderung wird als Arbeitsablauf beschrieben, nicht als Erfolgsversprechen.

Vorher

  • Tage im Studio und Schnitt
  • Hohe Kosten je Version
  • Regionalisierung unterbleibt

Nachher

  • Basisspot einmal, 40 Ableitungen automatisch
  • Synthetische Ansage in lizenzierter Stimme
  • Automatische Gegenprüfung, Producer sichtet

Dokumentierte Ergebniswerte

Die Werte gelten im jeweils beschriebenen Szenario und sind kein allgemeiner Benchmark.

Durchlauf für 40 Versionen (Zielwert)
< 1 Tag
Basisproduktion statt 40
1
Versionen mit dokumentierter Gegenprüfung
100 %

Grenzen und bewusste Entscheidungen

Diese Bedingungen gehören zum Lösungsweg und dürfen nicht aus dem Szenario herausgekürzt werden.

  • Stimmklone nur mit Vertrag: das Landgericht Berlin II hat 2025 ein Recht an der eigenen Stimme bestätigt
  • Generierte Produktszenen sind kennzeichnungspflichtig
  • Text und Logos in generierten Clips bleiben unzuverlässig

Werkzeug-Stack

n8n workflow After Effects Templates / DaVinci Resolve ElevenLabs (lizenzierte Stimme) Whisper / Voxtral (Gegenprüfung)

Versionierung ist der Fall, in dem KI im Bewegtbild heute am verlässlichsten spart: nicht beim Imagefilm, sondern bei den 39 Ableitungen danach.

Was funktioniert

  • Endcards und Texttafeln aus Stammdaten
  • Synthetische Ansagen in einer lizenzierten Stimme
  • Automatische Kontrolle von Ton und Adresse

Was im Szenario bewusst ausgespart bleibt

  • Keine Vollautomatik ohne Sichtung
  • Keine Stimme ohne ausdrückliche Zustimmung des Sprechers
  • Keine generierten Produktszenen ohne Kennzeichnung

Formate, Längen und Sprachen aus einem Dreh: Video-Ableitungen und Dubbing.