40 Hausversionen eines Addressable-TV-Spots
Anonymisiertes Anwendungsbeispiel. Geprüft am 15. August 2026.
- Aufgabentyp
- Produktion
- Betrieb
- Hybrid
- Aufwand
- Mittel
- Zeitrahmen
- 5 Wochen
- Quelle
- Anonymisiert; Zielwerte aus Branchendossier Werbeagentur (08/2026)
Aufgabe
Eine Verbundgruppe schaltet Addressable TV; jedes der 40 Häuser soll seinen Spot mit eigenem Namen, Adresse, Aktion und Sprecher-Ansage bekommen. Klassisch sind das 40 Sprecheraufnahmen und 40 Schnittversionen. Regionalisierte Spots scheitern an den Kosten je Version, nicht an der Idee.
Lösungsweg
Der Basisspot wird klassisch produziert. Endcard, Texttafel und Off-Ton liegen als variable Ebenen im Template. Ein Workflow erzeugt je Haus die Endcard, das Voiceover per Stimm-Synthese in einer Stimme, deren Sprecher der KI-Nutzung vertraglich zugestimmt hat, mischt Ton und rendert in den Senderformaten. Eine automatische Gegenprüfung vergleicht die Ansage per Sprache-zu-Text mit dem Soll-Text und prüft die Adresse im Bild; der Producer sichtet Stichproben und Abweichungen. Generierte Bildanteile werden gekennzeichnet.
Kontrollpunkt Ein Mensch prüft oder gibt das Ergebnis frei.
Wie es technisch abläuft
Jeder Schritt bleibt einzeln prüfbar; Komponenten werden nur dort genannt, wo sie festgelegt sind.
- 01 Basisspot klassisch produziert
- 02 Variablen Endcard, Tafel, Off-Ton
- 03 Sprache ElevenLabs, Sprechervertrag
- 04 Render Senderformate
- 05 Gegenprüfung Speech-to-Text
- 06 Sichtung Producer
Vorher und Nachher
Die Veränderung wird als Arbeitsablauf beschrieben, nicht als Erfolgsversprechen.
Vorher
- Tage im Studio und Schnitt
- Hohe Kosten je Version
- Regionalisierung unterbleibt
Nachher
- Basisspot einmal, 40 Ableitungen automatisch
- Synthetische Ansage in lizenzierter Stimme
- Automatische Gegenprüfung, Producer sichtet
Dokumentierte Ergebniswerte
Die Werte gelten im jeweils beschriebenen Szenario und sind kein allgemeiner Benchmark.
- Durchlauf für 40 Versionen (Zielwert)
- < 1 Tag
- Basisproduktion statt 40
- 1
- Versionen mit dokumentierter Gegenprüfung
- 100 %
Grenzen und bewusste Entscheidungen
Diese Bedingungen gehören zum Lösungsweg und dürfen nicht aus dem Szenario herausgekürzt werden.
- Stimmklone nur mit Vertrag: das Landgericht Berlin II hat 2025 ein Recht an der eigenen Stimme bestätigt
- Generierte Produktszenen sind kennzeichnungspflichtig
- Text und Logos in generierten Clips bleiben unzuverlässig
Werkzeug-Stack
Versionierung ist der Fall, in dem KI im Bewegtbild heute am verlässlichsten spart: nicht beim Imagefilm, sondern bei den 39 Ableitungen danach.
Was funktioniert
- Endcards und Texttafeln aus Stammdaten
- Synthetische Ansagen in einer lizenzierten Stimme
- Automatische Kontrolle von Ton und Adresse
Was im Szenario bewusst ausgespart bleibt
- Keine Vollautomatik ohne Sichtung
- Keine Stimme ohne ausdrückliche Zustimmung des Sprechers
- Keine generierten Produktszenen ohne Kennzeichnung
Formate, Längen und Sprachen aus einem Dreh: Video-Ableitungen und Dubbing.