In den vergangenen Tagen war ich für meine Umwelt echt nur schwierig ansprechbar. Ich hing am Rechner vor meinen Coding-Tools, am Handy remote in den Sessions, war tief in Gedanken. Es waren aber auch die Tage, in denen zwei Dinge zusammengewachsen sind, von denen ich nicht glaubte, dass es funktionieren würde: KI und Videojournalismus. Inzwischen aber kann ich sagen: Es hat geklappt. Und wie! Ich habe einen KI-Schnittplatz gebaut und Filme produziert, die nie durch ein herkömmliches Schnittprogramm gelaufen sind. Da funktionieren Dinge, die ich bis vor ein paar Tagen für unmöglich hielt.
Genau genommen ist es auch nicht nur ein Schnittplatz, sondern ein Redaktionsvolontär, der gerade das Handwerk des Videojournalisten lernt.
Worum geht’s?
Mein neues Tool bekommt das Video-Rohmaterial aus der Kamera und meine Notizen, Pressemitteilung, Transkripte des Gesagten aus einer Pressekonferenz, Links von Webseiten eingefüllt. Aus beidem entwickelt es dann die Video-Geschichte. Wenn ich möchte, starte ich den Autopiloten. Dann fängt der KI-Schnittplatz an zu arbeiten:
Er erstellt eine Storyline aus Abgleich von Informationen und vorhandenem Videomaterial: Es schreibt alles Gesprochene ab, wortgenau mit Zeitmarken. Dazu beschreibt er jedes Bild: Einstellungsgröße, Ort, was zu sehen ist, ob die Kamera steht, schwenkt oder wackelt.
Er hört die relevanten O-Töne heraus und erstellt das Manuskript des Nachrichten- oder Magazin-Videos: Es hört zuerst die O-Töne, legt die stärksten fest und schreibt den Sprechertext um sie herum. Jeder Satz braucht einen Beleg aus Pressetext, Notiz oder Interview. Was nicht belegt ist, steht nicht drin.
Er lässt meinen KI-Stimmklon den Text sprechen
Er schneidet das Video, mischt es ab, macht eine Farbkorrektur, stabilisiert verwackelte Bilder, optimiert die technische Qualität von O-Tönen, setzt die Bauchbinden im Sender- oder Firmendesign, schreibt eine Anmoderation, erstellt optional Untertitel für den Videoplayer.
Er legt das Video zur Abnahme vor.
Dann kann ich entweder nur ein bisschen was verändern oder alles. Und ich muss natürlich nicht den Autopiloten laufen lassen. Ich kann an jedem Schritt einhaken: Die Storyline vorgeben, den Textentwurf komplett selbst reintippen oder den KI-Entwurf redigieren, die Bildauswahl manuell vornehmen, exakt sagen, welches Bild an welche Stelle soll, die O-Töne selbst bestimmen, meine eigene Tonspur einsprechen (entweder direkt am Rechner bzw. Handy oder hochladen) und die Story daran ausrichten lassen. Oder, wenn ich sehr individuelle Ansprüche an das Video habe, lasse ich mir den Schnitt meines Tools als Final-Cut-Projekt (oder Premiere, DaVinci, Avid… name it) ausgeben und bearbeite es manuell zu Ende.
Ich bleibe als Autor, Cutter und Redakteur also voll flexibel und bekomme am Ende auf die ein oder andere Art exakt das journalistische Ergebnis, das ich mir vorgestellt habe – ich habe mich lediglich einer Menge lästiger Arbeiten entledigt, die jetzt voll automatisch mit erledigt werden.
Ach so… almost needless to say, dass das alles auch via iPhone funktioniert, das ich über einen Tunnel mit dem Mac verbunden habe. Ich kann vom Drehort Videos schicken, Informationen einsprechen, den Text über eine Teleprompterfunktion auf dem Handy einsprechen.
Symbolbild, KI-generiert.
Und warum rede ich von der KI als einem Redaktionsvolontär? Weil das System wie ein Volontär mitlernt. Mit jeder Änderung, die ich ihm gebe, erstellt es für sich eine Notiz und wird diesen oder jeden Fehler in Zukunft nicht mehr machen. Meine Erwartung: Im Lauf der Zeit schneidet das System Videobeiträge so, wie ich sie produzieren würde – und zwar im ersten Anlauf. Aber natürlich ist dieses Lernen nicht auf mich beschränkt: Ich habe das System so angelegt, dass es sich im Lauf der Zeit auf jede*n Nutzer*in individuell eingrooven würde, der/die mit ihm arbeitet.
Eine kleine Funktion mag ich ganz besonders: ich kann eine Art Chatbot aufrufen, den wir „Producer“ genannt haben. Mit ihm kann ich reden wie mit einem Cutter auf dem Schnittplatz, und zwar tatsächlich, indem ich in ihn hineinrede: „Tausch doch bitte mal das Bild bei 0:40 aus, da haben wir ein besseres, ich weiß, dass ich es gedreht habe.“ Oder: „Kannst du vielleicht die Einstellung bei 1:32 nochmal anschauen, da stimmt der Weißabgleich noch nicht, dreh doch ein bisschen wärmer.“ Und mein KI-Kollege wird es tun und dann antworten, wie weit er damit gekommen ist.
Der KI-Schnittplatz kennt inzwischen schon mehrere Stile und Formate: NiFs, Magazin-Beiträge, Aufsager, Interviews, die mit mehreren Kameras gedreht wurden, Zoom-Interviews und noch einiges mehr. Er kennt JumpCuts, schneidet Intros, unterlegt sie mit Musik, arbeitet mit Slomo und Timelapse. Aus dem jeweiligen Rohmaterial baut er sendefähige Videos in der gewünschten Länge. Aus mehreren Videos stellt er einen Newsflash zusammen, entwirft eine Thementafel zum Start der Sendung und legt Themen-Inserts aufs Startbild eines jeden Beitrags.
Und danach beginnt der Gewinn für heutige Redaktionen überhaupt erst, denn: Der KI-Schnittplatz bearbeitet das Material weiter. Er skaliert das Material um und baut Reels für Social Media daraus, und er nimmt alle Informationen und liefert sie an andere KI-Redaktionssysteme, die Blogbeiträge, journalistische Artikel, Insta-, Facebook- oder LinkedIn-Posts daraus machen. In meinem Fall werden sie – nach Freigabe natürlich – auch automatisch über die jeweilige API der Plattformen veröffentlicht. Auf diese Weise wird das, was früher sehr aufwändig war – das Channel-Management – in einem Zug überschaubar.
Für Produktionen, die ich für Kunden erledige, gibt es eine eigene, passwortgeschützte Abnahmeseite: Der Kunde schaut sich das Video an, kommentiert direkt an der Timeline, was er geändert haben möchte und kann mit mir über ein WhatsApp-artiges Tool über den Film chatten. Alles, was hier besprochen wird, übersetzt die KI in ein Änderungsszenario und legt es mir vor. Was ich umgesetzt haben will, gebe ich frei, anderes nicht. Oder ich habe noch eigene Ideen, die das Videoprojekt präzisieren, und schreibe sie dazu. Und dann geht’s los: Die KI setzt die Änderungswünsche um und stellt eine neue Version zur Verfügung. Falls das – aus welchen Gründen auch immer – nicht funktioniert, ist das kein Beinbruch: Dann baue ich die Änderungen in meinem Schnittprogramm selbst und checke das adaptierte Video in den Abnahmeprozess ein.
Wie auch immer: Bevor ich begonnen habe, dieses Ding vibezucoden, hätte ich nicht geglaubt, dass es funktioniert. Und jetzt muss ich sagen: Es ist besser als alle Erwartungen, die ich daran hätte haben können. Ein paar Bugs hier und da gibt es noch, da müssen wir ran, klar. Es braucht einiges an Token – auch klar. Jedes Video kostet – so meine Beobachtung inzwischen – etwa fünf Euro echtes Geld. Wer weiß, wie weit man normalerweise mit 20 Euro im Monat für Claude oder ChatGPT kommt, weiß, dass da ganz schön KI-Power benötigt wird. Aber Video ist nun mal auch mit KI deutlich aufwändiger zu bearbeiten als andere Medien. War schon immer so, wird so bleiben.
Abnahme im Browser: anhalten, an der Stelle anmerken, der Schnittplatz setzt es um. Ausgerechnet hier läuft ein Kameramann durchs Bild, so ein Fall für den zweiten Blick.
Mein Referenzfilm handelt von Assistenzhunden
Um zu sehen, wie weit ich damit in der Praxis komme, habe ich einen Stoff genommen, den ich gut kenne: Assistenzhunde in Mannheim. Das Material eines meiner letzten Drehs für RNF von Anfang Dezember 2025. Die Stadt klebt Aufkleber an ihre Türen, die zeigen, dass Assistenzhunde willkommen sind. Ein Standard-Pressetermin, wie sie hundertfach im Jahr vorkommen.
Der Schnittplatz hat daraus im Autopiloten, also ohne Zwischenhalt, einen Beitrag von zweieinhalb Minuten gebaut und ein Reel für Instagram. Die Ergebnisse stehen auf YouTube und sind hier eingebettet.
Diese Videos sind noch nicht perfekt – aber sie sind ein Beispiel für das, was herauskommt, wenn ich heute den KI-Schnittplatz mit Rohmaterial und Infos über ein Ereignis füttere und sage: „Mach mal.“ Mein virtueller Assistent hat eine andere Storyline gewählt als ich im Original des Beitrags. Der Text läuft anders, die O-Tone sind anders gewählt. Die KI hat sich entschieden, ein zufällig aufgenommenes Statement während des Drehs – es sollte nur eine Einstellung von vielen sein – als O-Ton zu verwenden und den Raumton so zu optimieren, dass er einigermaßen verständlich wird. Hätte ich so nicht auf Sendung gegeben. Ich habe die Videos zum Demozwecken einfach so gelassen, wie sie nach dem intensiven Training der vergangenen Tage aus dem Schnittplatz herauskamen.
Selbst gebaut, weil es passen soll
Was ist da nun entstanden? Etwas, das mir passt wie ein Anzug vom Schneider, gebaut mit Vibe Coding: Ich beschreibe in normaler Sprache, was ich brauche, und die KI schreibt den Code dazu. Was genau allerdings so eine Software können muss, das weiß nur jemand, der jahrelang operativ in dem Job gearbeitet hat, der auch die Trainingsdaten hat: Aus mehreren Dutzend meiner Produktionen hat die KI die Muster erkannt, wie ein Videobeitrag fürs Fernsehen aufgebaut ist, wie getextet wird, wie O-Töne eingebettet sind, wie Moderationen geschrieben werden. Und das ist ein wichtiger Aspekt: Die KI – zumindest die, die uns zur Verfügung steht – baut nicht von alleine ein perfektes Werkzeug. Sie will angeleitet werden und braucht menschliche Ahnung beim Programmieren und später bei der Bewertung der Ergebnisse, damit etwas Sinnvolles entsteht.
Beitragsbild und Screenshot: KI-Schnittplatz. Symbolbild im Text: KI-generiert.
Lesezeit: 536 Sekunden
In den vergangenen Tagen war ich für meine Umwelt echt nur schwierig ansprechbar. Ich hing am Rechner vor meinen Coding-Tools, am Handy remote in den Sessions, war tief in Gedanken. Es waren aber auch die Tage, in denen zwei Dinge zusammengewachsen sind, von denen ich nicht glaubte, dass es funktionieren würde: KI und Videojournalismus. Inzwischen aber kann ich sagen: Es hat geklappt. Und wie! Ich habe einen KI-Schnittplatz gebaut und Filme produziert, die nie durch ein herkömmliches Schnittprogramm gelaufen sind. Da funktionieren Dinge, die ich bis vor ein paar Tagen für unmöglich hielt.
Genau genommen ist es auch nicht nur ein Schnittplatz, sondern ein Redaktionsvolontär, der gerade das Handwerk des Videojournalisten lernt.
Worum geht’s?
Mein neues Tool bekommt das Video-Rohmaterial aus der Kamera und meine Notizen, Pressemitteilung, Transkripte des Gesagten aus einer Pressekonferenz, Links von Webseiten eingefüllt. Aus beidem entwickelt es dann die Video-Geschichte. Wenn ich möchte, starte ich den Autopiloten. Dann fängt der KI-Schnittplatz an zu arbeiten:
Dann kann ich entweder nur ein bisschen was verändern oder alles. Und ich muss natürlich nicht den Autopiloten laufen lassen. Ich kann an jedem Schritt einhaken: Die Storyline vorgeben, den Textentwurf komplett selbst reintippen oder den KI-Entwurf redigieren, die Bildauswahl manuell vornehmen, exakt sagen, welches Bild an welche Stelle soll, die O-Töne selbst bestimmen, meine eigene Tonspur einsprechen (entweder direkt am Rechner bzw. Handy oder hochladen) und die Story daran ausrichten lassen. Oder, wenn ich sehr individuelle Ansprüche an das Video habe, lasse ich mir den Schnitt meines Tools als Final-Cut-Projekt (oder Premiere, DaVinci, Avid… name it) ausgeben und bearbeite es manuell zu Ende.
Ich bleibe als Autor, Cutter und Redakteur also voll flexibel und bekomme am Ende auf die ein oder andere Art exakt das journalistische Ergebnis, das ich mir vorgestellt habe – ich habe mich lediglich einer Menge lästiger Arbeiten entledigt, die jetzt voll automatisch mit erledigt werden.
Ach so… almost needless to say, dass das alles auch via iPhone funktioniert, das ich über einen Tunnel mit dem Mac verbunden habe. Ich kann vom Drehort Videos schicken, Informationen einsprechen, den Text über eine Teleprompterfunktion auf dem Handy einsprechen.
Und warum rede ich von der KI als einem Redaktionsvolontär? Weil das System wie ein Volontär mitlernt. Mit jeder Änderung, die ich ihm gebe, erstellt es für sich eine Notiz und wird diesen oder jeden Fehler in Zukunft nicht mehr machen. Meine Erwartung: Im Lauf der Zeit schneidet das System Videobeiträge so, wie ich sie produzieren würde – und zwar im ersten Anlauf. Aber natürlich ist dieses Lernen nicht auf mich beschränkt: Ich habe das System so angelegt, dass es sich im Lauf der Zeit auf jede*n Nutzer*in individuell eingrooven würde, der/die mit ihm arbeitet.
Eine kleine Funktion mag ich ganz besonders: ich kann eine Art Chatbot aufrufen, den wir „Producer“ genannt haben. Mit ihm kann ich reden wie mit einem Cutter auf dem Schnittplatz, und zwar tatsächlich, indem ich in ihn hineinrede: „Tausch doch bitte mal das Bild bei 0:40 aus, da haben wir ein besseres, ich weiß, dass ich es gedreht habe.“ Oder: „Kannst du vielleicht die Einstellung bei 1:32 nochmal anschauen, da stimmt der Weißabgleich noch nicht, dreh doch ein bisschen wärmer.“ Und mein KI-Kollege wird es tun und dann antworten, wie weit er damit gekommen ist.
Der KI-Schnittplatz kennt inzwischen schon mehrere Stile und Formate: NiFs, Magazin-Beiträge, Aufsager, Interviews, die mit mehreren Kameras gedreht wurden, Zoom-Interviews und noch einiges mehr. Er kennt JumpCuts, schneidet Intros, unterlegt sie mit Musik, arbeitet mit Slomo und Timelapse. Aus dem jeweiligen Rohmaterial baut er sendefähige Videos in der gewünschten Länge. Aus mehreren Videos stellt er einen Newsflash zusammen, entwirft eine Thementafel zum Start der Sendung und legt Themen-Inserts aufs Startbild eines jeden Beitrags.
Und danach beginnt der Gewinn für heutige Redaktionen überhaupt erst, denn: Der KI-Schnittplatz bearbeitet das Material weiter. Er skaliert das Material um und baut Reels für Social Media daraus, und er nimmt alle Informationen und liefert sie an andere KI-Redaktionssysteme, die Blogbeiträge, journalistische Artikel, Insta-, Facebook- oder LinkedIn-Posts daraus machen. In meinem Fall werden sie – nach Freigabe natürlich – auch automatisch über die jeweilige API der Plattformen veröffentlicht. Auf diese Weise wird das, was früher sehr aufwändig war – das Channel-Management – in einem Zug überschaubar.
Für Produktionen, die ich für Kunden erledige, gibt es eine eigene, passwortgeschützte Abnahmeseite: Der Kunde schaut sich das Video an, kommentiert direkt an der Timeline, was er geändert haben möchte und kann mit mir über ein WhatsApp-artiges Tool über den Film chatten. Alles, was hier besprochen wird, übersetzt die KI in ein Änderungsszenario und legt es mir vor. Was ich umgesetzt haben will, gebe ich frei, anderes nicht. Oder ich habe noch eigene Ideen, die das Videoprojekt präzisieren, und schreibe sie dazu. Und dann geht’s los: Die KI setzt die Änderungswünsche um und stellt eine neue Version zur Verfügung. Falls das – aus welchen Gründen auch immer – nicht funktioniert, ist das kein Beinbruch: Dann baue ich die Änderungen in meinem Schnittprogramm selbst und checke das adaptierte Video in den Abnahmeprozess ein.
Wie auch immer: Bevor ich begonnen habe, dieses Ding vibezucoden, hätte ich nicht geglaubt, dass es funktioniert. Und jetzt muss ich sagen: Es ist besser als alle Erwartungen, die ich daran hätte haben können. Ein paar Bugs hier und da gibt es noch, da müssen wir ran, klar. Es braucht einiges an Token – auch klar. Jedes Video kostet – so meine Beobachtung inzwischen – etwa fünf Euro echtes Geld. Wer weiß, wie weit man normalerweise mit 20 Euro im Monat für Claude oder ChatGPT kommt, weiß, dass da ganz schön KI-Power benötigt wird. Aber Video ist nun mal auch mit KI deutlich aufwändiger zu bearbeiten als andere Medien. War schon immer so, wird so bleiben.
Mein Referenzfilm handelt von Assistenzhunden
Um zu sehen, wie weit ich damit in der Praxis komme, habe ich einen Stoff genommen, den ich gut kenne: Assistenzhunde in Mannheim. Das Material eines meiner letzten Drehs für RNF von Anfang Dezember 2025. Die Stadt klebt Aufkleber an ihre Türen, die zeigen, dass Assistenzhunde willkommen sind. Ein Standard-Pressetermin, wie sie hundertfach im Jahr vorkommen.
Der Schnittplatz hat daraus im Autopiloten, also ohne Zwischenhalt, einen Beitrag von zweieinhalb Minuten gebaut und ein Reel für Instagram. Die Ergebnisse stehen auf YouTube und sind hier eingebettet.
Hier klicken, um den Inhalt von YouTube anzuzeigen.
Erfahre mehr in der Datenschutzerklärung von YouTube (öffnet in neuem Tab).
Hier klicken, um den Inhalt von YouTube anzuzeigen.
Erfahre mehr in der Datenschutzerklärung von YouTube (öffnet in neuem Tab).
Diese Videos sind noch nicht perfekt – aber sie sind ein Beispiel für das, was herauskommt, wenn ich heute den KI-Schnittplatz mit Rohmaterial und Infos über ein Ereignis füttere und sage: „Mach mal.“ Mein virtueller Assistent hat eine andere Storyline gewählt als ich im Original des Beitrags. Der Text läuft anders, die O-Tone sind anders gewählt. Die KI hat sich entschieden, ein zufällig aufgenommenes Statement während des Drehs – es sollte nur eine Einstellung von vielen sein – als O-Ton zu verwenden und den Raumton so zu optimieren, dass er einigermaßen verständlich wird. Hätte ich so nicht auf Sendung gegeben. Ich habe die Videos zum Demozwecken einfach so gelassen, wie sie nach dem intensiven Training der vergangenen Tage aus dem Schnittplatz herauskamen.
Selbst gebaut, weil es passen soll
Was ist da nun entstanden? Etwas, das mir passt wie ein Anzug vom Schneider, gebaut mit Vibe Coding: Ich beschreibe in normaler Sprache, was ich brauche, und die KI schreibt den Code dazu. Was genau allerdings so eine Software können muss, das weiß nur jemand, der jahrelang operativ in dem Job gearbeitet hat, der auch die Trainingsdaten hat: Aus mehreren Dutzend meiner Produktionen hat die KI die Muster erkannt, wie ein Videobeitrag fürs Fernsehen aufgebaut ist, wie getextet wird, wie O-Töne eingebettet sind, wie Moderationen geschrieben werden. Und das ist ein wichtiger Aspekt: Die KI – zumindest die, die uns zur Verfügung steht – baut nicht von alleine ein perfektes Werkzeug. Sie will angeleitet werden und braucht menschliche Ahnung beim Programmieren und später bei der Bewertung der Ergebnisse, damit etwas Sinnvolles entsteht.
Beitragsbild und Screenshot: KI-Schnittplatz. Symbolbild im Text: KI-generiert.
Mehr zum Thema: