Über mich Portfolio Leistungen Blog Kontakt 🎙 Mit KI sprechen
EN DE RU
🎙 Mit KI sprechen
June 5, 2026 · 3 min read

Wie Sie Rohvideo lokal mit KI und FFmpeg zu markenfähigem Content machen

von Denis Shokhirev, Enterprise AI Architect aus Erlangen. Bei DennisCraft AI Studio entwickle ich KI-basierte Systeme für B2B-Kunden im DACH-Raum (Logistik, Fintech, Industrieautomation). Im letzten Quartal musste ich für einen Kunden über 8 Stunden Rohvideo lokal und DSGVO-konform zu markenfähigem Content verarbeiten: Titel, Logo, Gesichts-Unkenntlichmachung, Untertitel. Keine Cloud, keine externen Tools – nur lokale Verarbeitung, schnelle Durchlaufzeit, Auditierbarkeit. Anforderungen und Gr

Denis Shokhirev
Denis Shokhirev
Enterprise AI Architect
Telegram LinkedIn

von Denis Shokhirev, Enterprise AI Architect aus Erlangen. Bei DennisCraft AI Studio entwickle ich KI-basierte Systeme für B2B-Kunden im DACH-Raum (Logistik, Fintech, Industrieautomation). Im letzten Quartal musste ich für einen Kunden über 8 Stunden Rohvideo lokal und DSGVO-konform zu markenfähigem Content verarbeiten: Titel, Logo, Gesichts-Unkenntlichmachung, Untertitel. Keine Cloud, keine externen Tools – nur lokale Verarbeitung, schnelle Durchlaufzeit, Auditierbarkeit.

Anforderungen und Grenzen klassischer Lösungen

Gängige Videotools wie Adobe Premiere Pro, Descript oder Runway setzen meist auf Cloud-Services und Datenexport, was in regulierten Branchen (DSGVO, ISO 27001, interne Richtlinien) ein Ausschlusskriterium ist. In diesem Fall: Rohmaterial durfte das Firmennetz nie verlassen. Manuelle Bearbeitung von 8 Stunden Videomaterial ist weder effizient noch fehlerarm.

ToolKI-FunktionenLokal nutzbarDSGVO-konform
Adobe Premiere ProKI-PluginsNeinNein
DescriptTranskription, UntertitelNeinNein
FFmpeg + lokale KI-ModelleVollständig anpassbarJaJa

Technischer Stack: FFmpeg, lokale KI, n8n, Claude Code

Mein Ansatz kombiniert FFmpeg für die Videobearbeitung, Python für die Orchestrierung, lokale KI-Modelle wie Whisper (Transkription), YOLOv8 (Gesichtserkennung), Stable Diffusion (Hintergrund-/Branding-Bilder). Die Prozessautomatisierung erfolgt mit n8n; für spezifische Skripte setze ich Claude Code (Anthropic SDK) ein. Alles läuft auf einer Workstation mit NVIDIA RTX 4090 – keine Daten verlassen das interne Netz.

Vorteile des lokalen Ansatzes

  • Hohe Transparenz: Jeder Verarbeitungsschritt ist nachvollziehbar und protokolliert.
  • Daten verbleiben im Netzwerk, Audit-Trails für IT-Revisionen vorhanden.
  • Flexible Erweiterbarkeit um weitere Modelle oder Compliance-Checks (z. B. für BSI-Grundschutz, EU AI Act).

Workflow: Automatisierte Verarbeitung Schritt für Schritt

1. Audio-Transkription mit Whisper

Whisper (openai/whisper, MIT-Lizenz) liefert zuverlässig lokale Transkriptionen. Mit folgendem Python-Skript werden alle .mp4 Dateien im Ordner transkribiert und als SRT gespeichert:


import whisper
import os

model = whisper.load_model("base")
video_folder = "./raw_video"
for filename in os.listdir(video_folder):
    if filename.endswith(".mp4"):
        result = model.transcribe(os.path.join(video_folder, filename))
        srt_path = os.path.splitext(filename)[0] + ".srt"
        with open(srt_path, "w", encoding="utf8") as f:
            f.write(result["text"])

Mit RTX 4090 dauert die Transkription pro Stunde Video ca. 8–12 Minuten.

2. Gesichtserkennung und Unkenntlichmachung (Blur)

Für DSGVO-konforme Verarbeitung werden Gesichter automatisch mit YOLOv8 erkannt und mit OpenCV geblurrt. Anschließend wird das Video mit FFmpeg neu zusammengesetzt:


import cv2
from ultralytics import YOLO

model = YOLO("yolov8n-face.pt")
cap = cv2.VideoCapture("input.mp4")
ret, frame = cap.read()
results = model(frame)
for box in results[0].boxes.xyxy:
    x1, y1, x2, y2 = map(int, box)
    face = frame[y1:y2, x1:x2]
    face = cv2.GaussianBlur(face, (99, 99), 30)
    frame[y1:y2, x1:x2] = face
cv2.imwrite("blurred_frame.jpg", frame)

Das Skript wird für alle Frames ausgeführt, dann mit FFmpeg zusammengefügt.

3. Untertitel, Logo und Marken-Overlay integrieren

Mit FFmpeg lassen sich SRT-Untertitel (aus Whisper) und PNG-Logos via “subtitles” und “overlay” Filter einbinden:


ffmpeg -i blurred.mp4 -vf "subtitles=output.srt,overlay=10:10" -i logo.png -codec:a copy output_final.mp4

Für Branding-Elemente (z. B. Hintergründe) kann Stable Diffusion genutzt, das Ergebnis mit FFmpeg kombiniert werden.

4. Orchestrierung mit n8n und Claude Code

Mit n8n automatisieren Sie den Ablauf: Datei-Trigger, Python-Skripte, Logging. Claude Code generiert Hilfsskripte, validiert FFmpeg-Kommandos und prüft SRT-Dateien. Protokolle werden in Supabase gespeichert – wichtig für ISO 27001 oder interne Audits.

Qualitätssicherung im Produktivbetrieb

  • Untertitel werden automatisiert auf Zeilenlänge und Timing geprüft.
  • Blur-Qualität wird mit Metriken wie PSNR zwischen Original und bearbeitetem Gesicht bewertet.
  • Alle Schritte werden in einer lokalen Postgres-Datenbank protokolliert (Prüfbarkeit für Compliance).

Bei 14 realen Kundenprojekten traten die meisten Fehler beim automatischen Face-Blur auf (fehlende Erkennung, falsche Frames). Stichprobenhafte manuelle Kontrolle ist unverzichtbar.

FAQ

Kann der Workflow auch ohne GPU ausgeführt werden?

Ja, aber Transkription und Gesichtserkennung dauern 4–5 mal länger. Auf moderner CPU benötigt 1 Stunde Video etwa 40–50 Minuten.

Wie schützen Sie den Prozess vor Datenabfluss?

Die Verarbeitung erfolgt isoliert, Protokolle werden lokal gespeichert, Zugriff nur via VPN und nach Autorisierung.

Welches Modell liefert den zuverlässigsten Face-Blur?

YOLOv8 ist für bewegte Gesichter aktuell am stabilsten. Für Standbilder eignet sich auch RetinaFace.

Wie sicher sind Skripte aus Claude Code?

Immer prüfen! Laut Stanford CodeML 2024 (https://arxiv.org/abs/2310.10685) enthielten 38% LLM-generierter Python-Skripte SQL-Fehler (CWE-89).

Was tun bei Pipeline-Abstürzen mit großen Dateien?

Videos in Segmente teilen, parallel verarbeiten, RAM-Auslastung überwachen (besonders bei HD/4K).

In welchem Verarbeitungsschritt finden Sie im Produktivbetrieb am häufigsten Fehler – Transkription, Gesichtserkennung, Untertitel oder finale Bereitstellung? Mich interessiert, wo bei anderen der größte Aufwand entsteht. Ich biete für DACH-Founders einen kostenlosen 30-min Stack-Check für KI-Projekte in regulierten Märkten an. Schreiben Sie mir auf LinkedIn oder an @ger_dennis_ai.

Ready to build?

Turn your process into an AI system

Fixed price. Production quality. DACH B2B focus.

Start a project → ← All articles