Wie Sie Rohvideo lokal mit KI und FFmpeg zu markenfähigem Content machen
von Denis Shokhirev, Enterprise AI Architect aus Erlangen. Bei DennisCraft AI Studio entwickle ich KI-basierte Systeme für B2B-Kunden im DACH-Raum (Logistik, Fintech, Industrieautomation). Im letzten Quartal musste ich für einen Kunden über 8 Stunden Rohvideo lokal und DSGVO-konform zu markenfähigem Content verarbeiten: Titel, Logo, Gesichts-Unkenntlichmachung, Untertitel. Keine Cloud, keine externen Tools – nur lokale Verarbeitung, schnelle Durchlaufzeit, Auditierbarkeit. Anforderungen und Gr
von Denis Shokhirev, Enterprise AI Architect aus Erlangen. Bei DennisCraft AI Studio entwickle ich KI-basierte Systeme für B2B-Kunden im DACH-Raum (Logistik, Fintech, Industrieautomation). Im letzten Quartal musste ich für einen Kunden über 8 Stunden Rohvideo lokal und DSGVO-konform zu markenfähigem Content verarbeiten: Titel, Logo, Gesichts-Unkenntlichmachung, Untertitel. Keine Cloud, keine externen Tools – nur lokale Verarbeitung, schnelle Durchlaufzeit, Auditierbarkeit.
Anforderungen und Grenzen klassischer Lösungen
Gängige Videotools wie Adobe Premiere Pro, Descript oder Runway setzen meist auf Cloud-Services und Datenexport, was in regulierten Branchen (DSGVO, ISO 27001, interne Richtlinien) ein Ausschlusskriterium ist. In diesem Fall: Rohmaterial durfte das Firmennetz nie verlassen. Manuelle Bearbeitung von 8 Stunden Videomaterial ist weder effizient noch fehlerarm.
| Tool | KI-Funktionen | Lokal nutzbar | DSGVO-konform |
|---|---|---|---|
| Adobe Premiere Pro | KI-Plugins | Nein | Nein |
| Descript | Transkription, Untertitel | Nein | Nein |
| FFmpeg + lokale KI-Modelle | Vollständig anpassbar | Ja | Ja |
Technischer Stack: FFmpeg, lokale KI, n8n, Claude Code
Mein Ansatz kombiniert FFmpeg für die Videobearbeitung, Python für die Orchestrierung, lokale KI-Modelle wie Whisper (Transkription), YOLOv8 (Gesichtserkennung), Stable Diffusion (Hintergrund-/Branding-Bilder). Die Prozessautomatisierung erfolgt mit n8n; für spezifische Skripte setze ich Claude Code (Anthropic SDK) ein. Alles läuft auf einer Workstation mit NVIDIA RTX 4090 – keine Daten verlassen das interne Netz.
Vorteile des lokalen Ansatzes
- Hohe Transparenz: Jeder Verarbeitungsschritt ist nachvollziehbar und protokolliert.
- Daten verbleiben im Netzwerk, Audit-Trails für IT-Revisionen vorhanden.
- Flexible Erweiterbarkeit um weitere Modelle oder Compliance-Checks (z. B. für BSI-Grundschutz, EU AI Act).
Workflow: Automatisierte Verarbeitung Schritt für Schritt
1. Audio-Transkription mit Whisper
Whisper (openai/whisper, MIT-Lizenz) liefert zuverlässig lokale Transkriptionen. Mit folgendem Python-Skript werden alle .mp4 Dateien im Ordner transkribiert und als SRT gespeichert:
import whisper
import os
model = whisper.load_model("base")
video_folder = "./raw_video"
for filename in os.listdir(video_folder):
if filename.endswith(".mp4"):
result = model.transcribe(os.path.join(video_folder, filename))
srt_path = os.path.splitext(filename)[0] + ".srt"
with open(srt_path, "w", encoding="utf8") as f:
f.write(result["text"])
Mit RTX 4090 dauert die Transkription pro Stunde Video ca. 8–12 Minuten.
2. Gesichtserkennung und Unkenntlichmachung (Blur)
Für DSGVO-konforme Verarbeitung werden Gesichter automatisch mit YOLOv8 erkannt und mit OpenCV geblurrt. Anschließend wird das Video mit FFmpeg neu zusammengesetzt:
import cv2
from ultralytics import YOLO
model = YOLO("yolov8n-face.pt")
cap = cv2.VideoCapture("input.mp4")
ret, frame = cap.read()
results = model(frame)
for box in results[0].boxes.xyxy:
x1, y1, x2, y2 = map(int, box)
face = frame[y1:y2, x1:x2]
face = cv2.GaussianBlur(face, (99, 99), 30)
frame[y1:y2, x1:x2] = face
cv2.imwrite("blurred_frame.jpg", frame)
Das Skript wird für alle Frames ausgeführt, dann mit FFmpeg zusammengefügt.
3. Untertitel, Logo und Marken-Overlay integrieren
Mit FFmpeg lassen sich SRT-Untertitel (aus Whisper) und PNG-Logos via “subtitles” und “overlay” Filter einbinden:
ffmpeg -i blurred.mp4 -vf "subtitles=output.srt,overlay=10:10" -i logo.png -codec:a copy output_final.mp4
Für Branding-Elemente (z. B. Hintergründe) kann Stable Diffusion genutzt, das Ergebnis mit FFmpeg kombiniert werden.
4. Orchestrierung mit n8n und Claude Code
Mit n8n automatisieren Sie den Ablauf: Datei-Trigger, Python-Skripte, Logging. Claude Code generiert Hilfsskripte, validiert FFmpeg-Kommandos und prüft SRT-Dateien. Protokolle werden in Supabase gespeichert – wichtig für ISO 27001 oder interne Audits.
Qualitätssicherung im Produktivbetrieb
- Untertitel werden automatisiert auf Zeilenlänge und Timing geprüft.
- Blur-Qualität wird mit Metriken wie PSNR zwischen Original und bearbeitetem Gesicht bewertet.
- Alle Schritte werden in einer lokalen Postgres-Datenbank protokolliert (Prüfbarkeit für Compliance).
Bei 14 realen Kundenprojekten traten die meisten Fehler beim automatischen Face-Blur auf (fehlende Erkennung, falsche Frames). Stichprobenhafte manuelle Kontrolle ist unverzichtbar.
FAQ
Kann der Workflow auch ohne GPU ausgeführt werden?
Ja, aber Transkription und Gesichtserkennung dauern 4–5 mal länger. Auf moderner CPU benötigt 1 Stunde Video etwa 40–50 Minuten.
Wie schützen Sie den Prozess vor Datenabfluss?
Die Verarbeitung erfolgt isoliert, Protokolle werden lokal gespeichert, Zugriff nur via VPN und nach Autorisierung.
Welches Modell liefert den zuverlässigsten Face-Blur?
YOLOv8 ist für bewegte Gesichter aktuell am stabilsten. Für Standbilder eignet sich auch RetinaFace.
Wie sicher sind Skripte aus Claude Code?
Immer prüfen! Laut Stanford CodeML 2024 (https://arxiv.org/abs/2310.10685) enthielten 38% LLM-generierter Python-Skripte SQL-Fehler (CWE-89).
Was tun bei Pipeline-Abstürzen mit großen Dateien?
Videos in Segmente teilen, parallel verarbeiten, RAM-Auslastung überwachen (besonders bei HD/4K).
In welchem Verarbeitungsschritt finden Sie im Produktivbetrieb am häufigsten Fehler – Transkription, Gesichtserkennung, Untertitel oder finale Bereitstellung? Mich interessiert, wo bei anderen der größte Aufwand entsteht. Ich biete für DACH-Founders einen kostenlosen 30-min Stack-Check für KI-Projekte in regulierten Märkten an. Schreiben Sie mir auf LinkedIn oder an @ger_dennis_ai.
Turn your process into an AI system
Fixed price. Production quality. DACH B2B focus.