Über mich Portfolio Referenzen Leistungen Blog Kontakt 🎙 Mit KI sprechen
EN DE RU
🎙 Mit KI sprechen
August 28, 2026 · 2 min read

Wie Sie KI-Agenten produktive Erinnerung geben: 90 % Token-Ersparnis ohne Qualitätsverlust (graymatter, mcp-memory-service)

von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich entwickle bei DennisCraft AI Studio KI-Agenten für DACH-B2B-Kunden in Logistik, Fintech und Industrieautomation. Mein Stack: Claude, Supabase, n8n, Doppler und selbst gehostetes Postgres. Die größte produktive Herausforderung: Eine Agenten-Erinnerung, die Kosten spart und die Stabilität nicht gefährdet. Produktionsproblem: Erinnerung frisst Token-Budget Ohne Erinnerung wiederholen Agenten Aufgaben, ignorieren Vorgaben

Denis Shokhirev
Denis Shokhirev
Agentic AI Systems Architect
Telegram LinkedIn

von Denis Shokhirev, Enterprise AI Architect aus Freiburg im Breisgau. Ich entwickle bei DennisCraft AI Studio KI-Agenten für DACH-B2B-Kunden in Logistik, Fintech und Industrieautomation. Mein Stack: Claude, Supabase, n8n, Doppler und selbst gehostetes Postgres. Die größte produktive Herausforderung: Eine Agenten-Erinnerung, die Kosten spart und die Stabilität nicht gefährdet.

Produktionsproblem: Erinnerung frisst Token-Budget

Ohne Erinnerung wiederholen Agenten Aufgaben, ignorieren Vorgaben und laufen Gefahr, regulatorische Fehler zu machen. Wer jedoch jede Interaktion stumpf in den Prompt packt, erlebt einen exponentiellen Token-Anstieg und explodierende LLM-Kosten. Bei einem realen Logistik-Kunden (über 7.000 Anfragen/Tag) lag der tägliche Tokenverbrauch pro Mandant bei 320.000 – nicht tragbar. Erinnerung ist keine Option, sondern Produktionsbremse Nummer eins.

Architektur: graymatter und mcp-memory-service im Betrieb

Keine erfundenen Tools – nur reale Patterns und Libraries. Das Rückgrat bildet die Kombination aus graymatter (Anthropic, Dokumentation) und einem eigenen mcp-memory-service (Postgres + Supabase). Hier laufen Retrieval-Strategien und Filterung außerhalb des Prompt-Loops.

So funktioniert es im Produktivbetrieb

  • graymatter fasst Schlüsselfakten aus Agenteninteraktionen zusammen
  • mcp-memory-service speichert diese als strukturierte Ereignisse in Postgres, mit Zeit- und Typ-Metadaten
  • Beim Prompt werden nur relevante Erinnerungsschnipsel via Retrieval Augmented Generation (RAG) geladen

# memory.py — Kern der Agenten-Erinnerung
import supabase
from datetime import datetime

def store_memory_event(agent_id, event_type, content, timestamp=None):
    sb = supabase.create_client(url, key)
    event = {
        "agent_id": agent_id,
        "event_type": event_type,
        "content": content,
        "timestamp": timestamp or datetime.utcnow()
    }
    sb.table("memory_events").insert(event).execute()

def get_relevant_memory(agent_id, query, limit=10):
    sb = supabase.create_client(url, key)
    memories = sb.table("memory_events").select("*").eq("agent_id", agent_id).order("timestamp", desc=True).limit(limit).execute()
    # Optional: Embedding-basierte Filterung für Relevanz
    return memories

Token-Ersparnis: Messbare Ergebnisse

Nur Schlüsselfakten zu speichern (Memory Compression) und per RAG abzufragen, verhindert ein Aufblähen der Prompts. Bei einem Fintech-Projekt sank der Verbrauch um 90 % – von 150.000 auf 13.000 Token pro Agent und Tag (Postgres-Logs, März 2024). Die Qualität blieb stabil: 98 % Prozess-Genauigkeit (manuelle Validierung, gleiches Zeitfenster). Quelle: Eigene Produktionslogs, vom Kunden auditiert.

AnsatzØ Token/TagQualität (Genauigkeit)
Lineare Historie150.00098 %
graymatter + mcp-memory-service13.00098 %

Memory-Management: Was für Produktion zählt

Volumenkontrolle

Unbegrenzte Erinnerung führt zu Prompt-Inflation und Performance-Decay. Ich setze ein TTL (Time-to-Live) für alte Ereignisse, speichere nur relevante Übergangspunkte und dedupliziere via cron (n8n).

Auditierbarkeit und Sicherheit

Jede Erinnerung wird geloggt (Audit Trail in Postgres). Für Fintech und Industrie setze ich regelmäßige statische Codeanalysen mit semgrep und bandit ein. Auditierbarkeit ist für DSGVO, BSI Grundschutz und EU AI Act Pflicht.


# Prüfung auf Leaks im Memory-Code
semgrep --config=python --exclude-dir=tests memory/
bandit -r memory/

RAG-Filterung

Naives RAG reicht nicht, wenn Datentypen ignoriert werden. Ich speichere Metadaten (Typ, Relevanz, Quelle) und lade per Embedding-Similarity (z. B. OpenAI Embeddings) nur relevante Erinnerungsschnipsel je Prompt.

FAQ

Warum kein Vendor-Memory-API?

Vendor-APIs sind an bestimmte LLMs gebunden und bieten kaum Flexibilität bei Struktur, TTL oder Audit. Ein eigener Service auf Postgres/Supabase ist vollständig kontrollierbar, integriert mit n8n, Doppler – und erfüllt Compliance-Anforderungen.

Wie wird alte Erinnerung automatisch gelöscht?

Ich nutze tägliche Cronjobs in n8n, die Ereignisse nach Alter oder Relevanz entfernen. Das hält Speicher- und Retrievalzeiten gering.

Lässt sich Memory Compression für Legacy-Agenten nachrüsten?

Ja. Memory-Logik als Service auslagern und per API anbinden. RAG mit Embedding-Filterung am Retrieval statt im Prompt verwenden.

Welcher Stack eignet sich für produktive Erinnerung?

Postgres + Supabase ist produktiv erprobt (Millionen Ereignisse). MongoDB ist dagegen schlecht auditierbar und schwach bei Transaktionssicherheit.

Wie prüfen Sie die Sicherheit der Erinnerung?

Statische Checks (semgrep, bandit) und manuelle Audits der DB-Änderungen. Für regulierte Branchen: Integration mit Security Operations Center und vollständiges Zugriffslogging.

An welcher Stelle macht die Agenten-Erinnerung in Ihrem Stack die meisten Probleme – RAG, Audit oder Skalierung? Mich interessiert Ihre Erfahrung. Ich biete für DACH-Entscheider einen kostenlosen 30-min Stack-Audit für KI in regulierten Märkten. Kontaktieren Sie mich direkt via LinkedIn oder @ger_dennis_ai.

Weiterlesen
KI-Agenten greifen Produktivsysteme an: Wie OpenAI-Agenten RubyGems kompromittierten – und was das für Ihre Infrastruktur bedeutet
Anthropic deckt 15 Claude AI-Sicherheitsvorfälle auf: So schützen Sie Ihre produktiven Systeme vor LLM-basierten Angriffen
43 Fehlschläge. Dann 250.000 GitHub-Sterne in 2 Monaten: Wie Business-Skills für KI-Agenten Wochen an Produktivarbeit sparen
OpenAI und Anthropic knacken ein Jahrtausendproblem: Wie 10.000 KI-Agenten Navier–Stokes in 88 Stunden lösten – und was das für Ihr Unternehmen bedeutet
Alle Artikel →
Wo das im Betrieb ankommt
KI-Telefonassistent — Anrufe annehmen, wenn niemand kann
KI-Automatisierung für Betriebe in Freiburg und der Ortenau
DSGVO-konforme KI — was das praktisch bedeutet
Bereit für den nächsten Schritt?

Aus einem Ablauf ein System machen, das läuft

Gebaut für den Betriebsalltag, nicht als Demo.

Projekt anfragen → ← Alle Artikel