Agentengedächtnis jenseits des Kontextfensters
Kontextfenster sind Arbeitsgedächtnis, kein Gedächtnis. Dieser Artikel trennt beide Begriffe und beschreibt die drei Mechanismen, die 2024 produktiv im Einsatz sind — Gesprächszusammenfassungen, Vektorgedächtnis und strukturierter Zustand — samt ihrer Fehlermodi. Dazu: warum gezieltes Vergessen die Korrektheit verbessert und welche Grenzen die DSGVO persistentem Agentengedächtnis setzt.
Ein Kontextfenster ist kein Gedächtnis
Ein LLM ist zustandslos. Jeder API-Aufruf beginnt bei null. Was in einer Chat-Oberfläche wie Gedächtnis aussieht, ist Wiederholung: Der Client sendet die bisherigen Gesprächszüge mit jeder Anfrage erneut. Das Kontextfenster — 128.000 Token bei GPT-4o, 200.000 bei Claude 3.5 Sonnet, seit dem 27. Juni 2024 bis zu 2 Millionen bei Gemini 1.5 Pro — ist bestenfalls Arbeitsgedächtnis. Nach dem Aufruf ist es leer.
Für Agenten ist diese Unterscheidung strukturell. Ein Agent, der über Wochen, Sitzungen und Aufgaben hinweg arbeitet, sammelt mehr Historie an, als ein Fenster fasst — und braucht einzelne Fakten zu unvorhersehbaren Zeitpunkten zurück. Gedächtnis ist deshalb ein Engineering-Problem außerhalb des Modells: was speichern, wie abrufen, wann löschen. Dieser Artikel behandelt die drei Mechanismen, die 2024 produktiv im Einsatz sind.
Warum größere Fenster nicht genügen
Drei Argumente gegen „einfach ein größeres Fenster". Erstens die Kosten: Eingabe-Token werden bei jedem Aufruf erneut berechnet; eine vollständig mitgesendete Historie macht jeden Gesprächszug teurer als den vorherigen. Zweitens die Latenz: Die Prefill-Zeit wächst mit der Promptlänge. Drittens die Abrufqualität: Liu et al. zeigten im Juli 2023 („Lost in the Middle", arXiv 2307.03172), dass Modelle Informationen aus der Mitte langer Kontexte deutlich schlechter nutzen als vom Anfang oder Ende.
Selbst ein perfektes Fenster würde nichts persistieren. Das Fenster ist ein Argument eines Funktionsaufrufs, kein Speicher. Endet die Sitzung, ist sein Inhalt weg. Persistenz braucht einen Schreibpfad, einen Abrufpfad und einen Löschpfad — das sind Fragen des Systementwurfs, nicht des Modells.
Gesprächszusammenfassungen
Der älteste Mechanismus ist die rollierende Zusammenfassung. Nähert sich das Transkript dem Token-Budget, komprimiert das Modell ältere Gesprächszüge zu einer Zusammenfassung; sie ersetzt diese Züge im Prompt. LangChain liefert das als ConversationSummaryMemory aus; die meisten Agenten-Frameworks haben ein Äquivalent. Die Kosten bleiben begrenzt. Der Prompt bleibt kurz.
Zusammenfassung ist konstruktionsbedingt verlustbehaftet, und der Verlust ist unkontrolliert. Das Modell entscheidet zum Zeitpunkt der Kompression, was überlebt — ohne zu wissen, was nächste Woche gefragt wird. Präzise Werte wie eine Bestellnummer oder eine einmal erwähnte Versionsvorgabe fallen zuerst weg. Zusammenfassungen erhalten Tenor und Thema. Fakten erhalten sie nicht zuverlässig; ein System of Record sind sie nicht.
Vektorbasierte Erinnerungen
Vektorgedächtnis wendet Retrieval-Augmented Generation auf die eigene Historie des Agenten an. Gesprächszüge oder extrahierte Aussagen werden eingebettet und in einen Vektorindex geschrieben; zur Anfragezeit werden die k ähnlichsten Einträge in den Prompt injiziert. Der Speicher skaliert auf Jahre von Historie. Die Abrufkosten bleiben konstant, egal wie viel sich angesammelt hat.
Die Grenzen sind die Grenzen der Embedding-Ähnlichkeit. Semantische Nähe ist nicht Relevanz: „Kunde hat den Vertrag gekündigt" und „Kunde hat den Vertrag verlängert" liegen im Embedding-Raum dicht beieinander. Zeit wird nicht modelliert: Eine Präferenz vom Januar und ihre Revision vom Juni treffen dieselbe Anfrage, und der Index weiß nicht, welche aktuell ist. Vektorgedächtnis ruft ab. Es schlussfolgert nicht.
Strukturierter Zustand
Der dritte Mechanismus speichert Fakten als expliziten, typisierten Zustand: ein Profil, eine Aufgabenliste, Schlüssel-Wert-Paare, die der Agent über Tool-Aufrufe liest und schreibt. MemGPT (Packer et al., Oktober 2023) hat das mit einer Betriebssystem-Analogie formalisiert: ein kleines Kerngedächtnis fest im Kontext, größere Speicher werden bei Bedarf eingelagert, und das LLM setzt die Speicheroperationen selbst per Funktionsaufruf ab.
Produkte folgten. OpenAI kündigte Memory für ChatGPT am 13. Februar 2024 an und stellte es am 5. September 2024 Free-, Plus-, Team- und Enterprise-Nutzern bereit — als sichtbare, editierbare, löschbare Einträge. Diese Sichtbarkeit ist der Punkt: Strukturierter Zustand ist auditierbar. Der Preis sind Schemaentwurf im Voraus und Extraktionslogik, die entscheidet, was zum Fakt wird.
| Mechanismus | Schreibpfad | Lesepfad | Schwäche |
|---|---|---|---|
| Zusammenfassung | Modell komprimiert ältere Züge | Zusammenfassung in jedem Prompt | Details werden später gebraucht |
| Vektorgedächtnis | Aussagen einbetten und speichern | Top-k-Ähnlichkeitssuche zur Laufzeit | Aktualität oder Negation entscheidet |
| Strukturierter Zustand | Extraktion in ein festes Schema | Direkter Zugriff oder im Kontext fixiert | Fakten passen nicht ins Schema |
Vergessen als Funktion
Ein Gedächtnis, das nur wächst, degradiert. Veraltete Fakten verdrängen aktuelle, die Abrufpräzision sinkt, Widersprüche sammeln sich an. Park et al. zeigten im April 2023 die Alternative: Der Memory Stream der „Generative Agents" bewertet jeden Eintrag nach Aktualität, Wichtigkeit und Relevanz, wobei die Aktualität exponentiell abfällt. Vergessen war in diesem Entwurf tragend, kein Nachgedanke.
Praktisch heißt das: Time-to-live auf episodischen Einträgen, Decay-Scores, die nie Abgerufenes herabstufen, und Supersede-on-Write-Regeln, damit ein neuer Fakt seinen Vorgänger ersetzt, statt neben ihm zu existieren. Ein Agent, der sich an einen verworfenen Plan erinnert, handelt weiter danach. Löschen ist hier kein Datenverlust. Es ist Zustandshygiene.
Datenschutz als Systemgrenze
Persistentes Gedächtnis macht einen Agenten zum Speicher personenbezogener Daten, und das hat in der EU definierte Konsequenzen. Gespeicherte Nutzerfakten sind personenbezogene Daten im Sinne der DSGVO: Artikel 15 gewährt Auskunft, Artikel 17 Löschung. „Löschen Sie meine Daten" muss Zusammenfassungen, Vektoreinträge und strukturierten Zustand gleichermaßen erreichen — auch abgeleitete Fakten, die der Nutzer nie wörtlich geschrieben hat.
Daraus folgt die Architektur. Gedächtnis muss pro Nutzer und pro Zweck partitioniert sein, darf nie mandantenübergreifend geteilt werden und muss per Schlüssel löschbar sein. Ein Gedächtnis, das Nutzer nicht einsehen können, sollte nicht existieren. Wir behandeln einsehbares und löschbares Gedächtnis in Enterprise-Agenten als harte Anforderung, nicht als Feature. OpenAIs Memory-Kontrollen und temporäre Chats weisen in dieselbe Richtung.
Ausblick im September 2024
Wir erwarten, dass die drei Mechanismen zu verwalteten Gedächtnisschichten konvergieren: hierarchische Speicher, in denen Zusammenfassungen, Vektoren und strukturierte Fakten Stufen eines Systems sind, während Paging-Logik im Stil von MemGPT in Frameworks und Plattform-APIs wandert. Modellanbieter werden Gedächtnis als API-Primitiv anbieten, nicht nur als Produktfunktion ihrer Chat-Frontends.
Zwei Vorhersagen für die nächsten zwölf Monate. Erstens: Gedächtnisqualität wird eine Benchmark-Kategorie neben dem Schlussfolgern; heute wird sie kaum gemessen. Zweitens: Vergessen wird ein Compliance-Feature, das Enterprise-Käufer namentlich nachfragen. Kontextfenster werden weiter wachsen, und nichts davon wird dadurch obsolet. Ein Fenster ist, wo ein Agent denkt. Gedächtnis ist, was er behält.
Quellen
- Packer et al. – MemGPT: Towards LLMs as Operating Systems (arXiv 2310.08560, 12 Oct 2023)
- Liu et al. – Lost in the Middle: How Language Models Use Long Contexts (arXiv 2307.03172, 6 Jul 2023)
- Park et al. – Generative Agents: Interactive Simulacra of Human Behavior (arXiv 2304.03442, 7 Apr 2023)
- OpenAI – Memory and new controls for ChatGPT (13 Feb 2024, updated 5 Sep 2024)
- Google Developers Blog – Gemini 1.5 Pro 2M context window available to all developers (27 Jun 2024)
