Two soft glowing lights joined by a thin line on a dark monitor in a moonlit room, like two AI agents resting overnight
Back to blog
EngineeringAI Automation

Warum unsere KI-Agents schlafen: Ein Gedächtnis, das sich selbst aktualisiert

Es gibt viele Gedächtniswerkzeuge für KI-Agents. Wir haben trotzdem ein eigenes gebaut, das sich korrigiert, während die Agents untätig sind. Warum, wie es funktioniert und was wir gemessen haben.

S
Sno AI Team
September 30, 2026
|
1 min read
|
116 views
Share:

Im März gibst du einem Agent die Adresse des Staging-Servers. Im Juni zieht der Server um, und du gibst ihm die neue Adresse. Ein Gedächtnis, das nur sammelt, enthält nun beide. Die erste ist nicht gerade falsch. Damals stimmte sie. Aber hin und wieder wird der Agent sie mit voller Überzeugung auswählen, wie jemand, der den Weg zu einem Restaurant erklärt, das vor Jahren geschlossen hat.

Das ist das Problem mit dem Gedächtnis der meisten KI-Agents. Einen Agent dazu zu bringen, sich etwas zu merken, ist leicht. Schwierig wird es, wenn das Gemerkte veraltet.

Am Ende haben wir ein eigenes Gedächtnis in Sno Station eingebaut. Besonders scharf war ich darauf nicht. Es gibt bereits gute Gedächtniswerkzeuge, einige mit Zehntausenden Sternen auf GitHub, und die Welt braucht keinen zehnten Anbieter für Agent-Gedächtnisse. Das wollen wir auch nicht sein. Aber wir brauchten drei Dinge, die wir zusammen nicht finden konnten.

Ein Gedächtnis für jeden Agent

Das Erste ist leicht gesagt. Wir betreiben mehr als einen Agent. Claude Code, Codex, manchmal OpenClaw und Hermes. Jeder hat seine eigene Vorstellung von Gedächtnis, und das Gedächtnis jedes Agent endet an seiner eigenen Türschwelle.

Du sagst also Claude Code, dass das Team donnerstags bereitstellt, und am Freitag weiß Codex nichts davon. Du trägst die Information zwischen ihnen hin und her. Du bist das Kabel.

In Sno Station gibt es pro Person einen Gedächtnisspeicher auf dem eigenen Rechner, verschlüsselt. Jeder Agent liest und schreibt über ein schlankes Plugin. Während du arbeitest, hält das Plugin unauffällig fest, was es wert ist, behalten zu werden, und ruft zu Beginn einer Sitzung ab, was relevant ist. Darunter gibt es genau einen Schreibprozess, damit zwei Agents sich nicht gegenseitig die Einträge überschreiben.

Das macht auch die Übergabe möglich. Angenommen, das Kontingent eines Agent ist mitten in einer Aufgabe aufgebraucht und der andere übernimmt. Der zweite fängt nicht bei null an. Er weiß, was der erste wusste. Ohne gemeinsames Gedächtnis ist eine Übergabe bloß ein zweiter Agent, dem du alles noch einmal erklären musst.

Und das heißt, dass das Gedächtnis dir gehört und nicht einer Laufzeitumgebung. Wenn du den Agent nächstes Jahr gegen einen anderen austauschst, bleibt erhalten, was er über dich und deine Arbeit gelernt hat.

Ersetzen statt anhäufen

Das Zweite ist der Staging-Server.

Viele Gedächtnissysteme hängen nur an. Jede neue Tatsache landet auf dem Stapel. Nichts wird entfernt. Die Demo läuft gut. Ein paar Monate später hast du den Job gewechselt, die API hat sich geändert, und der Agent erinnert sich noch an deinen alten Chef. Ein Gedächtnis, das nur ergänzt, bewahrt jede Version auf und überlässt es dem Modell, sie im denkbar ungünstigsten Moment zu sortieren.

Unseres funktioniert anders, und die Regel ist streng. Wenn eine neue Tatsache einer alten widerspricht, betrachtet ein Modell das Paar und gibt eine von drei Antworten: ersetzen, behalten oder unsicher. Mehr darf es nicht sagen. Das Modell beurteilt. Gewöhnlicher Code erledigt den Rest. Der alte Gedächtniseintrag wird als ausgemustert markiert, der neue tritt an seine Stelle, und einem Agent werden nur aktuelle Einträge vorgelegt.

Das Modell hat keinen Löschknopf. Das möchte ich betonen. Es kann von sich aus nichts entfernen, und ein ausgemusterter Eintrag ist noch da, falls du jemals nachsehen musst, was früher galt. Es ist ungefähr der Unterschied zwischen dem Durchstreichen eines Eintrags im Kassenbuch und dem Herausreißen der Seite.

Wie gut die Beurteilung funktioniert

Die Beurteilung ist der riskante Teil. Wenn das Modell eine Tatsache ersetzt, die es hätte behalten sollen, ist etwas Wahres verloren gegangen. Das ist schlimmer als Unordnung.

Deshalb haben wir für genau diese Entscheidung ein eigenes kleines Modell trainiert und es mit einem Spitzenmodell aus einem der großen Labore verglichen. Beide bekamen dieselbe Prüfung: 223 Tatsachenpaare, jeweils eine ältere und eine neuere Tatsache, mit einer bekannten richtigen Antwort.

Unser Modell wählte in 97,5 Prozent der Fälle die richtige Handlung. Das Spitzenmodell in 96,8.

Wichtiger ist mir die Zahl der falschen Ersetzungen: die Fälle, in denen eine wahre Tatsache verworfen worden wäre. Bei unserem Modell geschah das in 3,2 Prozent der Fälle. Beim Spitzenmodell in 4,1.

Ich möchte das nicht überverkaufen. Es ist eine kleine Prüfung mit 223 Fragen aus dem Juni, und beide Modelle liegen dabei nah an der Obergrenze. Seitdem haben wir eine schwierigere geschrieben. Es ist auch kein Vergleich mit anderen Gedächtniswerkzeugen. Den haben wir noch nicht durchgeführt, und ich werde fremde Zahlen nicht zitieren, als wären es unsere eigenen.

Was uns das zeigt: Ein kleines Modell auf einer einzigen Grafikkarte kann diese eine Entscheidung ungefähr so gut treffen wie die größten Modelle. Das ist wichtig, weil die Beurteilung ständig stattfindet und sich auf Dinge bezieht, die du lieber niemandem schicken würdest.

Warum schlafen

Das Dritte ist der Zeitpunkt der Arbeit.

Das alles kann nicht passieren, während der Agent arbeitet. Jede neue Tatsache bedeutet, alles noch einmal durchzugehen, woran sich der Agent bereits erinnert. Das dauert, und der Agent hat eine Aufgabe zu erledigen. Deshalb findet der aufwendige Teil statt, wenn die Agents untätig sind.

Intern nennen wir diesen Durchlauf REM, nach der Schlafphase, in der Menschen offenbar den Tag einordnen. Anfangs mochte ich den Namen nicht. Er klang verspielt. Aber er passt. Der Durchlauf arbeitet die Sitzungen des Tages durch. Alte Tatsachen werden ausgemustert und Widersprüche geklärt. Danach gibt es weniger zu behalten, und das Übrige entspricht eher der Art, wie du heute arbeitest. Das Gedächtnis soll über Nacht kleiner werden, genau das Gegenteil von einem Stapel.

Du entscheidest, wie viel davon deinen Rechner verlässt. In der privatesten Einstellung verlässt ihn nichts. Das Modell deines eigenen Agent führt die Zusammenführung durch, und alles bleibt lokal. In der Standardeinstellung übernehmen die eigenen Abonnements deiner Agents das Denken. Und wenn du dich dafür entscheidest, treffen unsere Modelle die schwierigsten Entscheidungen, etwa die oben beschriebene zwischen Ersetzen und Behalten.

Ich sollte sagen, wo wir gerade stehen. Der gemeinsame Speicher und die Ersetzungsregel sind bei uns täglich im Einsatz. Der Schlafdurchlauf ist der neueste Teil, und auf unseren eigenen Rechnern läuft er noch nicht jede Nacht. Wegen eines Konfigurationsfehlers hatte er sich selbst übersprungen; das wird gerade behoben. Ich sage es dir lieber selbst, als dich darauf stoßen zu lassen.

Warum es allem zugrunde liegt

Folgendes habe ich am Anfang nicht verstanden. Ich hielt Gedächtnis für eine Funktion. Es ist eher ein Fundament.

Die nächtliche Rückschau, bei der Agents ihre eigenen Sitzungen lesen und Erkenntnisse festhalten, braucht einen Ort für diese Erkenntnisse. Die Übergabe zwischen Agents braucht ihn. Eine Aufzeichnung darüber, was ein Agent getan hat und wie oft er beim ersten Versuch richtiglag, braucht ihn. Später wird alles, was wir in der Cloud bauen, aus dem verdichtet, was dieses Gedächtnis enthält.

Nichts davon wäre es wert, auf einem Stapel aufzubauen, der nur wächst. Dafür braucht es ein Gedächtnis, das am Montag falsch sein und bis Dienstag korrigiert werden kann, ohne dass ein Mensch eingreifen muss.

Wenn das Gedächtnis falsch liegt, erbt der nächste Agent den Fehler, und du erklärst ihn erneut.

Bis der Server wieder umzieht.

Sno Station ist Open Source. Du findest es unter sno.ai.

S

Written by Sno AI Team

Contributing writer at Sno.ai, sharing insights about AI, productivity, and knowledge management.

Related Articles

Comments

Comments coming soon. Configure Giscus at giscus.app

Warum KI-Agents schlafen: ein Gedächtnis, das sich erneuert