An open notebook with handwritten notes beside a dim laptop at night
Back to blog
EngineeringAI Automation

290 Sitzungen, 13 Lektionen: Was KI-Agents sich selbst beibrachten

Jede Nacht lesen unsere KI-Agents ihre eigene Arbeit und halten fest, was sie gelernt haben. Nach 290 Sitzungen bestanden 13 Lektionen die Prüfung, und wir behielten 6. Hier steht, was sie fanden und was es wert war.

S
Sno AI Team
October 5, 2026
|
6 min read
|
118 views
Share:

An den meisten Morgen erscheint ganz oben in meinem Terminal eine Lektion. Sie lautet: Führe die Tests aus, die du geschrieben hast, und melde bestanden oder fehlgeschlagen, bevor du sagst, dass du fertig bist.

Niemand in unserem Team hat diesen Satz geschrieben. Ein Agent tat es nachts, nachdem er die Arbeit eines ganzen Tages durchgelesen und bemerkt hatte, dass er immer wieder Tests schrieb und sie dann nicht ausführte.

Man nennt das rekursive Selbstverbesserung (RSI). Es klingt nach einem Aufsatz über das Ende der Welt. In der Praxis ähnelt es eher einem Musiker, der sich nach dem Konzert die Aufnahme anhört. Du hörst die Stelle, an der du zu schnell gespielt hast. Du machst dir eine Notiz. Morgen spielst du ein bisschen weniger schnell.

Diese Schleife läuft seit Mitte September auf unseren eigenen Rechnern. Das meiste, was ich über RSI bei KI-Agents lese, handelt davon, was es eines Tages tun könnte. Hier geht es darum, was unseres bisher getan hat.

So funktioniert die Schleife

Sno Station führt sie einmal am Tag aus. Die Schritte sind einfach.

Es sammelt die Sitzungen des Tages aus Claude Code und Codex. Jede Sitzung bekommt eine kurze Einstufung: aufhebenswert oder nicht, erfolgreich oder fehlgeschlagen. Die aufgehobenen Sitzungen gehen an ein Bewertungsmodell, das nach einem Moment sucht, in dem etwas gelernt wurde. Meistens korrigiert dabei ein Mensch den Agenten, manchmal bemerkt der Agent seinen Fehler selbst, und manchmal macht ihm einfach die Umgebung einen Strich durch die Rechnung.

Für jeden solchen Moment schreibt das Bewertungsmodell eine Lektion aus vier Teilen. Die auslösende Situation. Den Rat. Den Grund. Und den Beleg, Wort für Wort aus der Sitzung zitiert, samt der Zeile, aus der er stammt.

Dann muss die Lektion durch zwei Prüfungen.

Die erste ist mechanisch. Jedes Zitat, das die Lektion anführt, muss Zeichen für Zeichen in der Sitzung stehen, aus der es angeblich stammt. Eine Lektion mit einem Zitat, das dort nicht vorkommt, wird verworfen. Bei der zweiten Prüfung hat ein anderes Modell nur eine Aufgabe: zweifeln. Es gleicht jeden Satz der Lektion mit den Belegen ab. Eine Lektion, die mehr behauptet, als ihre Belege hergeben, kommt nicht durch.

Danach ist ein Mensch dran. Ich lese, was übrig bleibt, und entscheide: behalten oder nicht.

Lektionen, die bestehen, werden den Agents zu Beginn späterer Sitzungen gezeigt, jeweils in einer Zeile. Diejenigen, die am meisten geholfen haben, stehen oben. Wenn eine Lektion relevant erscheint, kann der Agent sie vollständig öffnen.

Was dabei herauskam

Hier sind die Zahlen aus den Aufzeichnungen der Schleife auf unserem Build-Rechner.

Sie sammelte 1.879 Sitzungen. Davon gingen 290 an das Bewertungsmodell. 13 Lektionen bestanden beide Prüfungen. Ich behielt 6. Die anderen 7 liegen noch da und warten auf meine Entscheidung.

290 Sitzungen, 13 Lektionen. Dieses Verhältnis überraschte mich zuerst. Dann dachte ich darüber nach. An wie vielen Tagen deiner eigenen Arbeit passiert etwas, das du aufschreiben und an die Wand hängen würdest? Die meisten Tage sind einfach nur Tage.

Und die Lektionen selbst sind klein. Ehrlich gesagt hatte ich etwas Großartigeres erwartet. Hier sind drei davon, so wie die Agents sie geschrieben haben.

Nach einer Umbenennung eines Pakets oder Verzeichnisses mit git mv in einem npm-Workspace prüfe vor dem Verifikationsnachweis ausdrücklich die von git ignorierten Verzeichnisse mit Build-Ausgaben jedes Pakets (dist/, build/, out/) auf veraltete Artefakte. Verschiebe oder lösche sie.
Lies vor dem Erstellen jedes Teilstücks eines Patches den genauen Zeilenbereich an seiner Zielstelle, um den Kontext wortgetreu zu erfassen. Verwende niemals Bezeichner oder Syntax aus einer früheren, abgeschnittenen Ansicht derselben Datei wieder.
Bezeichne die Fähigkeit als „in den geprüften Quellen nicht dokumentiert“, bis ein ausdrücklicher Vertrag oder ein gezielter Test belegt, dass sie fehlt.

Die erste Lektion kostete uns an dem Tag, als es passierte, einen Nachmittag. Ein Paket wurde umbenannt, im Quellcode war alles richtig, und die Installation schlug weiterhin fehl, weil noch eine alte kompilierte Datei in einem Ordner lag, den git nicht beachtet. Das zweite ist etwas, das ein Agent vierzigmal pro Woche tut: Er erinnert sich ungefähr an den Inhalt einer Datei und schreibt einen Patch anhand seiner Erinnerung statt anhand der Datei.

Die dritte mag ich am liebsten. Ein Agent verglich Produkte, fand eine Funktion nicht in der Dokumentation eines Konkurrenten und meldete, der Konkurrent habe sie nicht. Schweigen ist kein Beleg für Abwesenheit. Diese Lektion musste ich auch schon Menschen beibringen.

Das sind die Dinge, die ein erfahrener Ingenieur mit sich herumträgt, ohne es zu merken. Narben. Der Unterschied ist, dass ein Agent jede Sitzung ganz ohne Narben beginnt.

Was es wert ist

Ich kann noch nicht sagen, wie sehr irgendetwas davon hilft.

Die Lektionen wurden zu Beginn von 5.595 Sitzungen gezeigt. In 135 Fällen öffnete ein Agent eine davon vollständig. Also in etwa 2 Prozent der Fälle. Die einzeilige Version erledigt den Großteil der Arbeit, oder gar nichts tut es. Ich kann nicht immer erkennen, was davon zutrifft.

Die Schleife prüft auch ihre eigenen Ergebnisse. Nachdem eine Lektion gezeigt wurde, fragt sie, ob der Agent sie befolgt hat und ob das geholfen hat. Bisher gibt es zwei klare Antworten: „befolgt, und es hat geholfen“. Beide betreffen dieselbe Lektion. Sieben weitere Fälle blieben unklar.

Und die Lektion ganz oben in meinem Terminal, die über das Ausführen deiner Tests? Nachdem sie eingeführt wurde, ließen Agents die Tests manchmal immer noch aus. 4 Fehlschläge in 12 Sitzungen. Vor der Lektion waren es 22 in 119. Die Stichprobe ist zu klein, um zu sagen, dass es schlechter wurde. Sie ist ganz sicher auch zu klein, um zu sagen, dass es besser wurde.

Ich weiß es also noch nicht. Das meine ich wörtlich. Wenn du mich zwingen würdest, heute einen Wert dafür zu nennen, würde ich sagen: Jede behaltene Lektion verhindert einen Fehler, der zwischen zehn Minuten und einem Nachmittag kostet, und dieselben sechs Fehler kommen oft genug wieder vor, dass das ins Gewicht fällt. Eine Nacht, in der 193 Sitzungen bewertet wurden, kostete ungefähr fünfzig Cent. Der Preis dafür, den Wert falsch einzuschätzen, ist niedrig.

Worauf ich vertraue, ist weniger als eine Messung. Ich erkenne die Lektionen wieder. Ich lese sie und denke: Ja, das ist passiert, und ja, genau das hätte ich dem Agenten gesagt.

Was schiefging

Die Schleife selbst brauchte dieselbe Behandlung, die sie den Agents gibt.

Am Anfang ließ ein Fehler Entwürfe von Lektionen durch die zweite Prüfung schlüpfen, ohne dass sie überhaupt geprüft wurden. Wir verwarfen sie alle. Die Zahlen oben enthalten nur, was den gesamten Prozess durchlaufen hat.

Außerdem hatten wir die Schleife zu vorsichtig gebaut. Einen Canary-Test, eine Hash-Prüfung, eine Wiederherstellung nach Abstürzen. Eines Nachts entfernten wir 724 Zeilen davon, und danach lief sie besser. Ein System, das aus Fehlern lernen sollte, war gegen Fehler abgesichert worden, die es nie gemacht hatte.

Dann wurde es Ende September still um die Schleife. Eine Einstellungsdatei war verschwunden. Jede Nacht wachte die Schleife auf, fand nichts, was sie senden durfte, und schlief wieder ein. Das ging eine Woche so, bevor es jemand bemerkte. Etwas, das um drei Uhr morgens still scheitert, ist schwer zu lieben.

Das steht jetzt auf der Liste. Wahrscheinlich sollte es eine Lektion werden.

Wie es weitergeht

Dreizehn Lektionen sind kein Agent, der sich selbst neu schreibt. Es ist ein Notizbuch. Vor einem Monat machten unsere Agents am Dienstag denselben Fehler wie am Montag, ohne sich an einen der beiden zu erinnern.

An manchen Morgen steht die Erinnerung da, und die Tests werden trotzdem nicht ausgeführt.

Sno Station ist Open Source, und die nächtliche Rückschau gehört dazu. Du findest es auf sno.ai.

S

Written by Sno AI Team

Contributing writer at Sno.ai, sharing insights about AI, productivity, and knowledge management.

Related Articles

Comments

Comments coming soon. Configure Giscus at giscus.app

290 Sitzungen, 13 Lektionen: Was KI-Agents sich beibrachten