
Die Stufen der KI-Agent-Automatisierung
Ein praktisches Modell von L1 bis L5 für die KI-Agent-Automatisierung: von Autovervollständigung und Assistenten bis zu Coding-Agents, KI-Gedächtnis, KI-Workflows und Automatisierung ganzer Fachbereiche.
Für autonomes Fahren gibt es eine nützliche Sprache: L1 bis L5. L1 bedeutet Assistenz, L2 teilweise Automatisierung, L3 beginnt, komplexere Bedingungen zu bewältigen, L4 funktioniert in definierten Bereichen selbstständig, und L5 steht für die vollständige FSD-Idee: Das System kommt vom Start bis zum Ziel, ohne dass ein Mensch fährt.
Die Automatisierung durch KI-Agents braucht eine ähnliche Sprache. Heute sagen alle „Agent“, meinen damit aber oft sehr Unterschiedliches. Die einen meinen Autovervollständigung. Andere meinen einen Programmierassistenten. Wieder andere meinen einen Agent, der Dateien lesen, Befehle ausführen, Systeme aktualisieren, sich an frühere Arbeit erinnern und einen Geschäftsprozess abschließen kann.
Der Nutzen dieses Modells ist einfach: Es hilft einem Team festzustellen, wo es tatsächlich steht. Wenn du die Stufe kennst, siehst du, was als Nächstes fehlt: ein besseres KI-Agent-Harness, ein stärkeres KI-Gedächtnis, klarere KI-Workflows, sicherere Berechtigungen oder leistungsfähigere KI-Agents.
L1: KI-Assistenz, der Mensch steuert
Auf L1 ist die KI eine Hilfe. Sie sieht wenig Kontext, sagt voraus, was du als Nächstes brauchen könntest, und lässt dich schneller arbeiten. Der Mensch steuert weiterhin die Aufgabe, wählt das Ziel, prüft das Ergebnis und trägt die Verantwortung dafür.
Ein einfaches Beispiel ist die Tab-Funktion von Cursor IDE. Anhand der Datei und der Cursorposition sagt sie die nächste Änderung oder Codezeile voraus. Das kann sich sehr leistungsfähig anfühlen, weil es das Schreiben von Code erleichtert. Aber die Funktion entscheidet nicht, welches Modul geändert werden soll, führt keine Testsuite aus, erstellt keinen Pull Request und veröffentlicht nichts. Das Lenkrad liegt weiterhin vollständig in menschlicher Hand.
Ein weiteres verbreitetes Beispiel für L1 ist generative KI im Chat. Du gibst etwa „Erstelle ein filmisch wirkendes Produktbild für ein neues KI-Workflow-Tool“ ein, prüfst das Ergebnis, passt den Prompt an und wählst das endgültige Bild. Das Modell kann ein nützliches Bild, einen Absatz oder eine Idee liefern. Zielsetzung, Qualitätsurteil, Überarbeitung und Entscheidung über die Verwendung liegen aber weiterhin beim Menschen.
Typische Einsatzfälle für L1 sind:
- Eine Codezeile vervollständigen
- Eine Antwort entwerfen
- Aus einem Prompt ein Bild erzeugen
- Ein Dokument zusammenfassen
- Einen Titel vorschlagen
- Einen kurzen Codeabschnitt erklären
L1 ist nützlich, wird aber leicht überschätzt. Es macht Menschen schneller, automatisiert jedoch nicht den Workflow.
L2: Automatisierung einzelner Aufgaben unter menschlicher Aufsicht
Auf L2 beginnt die KI, innerhalb einer klar begrenzten Aufgabe zu arbeiten. Sie kann bei einer Datei, einer Funktion, einem kleinen Fehler, einem Test oder einer eng gefassten Anfrage helfen. Der Mensch definiert weiterhin die Aufgabe, prüft das Ergebnis und entscheidet, ob er es annimmt.
GitHub Copilot passt gut hierher. Es geht über die Vervollständigung einzelner Zeilen hinaus: Es kann Änderungen vorschlagen, Fehler erklären, Testideen entwickeln und mit mehr Kontext in der IDE arbeiten. Meist beaufsichtigt die entwickelnde Person die Arbeit aber weiterhin genau. Der Mensch entscheidet, was er anfragt, annimmt oder verwirft und wann der Code fertig ist.
Hier werden die ersten Bestandteile eines KI-Agent-Harnesses wichtig. Das System braucht Kontext, Zugriff auf Werkzeuge, Grenzen für Berechtigungen, Protokolle, Möglichkeiten zur Gegenprüfung und eine Möglichkeit, das Ergebnis durch Menschen prüfen zu lassen.
Eine Aufgabe zur Veröffentlichung von Inhalten lässt sich zum Beispiel so aufteilen:
- Einen Markdown-Entwurf erstellen
- Ein PNG-Titelbild erstellen
- Das Bild in die Medienbibliothek eines CMS hochladen
- Die Markdown-Konvertierung testweise durchlaufen lassen
- Den Beitrag veröffentlichen
- Die Live-Seite öffnen und prüfen, ob Titel, Text und Bild richtig angezeigt werden
Auf L2 kann die KI bei einigen dieser Schritte helfen, aber der Mensch beaufsichtigt weiterhin den Ablauf.
L3: Automatisierung ganzer Workflows, Übergabe bei Unsicherheit
Auf L3 beantwortet die KI nicht mehr nur Fragen oder erledigt kleine Aufgaben. Sie kann einen mehrstufigen Workflow verstehen, mehrere Aktionen ausführen, Fehler beobachten und den nächsten Schritt anpassen.
Claude Code ist ein gutes Beispiel für diese Stufe. Du kannst ihm ein Entwicklungsziel geben. Es kann dann das Repository untersuchen, mehrere Dateien bearbeiten, Typprüfungen oder Tests ausführen, Fehlermeldungen lesen, das Problem beheben und berichten, was sich geändert hat. Es steuert einen Workflow, statt nur Text zu erzeugen.
Hier rückt auch der KI-Workflow ins Zentrum. Ein nützlicher Agent braucht einen Weg durch die Arbeit: planen, bearbeiten, überprüfen, Fehler beheben und zusammenfassen. Wenn ein Testlauf fehlschlägt, sollte er das Frontmatter korrigieren. Wenn eine Bild-URL nicht funktioniert, sollte er den Medieneintrag prüfen. Wenn eine Live-Seite ohne Inhalt angezeigt wird, sollte er Slug, Locale, CMS-Status und Rich-Text-Inhalt prüfen.
L3 ist bei wertvoller Automatisierung verbreitet, weil es leistungsfähig und zugleich realistisch ist:
- Softwareentwicklung: Code bearbeiten, Tests ausführen, Lint-Fehler beheben, einen PR vorbereiten
- Content-Betrieb: Aus einem Briefing einen CMS-Beitrag machen und die Live-Seite prüfen
- Vertriebsbetrieb: Leads anreichern, CRM-Felder aktualisieren, Aufgaben zur Nachverfolgung erstellen
- Datenanalyse: Daten abrufen, einen Bericht erstellen, Auffälligkeiten erklären
- Kundensupport: Anfragen einordnen, Antworten entwerfen, Sonderfälle weitergeben
Entscheidend ist nicht, dass das Modell besser chattet. Entscheidend ist, dass der Workflow vollständig genug ist, damit der Agent weiterarbeiten kann, bis echte Unsicherheit oder eine Berechtigungsgrenze auftritt.
L4: Automatisierung eines Fachbereichs innerhalb klarer Grenzen
Auf L4 kann ein Agent lange Zeit in einem definierten Fachbereich arbeiten. Er kennt das Ziel, hat Zugriff auf Werkzeuge, versteht Berechtigungen, erinnert sich an die Vorgeschichte und kann Ergebnisse in echte Geschäftssysteme zurückschreiben.
OpenClaw und Hermes weisen in diese Richtung. Sie sind nicht nur für einmalige Erledigungen oder einzelne Programmiersitzungen gedacht. Sie sind auf dauerhaften Betrieb ausgelegt: Werkzeuge, Gedächtnis, Workflows, Berechtigungen und Rückkopplung. Ihr Wert liegt nicht nur darin, dass ein Agent einmal eine beeindruckende Aufgabe erledigt, sondern dass er in einem Geschäftsbereich wiederholt und zuverlässig arbeiten kann.
Hier wird das KI-Gedächtnis entscheidend. Ohne Gedächtnis beginnt der Agent jedes Mal bei null. Mit Gedächtnis kann er frühere Entscheidungen, bevorzugten Schreibstil, Produktregeln, kundenspezifischen Kontext, Vorgaben für Veröffentlichungen und Muster aus früherer Arbeit behalten.
L4 bedeutet nicht, dass das System alles kann. Es bedeutet, dass es innerhalb eines definierten Bereichs weitgehend selbstständig arbeiten kann. Verlässt es diesen Bereich, sollte es anhalten, mit weniger Eigenständigkeit fortfahren oder die Aufgabe an einen Menschen übergeben.
Mögliche Beispiele für L4 sind:
- Ein Marketing-Agent, der Produktneuigkeiten fortlaufend in Blogbeiträge, E-Mails, Social-Media-Beiträge und Landingpages umsetzt
- Ein Finanz-Agent, der Belege sammelt, Auffälligkeiten prüft und Monatsabschlussberichte vorbereitet
- Ein Personal-Agent, der Einarbeitung, Berechtigungen, Schulungen und Statusmeldungen koordiniert
- Ein Compliance-Agent, der Änderungen von Vorschriften verfolgt und Prüfungsunterlagen vorbereitet
- Ein Datenbetriebs-Agent, der Kennzahlen überwacht, Veränderungen untersucht und Aufgaben an Teams weiterleitet
Die Schwierigkeit liegt nicht nur in der Intelligenz des Modells. Schwierig ist es, KI-Agent-Harness, KI-Gedächtnis, KI-Workflow, Berechtigungen, Prüfpfade, Möglichkeiten zum Zurücksetzen und die Übergabe an Menschen zu einem stabilen Betriebssystem zu verbinden.
L5: Vollständige Autonomie, die noch unerreichte FSD-Stufe
L5 ist einer der am häufigsten missbrauchten Begriffe bei der Automatisierung durch KI-Agents. Er bedeutet nicht, dass das Modell klug klingt. Er bedeutet auch nicht, dass der Agent viele Werkzeuge aufrufen kann. Er bedeutet, dass der Agent in einer offenen, sich verändernden Umgebung arbeiten und die Verantwortung für das Endergebnis übernehmen kann.
Beim Vergleich mit dem Autofahren bedeutet L5 nicht „es hat auf einer bekannten Straße funktioniert“. Gemeint ist die eigentliche FSD-Idee: Das System kann mit wechselnden Straßen und ungewöhnlichen Bedingungen umgehen und den ganzen Weg bewältigen, ohne dass ein Mensch fährt.
So weit sind wir noch nicht. Selbst die stärksten Agent-Systeme sind heute eher auf einem starken L3 oder einem fachbereichsspezifischen L4. Sie können hervorragend arbeiten, wenn Wege, Berechtigungen, Werkzeuge und Erfolgskriterien feststehen. Noch sind sie keine universellen Fahrer für Geschäftsprozesse, die über alle Systeme, Branchen und Sonderfälle hinweg jedes Ergebnis sicher verantworten können.
Um L5 näherzukommen, bräuchte das System:
- Ein KI-Agent-Harness für Werkzeuge, Berechtigungen, Beobachtbarkeit, Prüfung und Zurücksetzen
- Ein KI-Gedächtnis für langfristigen Kontext, Vorlieben, Entscheidungen und Geschäftswissen
- Einen KI-Workflow für Prozesszustand, Prüfkriterien und den Umgang mit Ausnahmen
- KI-Agents, die planen, ausführen, überprüfen, Fehler beheben und sich mit der Zeit verbessern können
Der praktikable Weg führt vorerst über L2 und L3 und anschließend zu L4, wo der Fachbereich klar genug abgegrenzt ist. L5 bleibt das Ziel, nicht die heutige Realität.
Warum dieses Modell wichtig ist
Die Automatisierung durch KI-Agents wird in jede Branche Einzug halten, aber Teams werden nicht alle gleich schnell reifen. Softwareentwicklung, Marketing, Kundensupport, Finanzen, Recht, Gesundheitsbetrieb, Bildung, Fertigung und Lieferketten können L1 bis L5 als gemeinsame Landkarte nutzen.
Ein Team auf L1 sollte die Nutzung seines Assistenten ausgezeichnet gestalten. Auf L2 sollte es ein ernst zu nehmendes KI-Agent-Harness aufbauen. Beim Übergang zu L3 sollte sich der Schwerpunkt auf die Steuerung von Workflows und die Fehlerbehebung verlagern. Für L4 braucht es KI-Gedächtnis, Berechtigungen, Prüfbarkeit und stabile Systemintegrationen.
Die beste Frage lautet nicht „Sollen wir KI-Agents einsetzen?“. Bessere Fragen sind:
Wo stehen wir heute? Welche Stufe kommt als Nächstes? Welche Workflows sind wiederkehrend, wertvoll und gut genug überprüfbar, um sie zuerst zu automatisieren? In welchen Teilen unserer Branche gibt es bereits klare Wege, Regeln und Rückkopplungen?
Wenn KI-Agent-Harness, KI-Gedächtnis, KI-Workflow und KI-Agents zusammenarbeiten, ist KI-Automatisierung nicht mehr nur eine Demo, sondern wird zur Infrastruktur. L1 bis L5 ist kein Slogan. Es ist eine Roadmap.
Written by Sno AI Team
Contributing writer at Sno.ai, sharing insights about AI, productivity, and knowledge management.
Related Articles
Comments
Comments coming soon. Configure Giscus at giscus.app


