Ein Post auf X hat diese Woche viele Entwickler aufgeregt. Sherwood (@shcallaway) schreibt, sein Team habe rund 800.000 Zeilen Unit Tests aus dem Monorepo von Sazabi gelöscht. Der Diff im Screenshot: 166 Zeilen dazu, über 811.000 Zeilen weg. Dazu drei Thesen, warum Unit Tests mit KI Agents mehr schaden als nützen. Die Frage ist berechtigt. Die Antwort ist gefährlich.
NCA Agentic AI Coding Guardrails: Regeln, Tests und Quality Gates, damit eure Agents schnell bleiben und trotzdem nichts kaputt machen. Zu den Guardrails
Die drei Thesen im Überblick
Sherwood begründet den Schritt mit drei Hypothesen. Er will die Ergebnisse später teilen. Schauen wir uns an, was jeweils dran ist.
| These | Was dran ist | Was fehlt |
|---|---|---|
| Unit Tests zementieren Slop Code | Tests auf Implementierung machen jeden Umbau teuer | Gute Tests prüfen Verhalten und lassen Umbau zu |
| Unit Tests bremsen den Dev Cycle | Lokale Läufe und CI kosten Zeit | Ohne Feedback läuft der Agent nur schneller in die falsche Richtung |
| Unit Tests kosten Tokens und CI Minuten | Agents lesen, reparieren und starten Tests | Ein Fehler in Production kostet mehr als jede CI Minute |
Die Reaktionen: Spott, Sorge und ein guter Einwand
Die Community hat schnell reagiert. Viele mit Ironie: als Nächstes die Build Configs löschen, nach zwei Wochen Agent Arbeit direkt nach Production pushen. Norbert (@norbert_tech) hat die Kette zu Ende gedacht. Erst fliegen die Tests, dann die CI, dann deployen die Agents. Am Ende entscheidet ein Agent, dass die Datenbank ohne User viel schneller ist.
Das ist Satire. Aber sie trifft. Spannender sind die sachlichen Antworten:
- Kevin (@kewun) wendet ein, dass gute Unit Tests gar keinen Slop festhalten, weil sie Verhalten prüfen und nicht die Implementierung.
- Kenneth Miller fragt, ob wenigstens Integration und E2E Tests bleiben und welche Tests das Team überhaupt behält.
Genau das sind die richtigen Fragen. Die erste beantworten wir im Beitrag Verhalten statt Implementierung testen, die zweite in Die Testpyramide für KI Agents.
Warum Agents Tests mehr brauchen als Menschen
Ein Developer kennt die Geschichte seines Codes. Er weiß, warum der seltsame Sonderfall drin ist. Ein Agent weiß das nicht. Er sieht nur Code, der kürzer sein könnte. Was passiert, wenn er ihn kürzt, haben wir in KI Refactoring zerstört die Applikation beschrieben.
- Tests sind die Spezifikation, die ein Agent wirklich lesen kann.
- Rot und Grün ist das Feedback, das jeder Agent versteht.
- Ein roter Test stoppt den Agent, bevor der Fehler im Commit landet.
- Weniger Tests heißt nicht weniger Fehler. Die Fehler fallen nur später auf, oft beim Nutzer.
Observability ersetzt keine Tests
Auf einen Kommentar antwortet Sherwood, sein Team baue eine agentische Observability Plattform, die Fehler in Production automatisch findet und behebt. Das erklärt die Richtung. Es ist aber auch ein Argument mit Produktinteresse.
Observability findet Fehler, nachdem sie passiert sind. Tests finden sie vorher. Beides hat seinen Platz. Wer nur auf das Monitoring setzt, macht seine Nutzer zur Testabteilung.
Löschen ja, aber gezielt
Es gibt Tests, die weg dürfen. Die Frage ist nur, welche. Statt 800.000 Zeilen auf einmal gehen wir so vor:
- Messen: Infection zeigt mit Mutation Testing, welche Tests nichts prüfen. Wie das in PHP läuft, steht im Beitrag zu PHP Mutation Testing.
- Ersetzen: Mock Tests durch echte Verhaltenstests ablösen, wie in Von Mocks zu echten Tests.
- Beschleunigen: Langsame Suites schneller machen statt löschen. Sechs Hebel dafür stehen in Langsame Tests beschleunigen.
- Absichern: Was bleibt, läuft als Quality Gate in der Pipeline.
Fazit
Sherwood will bald berichten, wie das Experiment ausgeht. Wir sind gespannt. Bis dahin bleibt unsere Haltung klar: Tests sind für Agents keine Bremse. Sie sind das Lenkrad. Wer Agents produktiv einsetzen will, braucht Guardrails, nicht weniger davon.
Häufige Fragen zu Unit Tests und KI Agents
Sind Unit Tests 2026 mit KI Agents überflüssig?
Nein. Tests auf reine Implementierung können weg, Tests auf Verhalten nicht. Agents brauchen dieses Feedback sogar mehr als Menschen, weil sie die Geschichte des Codes nicht kennen und Sonderfälle sonst wegräumen.
Bremsen Unit Tests 2026 die Arbeit von Coding Agents?
Langsame Tests bremsen, ja. Die Lösung ist aber schnellere Tests, nicht keine Tests. Gezielte Testauswahl, Parallelisierung und Caching holen meist mehr heraus als Löschen und behalten das Sicherheitsnetz.
Welche Tests darf ich 2026 löschen?
Tests, die bei Mutation Testing nichts finden, und Tests, die nur Mock Aufrufe prüfen. Vorher sollte ein Verhaltenstest dieselbe Logik abdecken. Dann ist das Löschen ein Gewinn statt ein Risiko.
Ersetzt Observability 2026 automatisierte Tests?
Nein. Observability erkennt Fehler, nachdem Nutzer sie erlebt haben. Tests fangen sie vor dem Deployment ab. Beides ergänzt sich, ersetzt sich aber nicht.
Was sind Guardrails für KI Agents?
Regeln, Tests und Quality Gates, die jeder Agent Edit durchlaufen muss. Statische Analyse, Unit Tests, E2E Tests und Review sorgen dafür, dass KI Code denselben Standard erfüllt wie handgeschriebener Code.
Agentic Coding mit Leitplanken
Im NCA KI Workshop für Developer lernt euer Team, Coding Agents mit Regeln, Tests und Quality Gates sicher einzusetzen. Im kostenlosen Erstgespräch klären wir Ziele und Rahmen.
