Unter dem X Post, in dem ein Team 800.000 Zeilen Unit Tests gelöscht hat, stellt Kenneth Miller die wichtigste Frage der ganzen Debatte: Behaltet ihr wenigstens Integration und E2E Tests? Welche Tests bleiben überhaupt? Diese Frage stellen sich gerade viele Teams. Die Testpyramide für KI Agents sieht anders aus als die, die wir gewohnt sind.
CI/CD Pipeline Setup von NCA: Statische Analyse, Unit Tests und Cypress E2E Tests in einer Pipeline, mit Preview Umgebungen und Deployments auf Servern in Deutschland. Zum Pipeline Setup
Die klassische Pyramide und ihre Annahmen
Die Testpyramide ist einfach: unten viele schnelle Unit Tests, in der Mitte weniger Integration Tests, oben wenige E2E Tests. Eine gute Einführung liefert The Practical Test Pyramid. Die Form hat einen Grund: E2E Tests waren teuer zu schreiben und langsam im Lauf.
Mit Coding Agents ändert sich die Rechnung. Tests schreiben ist billig geworden. Teuer ist jetzt etwas anderes: Tests, die bei jedem Umbau brechen, und Fehler, die kein Test sieht.
Jede Testart unter der Agent Brille
| Testart | Stabil beim Agent Refactoring | Rolle mit Agents |
|---|---|---|
| Statische Analyse | Hoch | Erster Filter nach jedem Edit, mit PHPStan, Psalm oder mypy |
| Unit Tests auf Implementierung | Niedrig | Kandidaten zum Löschen |
| Unit Tests auf Verhalten | Hoch | Bleiben und sichern die Fachlogik |
| Integration Tests | Hoch | Mehr davon, sie prüfen das Zusammenspiel mit Datenbank und Diensten |
| Cypress E2E Tests | Hoch | Letztes Gate, sichern die Wege, die Nutzer wirklich gehen |
Das Bild ähnelt eher der Testing Trophy von Kent C. Dodds als einer klassischen Pyramide: breiter in der Mitte, stabiler Boden aus statischer Analyse. Warum Implementierungstests mit Agents so schnell zum Problem werden, erklärt der Beitrag Verhalten statt Implementierung testen.
Regeln für Agents in jeder Stufe
- Statische Analyse läuft lokal, bevor der Agent überhaupt pusht.
- Code und Tests nie im selben Schritt ändern. Teständerungen gibt ein Mensch frei.
- Neue Logik braucht einen Verhaltenstest, bevor sie gemergt wird.
- E2E Tests sind tabu für den Agent. Sie beschreiben, was der Nutzer erwartet.
KI generierte E2E Tests brauchen eigene Regeln, damit sie stabil laufen. Wie das mit Cypress geht, steht in Testing Meta für Cypress. Das komplette Regelwerk für Teams fassen wir in den NCA Agentic AI Coding Guardrails zusammen.
Cypress als Gate und als Monitoring
In der Debatte fiel auch das Argument, eine Observability Plattform könne Fehler in Production finden und beheben. Wir lösen das anders. Dieselben Cypress Tests, die ein Deployment freigeben, laufen bei uns auch danach weiter. Auf eigener Infrastruktur prüfen sie regelmäßig die wichtigsten Wege durch die Live Seite.
- Vor dem Deployment: Kein Merge ohne grüne E2E Tests.
- Nach dem Deployment: Die Tests merken einen kaputten Checkout, bevor es ein Kunde tut.
- Ein Testsatz, zwei Aufgaben: Kein zweites System, das gepflegt werden muss.
Was E2E Tests in Aufbau und Pflege bedeuten, beschreibt Was kosten E2E Tests. Warum sie Teams entlasten, steht in Warum E2E Tests Webseiten menschlicher machen.
Fazit
Die Antwort auf Kenneths Frage ist klar: Integration und E2E Tests bleiben, und es werden eher mehr. Weg dürfen Unit Tests, die nur Implementierung beschreiben. Wer die Pyramide so umbaut, hat ein Netz, das Agents Freiheit gibt und Nutzer schützt. Den Hintergrund zur Debatte liefert 800.000 Zeilen Tests gelöscht.
Häufige Fragen zur Testpyramide mit KI Agents
Gilt die Testpyramide 2026 noch?
Als Idee ja, in der Form nicht mehr ganz. Mit Agents lohnen sich mehr Integration und E2E Tests, weil Schreiben billig geworden ist und diese Tests Umbauten überstehen. Unit Tests auf Implementierung verlieren an Wert.
Welche Tests sollten 2026 bei KI generiertem Code Pflicht sein?
Statische Analyse, Verhaltenstests für die Fachlogik und E2E Tests für die kritischen Nutzerwege. Diese drei Stufen fangen die typischen Fehler von Agents ab, etwa verschwundene Sonderfälle.
Dürfen KI Agents 2026 E2E Tests schreiben?
Schreiben ja, mit klaren Regeln und Review. Ändern sollte der Agent bestehende E2E Tests nicht ohne Freigabe, weil sie das erwartete Nutzerverhalten festhalten.
Kann Cypress 2026 auch Production überwachen?
Ja. Cypress Tests lassen sich zeitgesteuert gegen die Live Seite ausführen. So melden dieselben Tests, die ein Deployment freigeben, auch Fehler im laufenden Betrieb.
Was ist die Testing Trophy?
Ein Modell von Kent C. Dodds. Es setzt statische Analyse als Boden und den Schwerpunkt auf Integration Tests statt auf viele kleine Unit Tests. Für Teams mit Agents passt es oft besser als die klassische Pyramide.
Die richtige Teststrategie für eure Agents
Wir schauen mit euch auf die Testsuite, bauen die Pyramide für Agentic Coding um und setzen Cypress als Gate und Monitoring auf. Erstgespräch kostenlos, danach transparente Minuten Abrechnung.
