Welche Tests bleiben, wenn der Agent schreibt? Die Testpyramide für KI Agents 2026

Von Roland Golla
0 Kommentar
Ockerfarbene Wüste mit schwebender TEST PYRAMID und Roboter auf einer Leiter

Unter dem X Post, in dem ein Team 800.000 Zeilen Unit Tests gelöscht hat, stellt Kenneth Miller die wichtigste Frage der ganzen Debatte: Behaltet ihr wenigstens Integration und E2E Tests? Welche Tests bleiben überhaupt? Diese Frage stellen sich gerade viele Teams. Die Testpyramide für KI Agents sieht anders aus als die, die wir gewohnt sind.

CI/CD Pipeline Setup von NCA: Statische Analyse, Unit Tests und Cypress E2E Tests in einer Pipeline, mit Preview Umgebungen und Deployments auf Servern in Deutschland. Zum Pipeline Setup

Die klassische Pyramide und ihre Annahmen

Die Testpyramide ist einfach: unten viele schnelle Unit Tests, in der Mitte weniger Integration Tests, oben wenige E2E Tests. Eine gute Einführung liefert The Practical Test Pyramid. Die Form hat einen Grund: E2E Tests waren teuer zu schreiben und langsam im Lauf.

Mit Coding Agents ändert sich die Rechnung. Tests schreiben ist billig geworden. Teuer ist jetzt etwas anderes: Tests, die bei jedem Umbau brechen, und Fehler, die kein Test sieht.

Jede Testart unter der Agent Brille

TestartStabil beim Agent RefactoringRolle mit Agents
Statische AnalyseHochErster Filter nach jedem Edit, mit PHPStan, Psalm oder mypy
Unit Tests auf ImplementierungNiedrigKandidaten zum Löschen
Unit Tests auf VerhaltenHochBleiben und sichern die Fachlogik
Integration TestsHochMehr davon, sie prüfen das Zusammenspiel mit Datenbank und Diensten
Cypress E2E TestsHochLetztes Gate, sichern die Wege, die Nutzer wirklich gehen

Das Bild ähnelt eher der Testing Trophy von Kent C. Dodds als einer klassischen Pyramide: breiter in der Mitte, stabiler Boden aus statischer Analyse. Warum Implementierungstests mit Agents so schnell zum Problem werden, erklärt der Beitrag Verhalten statt Implementierung testen.

Regeln für Agents in jeder Stufe

  • Statische Analyse läuft lokal, bevor der Agent überhaupt pusht.
  • Code und Tests nie im selben Schritt ändern. Teständerungen gibt ein Mensch frei.
  • Neue Logik braucht einen Verhaltenstest, bevor sie gemergt wird.
  • E2E Tests sind tabu für den Agent. Sie beschreiben, was der Nutzer erwartet.

KI generierte E2E Tests brauchen eigene Regeln, damit sie stabil laufen. Wie das mit Cypress geht, steht in Testing Meta für Cypress. Das komplette Regelwerk für Teams fassen wir in den NCA Agentic AI Coding Guardrails zusammen.

Cypress als Gate und als Monitoring

In der Debatte fiel auch das Argument, eine Observability Plattform könne Fehler in Production finden und beheben. Wir lösen das anders. Dieselben Cypress Tests, die ein Deployment freigeben, laufen bei uns auch danach weiter. Auf eigener Infrastruktur prüfen sie regelmäßig die wichtigsten Wege durch die Live Seite.

  • Vor dem Deployment: Kein Merge ohne grüne E2E Tests.
  • Nach dem Deployment: Die Tests merken einen kaputten Checkout, bevor es ein Kunde tut.
  • Ein Testsatz, zwei Aufgaben: Kein zweites System, das gepflegt werden muss.

Was E2E Tests in Aufbau und Pflege bedeuten, beschreibt Was kosten E2E Tests. Warum sie Teams entlasten, steht in Warum E2E Tests Webseiten menschlicher machen.

Fazit

Die Antwort auf Kenneths Frage ist klar: Integration und E2E Tests bleiben, und es werden eher mehr. Weg dürfen Unit Tests, die nur Implementierung beschreiben. Wer die Pyramide so umbaut, hat ein Netz, das Agents Freiheit gibt und Nutzer schützt. Den Hintergrund zur Debatte liefert 800.000 Zeilen Tests gelöscht.

Häufige Fragen zur Testpyramide mit KI Agents

Gilt die Testpyramide 2026 noch?

Als Idee ja, in der Form nicht mehr ganz. Mit Agents lohnen sich mehr Integration und E2E Tests, weil Schreiben billig geworden ist und diese Tests Umbauten überstehen. Unit Tests auf Implementierung verlieren an Wert.

Welche Tests sollten 2026 bei KI generiertem Code Pflicht sein?

Statische Analyse, Verhaltenstests für die Fachlogik und E2E Tests für die kritischen Nutzerwege. Diese drei Stufen fangen die typischen Fehler von Agents ab, etwa verschwundene Sonderfälle.

Dürfen KI Agents 2026 E2E Tests schreiben?

Schreiben ja, mit klaren Regeln und Review. Ändern sollte der Agent bestehende E2E Tests nicht ohne Freigabe, weil sie das erwartete Nutzerverhalten festhalten.

Kann Cypress 2026 auch Production überwachen?

Ja. Cypress Tests lassen sich zeitgesteuert gegen die Live Seite ausführen. So melden dieselben Tests, die ein Deployment freigeben, auch Fehler im laufenden Betrieb.

Was ist die Testing Trophy?

Ein Modell von Kent C. Dodds. Es setzt statische Analyse als Boden und den Schwerpunkt auf Integration Tests statt auf viele kleine Unit Tests. Für Teams mit Agents passt es oft besser als die klassische Pyramide.

Die richtige Teststrategie für eure Agents

Wir schauen mit euch auf die Testsuite, bauen die Pyramide für Agentic Coding um und setzen Cypress als Gate und Monitoring auf. Erstgespräch kostenlos, danach transparente Minuten Abrechnung.

0 Kommentar

Tutorials und Top Posts

Gib uns Feedback

Diese Seite benutzt Cookies. Ein Akzeptieren hilft uns die Seite zu verbessern. Ok Mehr dazu