“Alle Tests sind grün. Das Feature ist fertig.”
Jeder Coding-Agent sagt das. Meistens stimmt es sogar, im engsten Sinne. Die Tests sind grün. Die Tests, die der Agent geschrieben hat. Für den Code, den der Agent geschrieben hat. Auf Basis seiner Lesart eines Tickets, in dem “Export schneller machen” stand.
Das ist kein Beweis. Das ist ein Schüler, der seine eigene Klausur korrigiert und euch die Note reicht.
Wo “fertig” schiefgeht
Ich habe zehn Wochen lang ein KI-Team auf einem echten Produkt laufen lassen, bevor ich kanman auf Basis dessen umgebaut habe, was ich dabei gelernt habe. Die Fehler, die wehgetan haben, waren nie Syntaxfehler. Die fängt die CI.
Die schmerzhaften sahen so aus:
- Der Agent hat genau das gemockt, was der Test prüfen sollte. Grüner Lauf, nichts getestet.
- Der Agent hat einen roten Test “gefixt”, indem er die Assertion geändert hat.
- Das Feature lief auf der Maschine des Agenten, mit Zustand aus drei früheren Versuchen, und sonst nirgends.
- Der PR hat getan, was im Ticket stand, und nicht, was die Person meinte, die es geschrieben hat.
Jeder dieser Fälle ist mindestens einmal durchs Review gekommen, weil Reviewer grünen Checks vertrauen. Natürlich tun sie das. Dafür sind grüne Checks da.
Das Outcome-Gate
Deshalb fragt kanman nicht den Agenten, ob er fertig ist. Das entscheidet das Gate, und das Gate ist kein Agent.
Es funktioniert in vier Schritten.
1. Die Spec kommt zuerst. Jede Story, die kanman bei der Aufnahme schreibt, bekommt einen Demonstrate-Block: einen konkreten, ausführbaren Weg, das Ergebnis zu zeigen. Nicht “Unit-Tests grün”, sondern “10.000 Zeilen exportieren, und der Download startet innerhalb von zwei Sekunden”. Aus diesem Block wird eine Akzeptanz-Spec, bevor irgendjemand eine Zeile Feature-Code schreibt.
2. Rot vor Ready. Eine Story kommt erst nach Ready, wenn ihre Spec existiert, läuft und fehlschlägt. Eine Spec, die vor der Arbeit schon grün ist, testet nichts. Eine Spec, die ihr eigenes Ziel mockt, wird abgelehnt. Keine Spec, kein Ready.
3. Der Agent fasst die Spec nicht an. Die Spec liegt auf einem geschützten Pfad. Wenn ein Commit des Coding-Agenten sie ändert, stoppt das Gate die Story. Der Agent kann die Spec grün machen. Er kann sie nicht leichter machen.
4. Grün im Reinraum, sonst kein Review. Wenn der Agent “fertig” meldet, läuft die Spec erneut auf einem frischen Checkout, gegen eine frisch aufgesetzte Umgebung. Kein Restzustand, kein “läuft bei mir”. Ist sie rot, geht die Story zurück in die Arbeit. Ist sie grün, öffnet sich der Pull Request. Kein grüner Lauf, kein Review.
Der Pull Request kommt dann mit einem Evidence Pack: jedes Akzeptanzkriterium mit seinem Ergebnis, der Spec-Lauf, Trace und Screenshots aus dem Lauf, welches Modell die Arbeit gemacht hat und was sie gekostet hat. Eure Reviewerin liest Belege, statt sie sich zusammenzusuchen.
“Unser Repo hat keine Akzeptanztests”
Die meisten Repos, die ich sehe, haben keine. Das ist okay.
Zum Start braucht ihr keine Testsuite, sondern ein Manifest: eine kleine .kanman/acceptance.json, die kanman sagt, wie es eine Umgebung startet und eine Spec ausführt. Wenn euer Repo keins hat, öffnet kanman einen Pull Request, der es hinzufügt, und ihr reviewt ihn wie jede andere Änderung. Der Guide zum Akzeptanz-Manifest erklärt die Schritte.
Bis dahin gibt es das Trial-Preset. Es lockert die Spec-Pflicht für die erste Pilotwoche und fällt auf CI, Testplan und einen unabhängigen Review-Lauf zurück. Und das Evidence Pack sagt das in klaren Worten: Für diese Änderung gibt es keinen Ergebnisnachweis. Das sage ich euch lieber, als ein grünes CI-Badge als Beweis zu verkleiden.
Warum genau das zählt
Es hat einen Grund, dass das in der Mitte von kanman sitzt und nicht in einer Einstellungsseite.
Ein KI-Teammitglied, das ungeprüfte Arbeit liefert, spart eurem Team keine Zeit. Es verschiebt die Arbeit vom Code-Schreiben zum Code-Anzweifeln. Eure Senior-Leute reviewen am Ende jede Zeile doppelt, weil sie nicht erkennen, welche PRs echt sind.
Ein KI-Teammitglied, das Belege zeigt, verändert das Review. Ihr fragt nicht mehr “funktioniert das?”, sondern “wollten wir das?”. Diese zweite Frage können Menschen gut beantworten.
Agenten, die ihre Arbeit beweisen, schlagen Agenten, die Demos zeigen. Wer die Details will: Das Outcome-Gate ist Schritt für Schritt dokumentiert.
Ihr wollt ein KI-Teammitglied, das seine Arbeit beweist, bevor es euch um ein Review bittet? kanman - Pilot ab 5.000 € für 6 Wochen, Team 990 € pro KI-Team und Monat.
Marco Kerwitz
Founder of kanman.ai