
KI-Agenten: Der Code wird mehr, die Fehler auch
Quellen (9)
- Faros AI: The AI Engineering Report 2026 – Acceleration Whiplashfaros.ai
- Faros AI Blog: Ten Takeaways vom AI Engineering Report 2026faros.ai
- ingenieur.de: KI-Agenten übernehmen Ingenieuraufgaben: Was bleibt dem Menschen?ingenieur.de
- ingenieur.de: OpenAI-Analyse – Engineering-Aufgaben außerhalb technischer Berufeingenieur.de
- ADT Mag: More Code, More Bugs – Faros Report Finds Trade-offs in AI-Driven Developmentadtmag.com
- IT-Boltwise: KI-Agenten verändern Softwareentwicklung – Produktivität steigt, Ohnmacht bleibtit-boltwise.de
- mind-verse.de: Zukunft des Software-Engineerings: KI-Agenten als transformative Kraftmind-verse.de
- borncity: KI-Agenten erobern Unternehmen – Gartner rechnet mit 215 Milliardenborncity.com
- Faros AI: AI Engineering Report 2026 (PDF)pages.faros.ai
Die bislang größte empirische Studie zu KI-Agenten in der Softwareentwicklung zeigt ein Paradox. Faros AI analysierte zwei Jahre Telemetriedaten von 22.000 Entwicklern in mehr als 4.000 Teams weltweit. Das Ergebnis trägt den Titel "Acceleration Whiplash": Wer mit KI-Unterstützung Gas gibt, schlägt früher oder später hart gegen die Qualitätsbremse. Mehr Output, mehr Fehler, weniger Kontrolle.
Die Produktivitätsgewinne und ihr Preis
Die Daten des Faros-Berichts sind in zwei Richtungen eindeutig. Teams mit hoher KI-Nutzung schaffen 66 Prozent mehr Epics, also abgeschlossene Arbeitspakete, pro Entwickler und erledigen 34 Prozent mehr Aufgaben insgesamt. Das sind echte Produktivitätsgewinne aus realer Unternehmenstelemetrie, nicht aus Laborexperimenten unter kontrollierten Bedingungen.
Gleichzeitig steigt in denselben Teams die Zahl der Produktionsstörungen pro eingereichtem Code-Paket um 242,7 Prozent. Die mittlere Zeit für die Code-Überprüfung verlängert sich um 441,5 Prozent. Der Code-Churn, also der Anteil von Code, der kurz nach seiner Entstehung wieder gelöscht wird, erhöht sich um 861 Prozent. Code wird schneller geschrieben als er sorgfältig durchdacht ist.
Besonders aufschlussreich ist eine weitere Zahl: Pull Requests, also Einreichungen neuen Codes ohne jede Überprüfung durch menschliche Reviewer oder automatisierte Prüfsysteme, haben um 31,3 Prozent zugenommen. Der Bericht begründet das direkt: Reviewer können mit dem Volumen des von KI-Agenten erzeugten Codes schlicht nicht mithalten.
Wenn das Budget die Qualität überholt
Teams mit dem höchsten Einsatz an KI-Token-Budget, also diejenigen, die am stärksten auf KI-generierten Code setzen, erreichen den doppelten Durchsatz im Vergleich zu Teams ohne KI-Unterstützung. Gleichzeitig entstehen bei ihnen zehnmal so hohe Tokenkosten. Das Fachmagazin ADT Mag fasst den Kernbefund so zusammen: Mehr Code bedeutet mehr Fehler, wenn die Überprüfungsprozesse nicht im gleichen Maß wachsen wie die Produktion.
KI-Agenten sind gut darin, Code zu erzeugen. Sie sind schlechter darin, seinen Kontext zu beurteilen, Wechselwirkungen mit bestehendem Code zu erkennen und Langzeitfolgen einzuschätzen. Das ist keine Eigenschaft, die zukünftige Modellversionen automatisch lösen. Es ist eine systemische Frage danach, wer die Verantwortung für das Ergebnis trägt.
Eine Analyse von OpenAI, die mehr als 800.000 berufliche Nachrichten aus US-Unternehmen auswertete, zeigt eine weitere Dimension: Werden reine Routineaufgaben wie Schreiben oder Terminplanung herausgerechnet, werden 43,5 Prozent aller fachspezifischen Aktivitäten mittlerweile Berufen zugeordnet, die bislang kaum mit technischer Arbeit verbunden waren. KI-Agenten verschieben Ingenieurtätigkeiten in Berufsfelder weit außerhalb der klassischen Entwicklerrollen.
Ingenieure als Manager digitaler Teams
Für Softwareentwickler verändert diese Entwicklung die Berufsrolle grundlegend. Das Portal ingenieur.de beschreibt den Wandel so: Ingenieure sind zunehmend nicht mehr hauptsächlich diejenigen, die Code schreiben, sondern diejenigen, die Agenten beauftragen, bewerten und korrigieren. "Was bleibt dem Menschen?" fragt ingenieur.de. Die Antwort: Steuerung, Qualitätsprüfung und Verantwortung für das Ergebnis.
Diese Rollenverschiebung birgt ein strukturelles Problem, das der Faros-Bericht sichtbar macht: Die Überwachungsmechanismen haben nicht Schritt gehalten. Wer prüft, ob der Agent den richtigen Code für das richtige Problem geschrieben hat? Wer erkennt, wenn ein Agent einen bestehenden Fehler reproduziert statt ihn zu lösen? Die Bugs pro Entwickler sind laut Bericht um 54 Prozent gestiegen. Das ist die Lücke zwischen Agent-Output und menschlicher Verifikation, ausgedrückt in Zahlen.
Die Konsequenz betrifft nicht nur Entwicklerteams. Software wird von mehr Menschen in kürzerer Zeit produziert und mit weniger Überprüfung in Produktion gebracht. Jede Bankanwendung, jede medizinische Software, jedes Verwaltungsprogramm, das mit KI-Agenten entwickelt wird, enthält potenziell mehr unentdeckte Fehler als zuvor. Ob dieser Mehraufwand in der Qualitätssicherung abgefangen wird, hängt davon ab, wie konsequent das jeweilige Team Oversight organisiert.
Ehe Governance-Tools die Lücke schließen
Gartner schätzt den weltweiten Markt für KI-Agenten in Unternehmen auf 215 Milliarden Euro. Dieses Wachstum beschleunigt sich nicht trotz der dokumentierten Qualitätsprobleme, sondern parallel dazu. Der Markt entwickelt gerade die Antworten auf die Probleme, die er selbst erzeugt: Monitoring-Dashboards für Agent-Output, automatisierte Qualitätssicherung auf PR-Ebene, Governance-Frameworks für Agent-Entscheidungen.
Wann diese Tools breit verfügbar und praxistauglich sind, lässt sich nicht sagen. Bis dahin gilt, was ingenieur.de als Grundsatz formuliert: Ein KI-Agent ist immer nur so gut wie die Person, die seine Ergebnisse bewertet und freigibt. Der Faros-Bericht dokumentiert in Zahlen, was passiert, wenn dieser Grundsatz im Betrieb nicht umgesetzt wird: mehr Code, weniger Qualität, höhere Kosten. Ob brancheninterne Standards oder regulatorische Vorgaben die nächste Reaktion des Markts bestimmen, entscheiden die nächsten Monate.
Kommentare