Leitfaden: Vom Prototyp zur Produktion

Was Studien über die Qualität KI-generierten Codes zeigen

Über Vibe Coding und KI-Assistenten kursieren viele Zahlen, belastbare und weniger belastbare. Dieser Beitrag geht die meistzitierten Untersuchungen durch: was sie gemessen haben, was sie zeigen und was sie ausdrücklich nicht zeigen. Am Ende stehen Zahlen, die im Umlauf sind, einer Prüfung aber nicht standhalten.

Ein Raster kleiner weißer Testwürfel auf hellem Papier, einige mit Fehlern, einer liegt auf einer Prüfplatte aus Stahl, darüber eine orange Kurve mit MesspunktenKI-GENERIERT
AKTUALISIERT
12. September 2026
LESEZEIT
10 Min.

Kurz beantwortet

Die Studien zeichnen ein stimmiges Bild: Sprachmodelle schreiben funktionierenden Code, erzeugen dabei aber oft unsichere Varianten (Veracode 2025). Code wird häufiger kopiert als umgebaut (GitClear 2025). KI-Nutzung geht mit mehr Durchsatz, aber weniger stabiler Auslieferung einher (DORA 2025). Und gefühltes Tempo ist kein gemessenes Tempo (METR 2025).

01

Wie lesen Sie eine Studie über KI-Code?

Mit drei Fragen: Was genau wurde gemessen, Laboraufgaben, Code in Repositories, Umfrageantworten oder Arbeitszeit im Experiment? Wer hat die Studie herausgegeben, und verkauft der Herausgeber etwas, das zum Ergebnis passt? Und erlaubt das Design eine Aussage über Ursachen oder nur über Zusammenhänge? Ohne diese Einordnung ist jede Prozentzahl nur halb verstanden.

Die vier Untersuchungen dieses Beitrags messen sehr Verschiedenes und lassen sich nicht gegeneinander aufrechnen. Sie ergänzen sich aber: Eine prüft Code-Proben auf Sicherheitslücken, eine analysiert Änderungsmuster in Hunderten Millionen Codezeilen, eine befragt Tausende Fachleute, eine misst Arbeitszeit im Experiment. Wie sich die Befunde auf den Weg vom Prototyp zur Produktion übertragen, ordnet der Leitfaden Vom Prototyp zur produktionsreifen Anwendung ein.

Vier Studien, vier Messansätze

KriteriumVeracode 2025GitClear 2025DORA 2025METR 2025
MethodeProgrammieraufgaben, generierter Code wird auf Schwachstellen getestetAnalyse geänderter Codezeilen in RepositoriesBefragung von Fachleutenrandomisiertes Experiment mit realen Aufgaben
Datenbasisüber 100 Sprachmodelle, vier Sprachen211 Millionen geänderte Zeilen, 2020 bis 2024knapp 5.000 Befragte16 Entwickler, 246 Aufgaben
HerausgeberAnbieter von SicherheitsprüfungenAnbieter von EntwicklungsanalysenForschungsprogramm bei Google CloudForschungsorganisation
Aussageartwas Modelle bei definierten Aufgaben erzeugenZusammenhang, keine UrsacheZusammenhang, SelbstauskunftUrsache, in engem Setting

02

Wie sicher ist Code, den Sprachmodelle schreiben?

Laut Veracode 2025 fielen 45 Prozent der generierten Code-Proben durch die Sicherheitstests und enthielten eine Schwachstelle aus den OWASP Top 10. Größere und neuere Modelle schnitten nicht besser ab. Die Fortschreibung vom Frühjahr 2026 zeigt dasselbe Bild: Syntaktisch korrekt ist fast alles, sicher nur gut die Hälfte.

45 %Code-Proben mit Schwachstelle aus den OWASP Top 10Veracode, 2025
72 %Fehlerquote bei Java, der riskantesten SpracheVeracode, 2025
86 %Proben ohne Schutz gegen Cross-Site-ScriptingVeracode, 2025
55 %sichere Lösungen im Frühjahr 2026, über 150 ModelleVeracode, 2026

Getestet wurden Aufgaben in Java, Python, C# und JavaScript, die sich sicher oder unsicher lösen lassen. In der Fortschreibung vom März 2026 beschreibt Veracode den Testsatz als 80 Aufgaben zu vier Schwachstellenklassen. Das Ergebnis dort: über 95 Prozent syntaktisch korrekt, rund 55 Prozent sicher. Gegen SQL-Injection schützten die Modelle in 82 Prozent der Fälle, gegen Cross-Site-Scripting nur in 15 und gegen Log-Injection in 13 Prozent. Java lag bei 29 Prozent sicherer Lösungen (Veracode, 2026).

Grenzen: Getestet werden einzelne Aufgaben zu wenigen Schwachstellenklassen, keine vollständigen Anwendungen und kein Code, der danach ein Review durchlaufen hat. Veracode verkauft Werkzeuge für Sicherheitsprüfungen, das Ergebnis passt zum Geschäftsmodell. Die Kernaussage bleibt trotzdem belastbar: Wer generierten Code ungeprüft übernimmt, übernimmt ein messbares Risiko. Wie derselbe Mechanismus in konkreten Werkzeugen aussieht, zeigt Mit Lovable, Bolt oder Replit gebaut.

03

Wird Code mit KI-Assistenten schwerer wartbar?

GitClear sieht in 211 Millionen geänderten Codezeilen einen klaren Trend: Seit KI-Assistenten verbreitet sind, wird mehr Code kopiert und weniger umgebaut. 2024 überstieg kopierter Code erstmals verschobenen, also umstrukturierten Code, und die Auswertung von 2026 setzt den Trend fort. Das ist ein Zusammenhang im gesamten Datensatz, kein Nachweis einer Ursache.

211 Mio.geänderte Codezeilen aus den Jahren 2020 bis 2024GitClear, 2025
12,3 %als kopiert eingestufte Zeilen 2024, nach 8,3 Prozent 2021GitClear, 2025
unter 10 %Anteil umgebauter Zeilen 2024, nach 25 Prozent 2021GitClear, 2025
73,0duplizierte Blöcke je Million geänderter Zeilen 2026, nach 40,3 im Jahr 2023GitClear, 2026

Warum das zählt: Kopierter Code muss bei jeder Änderung an mehreren Stellen gepflegt werden, umgebauter Code bündelt Logik an einer Stelle. Ein sinkender Anteil an Umbauten deutet darauf hin, dass neuer Code eher neben bestehenden gestellt als in ihn eingearbeitet wird. Die Auswertung von 2026 umfasst 623 Millionen Änderungen aus den Jahren 2023 bis 2026 und zeigt dieselbe Richtung (GitClear, 2026).

Grenzen: GitClear misst alle Änderungen im Datensatz, nicht gekennzeichneten KI-Code, und leitet Umbauten aus verschobenen Zeilen ab, einer Näherung. Der Herausgeber verkauft Analysen zur Entwicklungsproduktivität. Was solche Muster auf Dauer für eine einzelne Anwendung bedeuten, beschreibt Technische Schulden in KI-generiertem Code erkennen.

04

Macht KI Teams schneller oder stabiler?

Beides zugleich zeigt DORA 2025 bisher nicht. Der Bericht findet erstmals einen positiven Zusammenhang zwischen KI-Nutzung und dem Durchsatz der Softwareauslieferung, aber weiterhin einen negativen mit ihrer Stabilität. Die Kernthese lautet: KI repariert kein Team, sie verstärkt, was bereits da ist, starke Praktiken ebenso wie schwache.

Der Bericht „State of AI-assisted Software Development 2025“ beruht auf einer Befragung von knapp 5.000 Fachleuten weltweit und über 100 Stunden qualitativer Daten. 90 Prozent der Befragten nutzen KI bei der Arbeit, mehr als 80 Prozent sehen ihre Produktivität gestiegen, 30 Prozent vertrauen KI-generiertem Code wenig oder gar nicht (DORA, 2025). Die Entwicklerumfrage von Stack Overflow passt dazu: 66 Prozent nennen als größte Frustration KI-Lösungen, die fast richtig sind, aber eben nicht ganz (Stack Overflow, 2025).

Für Produktivsysteme ist die Stabilitätsaussage die wichtigere. Mehr Tempo ohne Absicherung verlagert Fehler in die Zeit nach der Auslieferung. DORA beschreibt deshalb Fähigkeiten, die den Nutzen von KI verstärken, darunter klare Regeln zur KI-Nutzung und hochwertige interne Plattformen. Grenzen: Es handelt sich um Selbstauskünfte und Zusammenhänge, nicht um gemessene Ursachen.

05

Sind erfahrene Entwickler mit KI wirklich langsamer?

In der METR-Studie von 2025 brauchten 16 erfahrene Open-Source-Entwickler mit KI-Werkzeugen 19 Prozent länger für ihre Aufgaben, hielten sich danach aber für 20 Prozent schneller. Belastbar ist vor allem der zweite Teil: Selbsteinschätzung ist ein schlechtes Maß. METR hat das Studiendesign 2026 wegen Selektionseffekten überarbeitet und die Aussagekraft neu eingeordnet.

Die Studie war ein randomisiertes Experiment: 246 reale Aufgaben in großen, den Teilnehmenden vertrauten Repositories mit im Mittel über einer Million Codezeilen, Aufgaben von durchschnittlich rund zwei Stunden, überwiegend mit Cursor Pro und Claude 3.5 und 3.7 Sonnet. Vorab erwarteten die Entwickler 24 Prozent Zeitgewinn. Gemessen wurden 19 Prozent mehr Zeit, mit einem Konfidenzintervall von plus 2 bis plus 39 Prozent (METR, 2025). METR betont selbst, dass die Studie nicht zeigt, dass KI den meisten Entwicklern nicht hilft.

Im Februar 2026 berichtete METR über Folgedurchgänge Ende 2025 und über ein Problem: Entwickler lehnten zunehmend ab, Aufgaben ohne KI zu bearbeiten, und ließen Aufgaben weg, bei denen sie viel von KI erwarteten. Die neuen Schätzungen deuten eher auf einen Zeitgewinn hin, mit Konfidenzintervallen, die auch keinen Effekt einschließen. METR nennt die eigenen Daten wegen dieser Selektionseffekte nur sehr schwache Evidenz und stellt das Design um (METR, 2026).

Veröffentlichungen im Überblick
  1. METR-Studie

    Experiment mit 16 erfahrenen Entwicklern und 246 Aufgaben.

  2. Veracode-Bericht

    2025 GenAI Code Security Report mit über 100 Modellen.

  3. DORA-Bericht

    State of AI-assisted Software Development 2025.

  4. METR überarbeitet das Design

    Selektionseffekte, Daten nur sehr schwache Evidenz.

  5. Veracode-Fortschreibung

    Über 150 Modelle, Sicherheitsquote weiter bei rund 55 Prozent.

  6. Heute

06

Welche Zahlen kursieren, halten aber nicht?

Einige Zahlen tauchen in Beiträgen zu KI-Code und KI-Projekten wiederholt auf, ohne zu tragen. Meist ist die Zahl nicht erfunden, sondern aus ihrem Zusammenhang gelöst: Eine Prognose wird zur Messung, eine US-Studie zu Enterprise-Piloten zur Aussage über den Mittelstand, ein Anbieter-Scan zur neutralen Erhebung. Tippen Sie auf eine Karte für die Einordnung.

Diese Zahlen kursieren, halten aber nicht

07

Was folgt aus den Studien für Ihr Projekt?

Keine der Studien spricht gegen KI-Werkzeuge. Sie sprechen gegen ungeprüfte Übernahme. Sicherheitsprüfung, Review und automatisierte Tests sind die Stellen, an denen die gemessenen Schwächen abgefangen werden. Und wer eine Zahl weitergibt, sollte sie vorher an der Quelle prüfen, die Prüfliste unten hilft dabei.

Checkliste

So prüfen Sie eine Zahl, bevor Sie sie weitergeben

0 von7

Wie sich die Befunde in konkreten Regeln niederschlagen, etwa welche KI-Werkzeuge ein Entwicklungsteam mit welchen Prüfpflichten nutzt, beschreibt KI-Werkzeuge im Entwicklungsteam freigeben. Eine kürzere Einordnung, wo Vibe Coding hilft und wo nicht, bietet der Beitrag Vibe Coding: wo es hilft, wo es beißt.

Häufige Fragen

Ist KI-generierter Code unsicherer als von Menschen geschriebener?

Die hier vorgestellten Studien vergleichen das nicht direkt. Veracode misst, wie oft Modelle bei Aufgaben mit sicherer und unsicherer Lösung die unsichere erzeugen, nicht wie oft Menschen das tun. Auch handgeschriebener Code enthält Schwachstellen. Belastbar ist die Aussage, dass generierter Code ohne Prüfung ein messbares Sicherheitsrisiko trägt und dass größere Modelle das bisher nicht beheben.

Warum werden neuere Modelle nicht sicherer?

Veracode beschreibt das Muster, nicht dessen abschließende Ursache: Die syntaktische Korrektheit liegt inzwischen über 95 Prozent, die Sicherheitsquote blieb bei rund 55 Prozent. Auffällig ist, dass bekannte Muster wie SQL-Injection meist abgewehrt werden, kontextabhängige wie Cross-Site-Scripting und Log-Injection kaum. Für die Praxis heißt das: Sicherheitsanforderungen gehören ausdrücklich in Aufgabe, Review und Tests.

Beweist die METR-Studie, dass KI Entwickler langsamer macht?

Nein. Sie zeigt für 16 sehr erfahrene Entwickler in ihren eigenen großen Repositories mit Werkzeugen von Anfang 2025 eine Verlangsamung, und METR schränkt die Übertragbarkeit selbst ein. Die spätere Überarbeitung stuft die Daten als sehr schwache Evidenz ein. Stabil ist ein anderer Befund: Die Selbsteinschätzung der Teilnehmenden lag deutlich neben der gemessenen Zeit.

Was bedeuten die Studien für Vibe Coding?

Für Prototypen wenig: Dort zählt, ob eine Idee trägt, und kurzlebiger Code muss nicht wartbar sein. Sobald eine Anwendung in Produktion geht, greifen die Befunde zugleich: Sicherheitslücken in generiertem Code, Kopien statt Umbauten, instabilere Auslieferung und eine Selbsteinschätzung, die das Risiko unterschätzt. Deshalb braucht der Übergang eine bewusste Prüfung.

Welche Studie ist für mittelständische Unternehmen am aussagekräftigsten?

Das hängt von der Frage ab. Für die Sicherheit einzelner Anwendungen ist Veracode am direktesten, für die Frage, ob ein Team mit KI besser liefert, DORA. GitClear beschreibt Trends der Wartbarkeit, METR die Grenzen der Selbsteinschätzung. Keine der Studien bildet speziell den deutschen Mittelstand ab; übertragbar sind vor allem die Mechanismen, weniger die einzelnen Prozentwerte.

Weiterlesen

Quellen

  1. 01 Insights from 2025 GenAI Code Security Report Veracode, 2025 · veracode.com
  2. 02 2025 GenAI Code Security Report Veracode, 2025 · veracode.com
  3. 03 Spring 2026 GenAI Code Security Update Veracode, 2026 · veracode.com
  4. 04 AI Copilot Code Quality: 2025 Research GitClear, 2025 · gitclear.com
  5. 05 The Maintainability Gap: 2026 AI Code Quality Research GitClear, 2026 · gitclear.com
  6. 06 Announcing the 2025 DORA Report Google Cloud, 2025 · cloud.google.com
  7. 07 State of AI-assisted Software Development 2025 DORA, 2025 · dora.dev
  8. 08 Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity METR, 2025 · metr.org
  9. 09 Update zum Studiendesign (Februar 2026) METR, 2026 · metr.org
  10. 10 2025 Developer Survey: AI Stack Overflow, 2025 · survey.stackoverflow.co
  11. 11 Technology & Security Predictions 2025 (Pressemitteilung) Forrester Research, 2024 · prnewswire.com

Über Ihr Vorhaben sprechen

Ob Prototyp, internes Werkzeug oder KI-Anwendung: Beschreiben Sie kurz, was Sie bauen oder in den Betrieb bringen wollen.

Arthur C. Clarke

“Jede hinreichend fortgeschrittene Technologie ist von Magie nicht zu unterscheiden.”