Eine nüchterne Bestandsaufnahme der Studienlage für Entscheider
Worum es geht
Die Versprechen sind groß: 30, 40, manchmal 70 Prozent Produktivitätsgewinn — so klingt das Marketing der KI-Anbieter, und so klingen viele Beratungsstudien. In deutschen Unternehmen ist KI inzwischen breit angekommen: Laut der aktuellen Bitkom-Erhebung nutzen 41 Prozent der Unternehmen ab 20 Beschäftigten generative KI, weitere 48 Prozent planen oder diskutieren den Einsatz.[1] 77 Prozent der Anwender berichten, dass sich ihre Wettbewerbsposition verbessert habe; 52 Prozent sehen einen messbaren Beitrag zum Unternehmenserfolg.[1]
Doch wer die akademische Studienlage genauer liest, findet ein deutlich differenzierteres Bild als die Pauschalversprechen vermuten lassen. Drei Befunde stechen heraus: KI hilft sehr stark — bei den richtigen Aufgaben. KI hilft Junior-Mitarbeitenden mehr als Senior-Mitarbeitenden. Und: KI verändert nicht nur, was wir tun, sondern auch, wie wir denken.
Wer als Geschäftsleitung ROI-Erwartungen kalibrieren will, kommt um diese Differenzierung nicht herum.
1. Die Versprechen — und was die Studien wirklich zeigen
Die meistzitierte Studie zu KI-Produktivität in der Wissensarbeit ist die Jagged Frontier-Untersuchung von Harvard, MIT, Wharton und BCG aus dem Jahr 2023. 758 Beraterinnen und Berater von Boston Consulting Group bearbeiteten dafür 18 realistische Aufgaben — randomisiert mit oder ohne Zugriff auf GPT-4.[2]
Die Schlagzeilen-Zahlen, die seither durch Präsentationen und Vorstandsetagen wandern: Die KI-Gruppe erledigte 12,2 Prozent mehr Aufgaben, war 25,1 Prozent schneller und produzierte Ergebnisse, die von menschlichen Gutachtern um 40 Prozent höher bewertet wurden.[2]
Das ist die eine Hälfte der Geschichte. Die andere Hälfte taucht in den Anbieter-Decks selten auf: Bei Aufgaben, die außerhalb der KI-Fähigkeiten lagen — die Forschenden nennen sie „outside the frontier“ — schnitten Beraterinnen und Berater mit GPT-4-Zugriff 19 Prozentpunkte schlechter ab als die Kontrollgruppe ohne KI.[2]
„AI assistance improves performance for some tasks but worsens it for others, even within the same knowledge workflow and with a seemingly similar level of difficulty.“[3]
Die Forschenden prägten dafür das Bild der „Jagged Frontier“ — einer zackigen, unvorhersehbaren Grenze zwischen dem, was KI kann, und dem, was sie nicht kann. Das Tückische: Diese Grenze ist von außen nicht sichtbar. Zwei Aufgaben, die für einen Menschen ähnlich schwer wirken, können für eine KI völlig unterschiedliche Schwierigkeitsgrade haben — und Mitarbeitende merken oft erst dann, dass sie sich auf die falsche Seite verlaufen haben, wenn das Ergebnis bereits in der Präsentation steht.
Eine zweite, viel beachtete MIT-Studie von Shakked Noy und Whitney Zhang bestätigt das Muster für Schreibaufgaben: 453 Berufstätige bearbeiteten realistische Texte (E-Mails, Cover Letter, Cost-Benefit-Analysen). Die ChatGPT-Gruppe brauchte 40 Prozent weniger Zeit, die Qualität stieg um 18 Prozent.[4] Die Aufgaben waren allerdings explizit so gewählt, dass sie keine fachliche Tiefenprüfung erforderten — kein Faktencheck, kein Unternehmenskontext, keine Stakeholder-Sensibilität.
Kernbotschaft für die Praxis: Studien, die hohe Produktivitätsgewinne zeigen, messen meist Aufgaben innerhalb der KI-Fähigkeiten. Wer die Kennzahl „+40 % Qualität“ in die eigene Organisation überträgt, sollte sich fragen: Welcher Anteil unserer Arbeit liegt tatsächlich innerhalb dieser Frontier?
2. Wenn KI gar nichts bringt — oder schadet
Die wohl unbequemste Studie der vergangenen Monate stammt von der unabhängigen Forschungsorganisation METR. Sie untersuchte 16 erfahrene Open-Source-Entwickler an realen Aufgaben in ihren eigenen, langjährig gepflegten Codebasen — randomisiert kontrolliert.[5]
Vor dem Versuch erwarteten die Entwickler, dass KI-Tools (Cursor Pro mit Claude 3.5/3.7 Sonnet) sie um durchschnittlich 24 Prozent beschleunigen würden. Nach dem Versuch glaubten sie, sie seien um etwa 20 Prozent schneller gewesen.
„Surprisingly, we find that allowing AI actually increases completion time by 19 % — AI tooling slowed developers down.“[6]
Die tatsächlich gemessene Veränderung: 19 Prozent langsamer mit KI als ohne. Die Entwickler hatten sich um 43 Prozentpunkte verschätzt. Selbst Ökonomen und ML-Experten, die im Vorfeld befragt wurden, sagten Beschleunigungen von 38–39 Prozent voraus.[6]
Was war passiert? Die Forschenden wertete 143 Stunden Bildschirmaufzeichnungen aus. Die Verlangsamung erklärt sich vor allem durch drei Effekte: Die Entwickler verbrachten erhebliche Zeit damit, KI-Vorschläge zu prüfen und zu korrigieren. Sie wechselten häufig zwischen „Selbst denken“ und „KI prompten“, was den Flow-Zustand störte. Und: In großen, komplexen Codebasen (über eine Million Codezeilen) musste der Kontext für die KI mühsam aufbereitet werden.[5]
Die wichtigste Lehre dieser Studie ist nicht „KI macht langsam“. Die wichtigste Lehre ist, wie weit Selbsteinschätzung und tatsächliche Produktivität auseinanderliegen können — und wie unzuverlässig Anekdoten und Umfragen als Steuerungsgrundlage sind. Wenn Mitarbeitende glauben, KI mache sie schneller, heißt das nicht, dass sie es tut.
3. Die Junior/Senior-Asymmetrie
Eine weitere Großstudie liefert ein konsistentes Bild aus einem ganz anderen Feld: Erik Brynjolfsson, Danielle Li und Lindsey Raymond werteten Daten von 5.172 Kundenservice-Mitarbeitenden eines Fortune-500-Unternehmens aus, denen schrittweise ein generativer KI-Assistent zur Seite gestellt wurde.[7]
Der durchschnittliche Produktivitätsgewinn (gemessen in gelösten Tickets pro Stunde): 14 Prozent. Zerlegt nach Erfahrungsgrad sieht das Bild jedoch ganz anders aus:
- Neue und gering qualifizierte Mitarbeitende: +34 Prozent
- Erfahrene Top-Performer: kein nennenswerter Effekt — bei einigen sogar leichte Qualitätsverluste in den Gesprächen[7]
Das Muster ist mittlerweile in mehreren Studien belegt: Auch Noy und Zhang fanden, dass die Produktivitätsverteilung sich komprimiert — die unteren Quartile profitieren überproportional, die oberen kaum.[4] Auch in der Jagged-Frontier-Studie holten die schwächsten 50 Prozent am stärksten auf.[2]
Die Erklärung der Forschenden: KI-Assistenten externalisieren das implizite Wissen erfahrener Mitarbeiter und stellen es Anfängern zur Verfügung. Die KI fungiert als Skill-Leveler.
Für die strategische Personalplanung hat das mindestens drei Implikationen:
Erstens verschiebt sich der ökonomische Wert einzelner Rollen. Wenn ein Junior mit KI 80 Prozent der Leistung eines Seniors erbringt, sinkt die Skill-Prämie für Seniorität — mit Folgen für Gehaltsstrukturen und Karrierepfade.
Zweitens verändert sich die Lernkurve im Unternehmen. Anfänger bekommen schneller „gute Ergebnisse“ — aber häufig, ohne den Weg dahin verstanden zu haben. Forschende der Aalto University warnen explizit davor, dass Junior-Beschäftigte „weniger Chancen haben, sich in den Arbeitskontext einzuarbeiten und weniger Herausforderungen zu lösen, wenn sie hauptsächlich KI-Outputs evaluieren — also weniger Möglichkeiten, on the job zu lernen und erfahren zu werden“.[8]
Drittens entsteht ein längerfristiges Risiko: Wenn die heutigen Junioren morgen die Senioren sind — woher kommt dann das implizite Wissen, das die KI heute repliziert?
4. Cognitive Offloading — der unterschätzte Preis
Eine der relevantesten neueren Untersuchungen zu KI im Büroalltag ist nicht ökonomisch, sondern kognitionspsychologisch ausgerichtet. Hank Lee (Carnegie Mellon) und Forschende von Microsoft Research befragten 319 Wissensarbeitende und werteten 936 reale KI-Nutzungsfälle aus.[9]
Der Befund:
„Higher confidence in GenAI is associated with less critical thinking, while higher self-confidence is associated with more critical thinking.“[9]
Übersetzt: Je mehr Vertrauen Mitarbeitende in die KI haben, desto weniger denken sie kritisch über deren Output nach. Je mehr Vertrauen sie in sich selbst haben, desto eher hinterfragen sie KI-Vorschläge — wobei dieses Hinterfragen kognitiv anstrengender ist als die Übernahme.
Die Studie identifiziert eine grundlegende Verschiebung in der Natur kritischen Denkens bei der KI-Nutzung. Statt selbst Inhalte zu erarbeiten, verlagern sich kognitive Aktivitäten auf drei Felder: Verifikation von Informationen, Integration von KI-Antworten in den eigenen Kontext und „Task Stewardship“ (Aufgabensteuerung).[9] Das ist nicht per se schlechter — aber es ist anders. Und es funktioniert nur, wenn die Mitarbeitenden überhaupt die Fachkompetenz haben, um Fehler im KI-Output zu erkennen.
Mehrere Folgestudien — etwa eine Untersuchung der Oregon State University — bestätigen, dass sich bei routinemäßiger KI-Nutzung das Reflexionsverhalten und das Bedürfnis nach tieferem Verständnis messbar reduzieren, besonders bei jüngeren Anwendern.[10] Die Communications of the ACM fasst die wachsende Forschungsliteratur zusammen: KI-Deskilling kann Grundwissen erodieren, soziale Interaktionsfähigkeiten reduzieren und die Fähigkeit verringern, kritische Probleme zu analysieren und zu diagnostizieren.[11]
Für die Praxis heißt das: Der Produktivitätsgewinn von heute kann mit einem Kompetenzverlust bezahlt werden, der erst sichtbar wird, wenn die KI versagt — oder wenn das Unternehmen plötzlich Mitarbeitende braucht, die etwas anderes können als KI-Outputs zu redigieren.
5. Vier Faktoren, die über den ROI entscheiden
Aus der Studienlage lassen sich vier Faktoren destillieren, die in der Praxis darüber entscheiden, ob KI tatsächlich Produktivität bringt — oder nur deren Illusion:
- Aufgabenpassung (Task-AI-Fit). Je näher eine Aufgabe an strukturierten, sprachlastigen, gut definierten Outputs liegt (Entwürfe, Zusammenfassungen, Übersetzungen, Erstrecherchen), desto höher der Gewinn. Je mehr eine Aufgabe Domänen-Tiefenwissen, präzise Faktenkontrolle oder seltene Edge-Cases erfordert, desto höher das Risiko, dass KI eher schadet. Die Bitkom-Studie zeigt, dass die meisten Unternehmen in Deutschland KI bislang nur für ein bis drei Anwendungsfälle nutzen — eine fokussierte Auswahl ist also bereits gelebte Praxis.[1]
- Erfahrungsniveau der Anwendenden. Bei Routineaufgaben profitieren Junior-Mitarbeitende stark, Senior-Mitarbeitende kaum. Bei komplexen, nicht-routinierten Aufgaben ist die Kombination aus erfahrener Fachkraft und KI klar überlegen — vorausgesetzt, die Fachkraft erkennt KI-Fehler.
- Betrieblicher vs. eigeninitiativer Einsatz. Eine aktuelle Studie des ifo Instituts mit knapp 9.800 deutschen Beschäftigten kommt zu einem klaren Befund: Nur etwa jeder fünfte Beschäftigte nutzt KI regelmäßig im Job. Wo KI eigeninitiativ eingesetzt wird, bleiben Effekte gering. Wo sie betrieblich eingeführt wird — mit Schulungen, definierten Prozessen, klaren Anwendungsfällen —, sind sowohl die Nutzungshäufigkeit als auch die Produktivitätsgewinne signifikant höher.[12] Schatten-KI ohne Governance ist also nicht nur ein Compliance-, sondern auch ein Produktivitätsproblem.
- Mess- statt Glaubenssache. Die METR-Studie hat gezeigt, wie unzuverlässig Selbsteinschätzungen sind. Wer Produktivitätsgewinne tatsächlich verifizieren will, kommt um harte Vergleichsmessungen nicht herum: definierte Aufgaben, A/B-Vergleiche, durchgängige Zeit- und Qualitätsmetriken. Das ist aufwendig — aber die Alternative besteht darin, sich selbst etwas zu erzählen.
6. Realistische Erwartungen — was wir der Geschäftsleitung empfehlen
Die referierten Studien beschreiben Effekte und Muster. Die folgenden Empfehlungen sind unsere redaktionelle Einordnung — Schlussfolgerungen, die aus der Studienlage naheliegen, aber nicht wörtlich in ihr stehen. Wo einzelne Empfehlungen an konkrete Studien- oder Verbandsempfehlungen anschließen, ist das ausgewiesen.
Keine pauschalen 30 Prozent erwarten. Die Bitkom-Daten zeigen für Deutschland branchenweite Produktivitätsgewinne durch generative KI von im Schnitt etwa 13 Prozent jährlich bei den Anwendern.[13] Das ist substanziell, aber weit entfernt von Anbieter-Versprechen. Auf gesamtwirtschaftlicher Ebene erwartet das IW Köln durch KI Produktivitätszuwächse, die das Wachstum auf das historisch ebenfalls schwache Niveau der 2000er Jahre heben – eine Verbesserung gegenüber den 2020ern, aber kein Boom.[13]
Die „Frontier“ für das eigene Unternehmen identifizieren – und Prozesse mitdenken. Statt KI flächendeckend „auszurollen“, lohnt es sich, gezielt zwei bis drei Aufgabentypen zu identifizieren, in denen KI nachweislich gut funktioniert – und mit diesen anzufangen. Routineaufgaben in Kundenservice, Marketing-Drafting, Erstrecherche und Übersetzung gehören regelmäßig dazu.
In Mitarbeiterkompetenz investieren, nicht nur in Tools. Die Jagged-Frontier-Studie hat ein klares Nebenergebnis geliefert: Die Gruppe mit zusätzlichem Prompt-Engineering-Training schnitt deutlich besser ab als die Gruppe mit reinem Tool-Zugang.[2] KI-Kompetenz ist kein Selbstläufer.
Die Lernkurve schützen. Wenn Junior-Mitarbeitende von Anfang an überwiegend KI-Outputs redigieren, statt selbst zu erarbeiten, geht implizites Wissen verloren — mit Folgen, die sich erst nach Jahren zeigen. Strukturierte Phasen ohne KI, klare Lernpfade und gezielte Mentor-Programme sind kein Ballast, sondern Investition in die zukünftige Senior-Generation.
Fazit
KI im Büroalltag ist weder Wundermittel noch Mythos. Sie ist ein Werkzeug mit deutlich erkennbarem Produktivitätsbeitrag — bei klar abgegrenzten Aufgaben, mit der richtigen Anwendergruppe, in einem durchdachten organisatorischen Rahmen. Außerhalb dieses Rahmens kann sie genauso gut Zeit kosten, Qualität senken und implizite Kompetenzen erodieren.
Was Geschäftsleitungen heute brauchen, ist nicht mehr Begeisterung — die ist in Vorständen und Belegschaften reichlich vorhanden — sondern eine nüchterne Erwartungskalibrierung. Die Studienlage gibt dafür mittlerweile genügend Anhaltspunkte. Die Frage lautet nicht: Lohnt sich KI? Sondern: Für welche unserer Aufgaben, mit welchen Mitarbeitenden, unter welchen Bedingungen — und wie messen wir das ehrlich?
Quellen
[1] Bitkom e. V. (2026): Digitalisierung der Wirtschaft: Fast jedes Unternehmen beschäftigt sich mit KI. Pressemitteilung, 11. März 2026. https://www.bitkom.org/Presse/Presseinformation/Digitalisierung-der-Wirtschaft-Unternehmen-beschaeftigen-sich-mit-KI
[2] Dell’Acqua, F., McFowland III, E., Mollick, E. R., Lifshitz-Assaf, H., Kellogg, K., Rajendran, S., Krayer, L., Candelon, F., Lakhani, K. R. (2023): Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Harvard Business School Working Paper No. 24-013, 18. September 2023. https://www.hbs.edu/faculty/Pages/item.aspx?num=64700
[3] Ebd., Abstract.
[4] Noy, S., Zhang, W. (2023): Experimental evidence on the productivity effects of generative artificial intelligence. Science, Vol. 381, Issue 6654, 14. Juli 2023. https://www.science.org/doi/10.1126/science.adh2586
[5] METR (2025): Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. Forschungsbericht, 10. Juli 2025. https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
[6] Becker, J., Rush, N., Barnes, E., Rein, D. (2025): Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv:2507.09089. https://arxiv.org/abs/2507.09089
[7] Brynjolfsson, E., Li, D., Raymond, L. R. (2025): Generative AI at Work. Quarterly Journal of Economics, Vol. 140, Issue 2, S. 889–942. https://academic.oup.com/qje/article/140/2/889/7990658
[8] Aalto University (2025): Researchers warn that skill erosion caused by AI could have a devastating and lasting impact on businesses. Pressemitteilung, 29. September 2025. https://www.aalto.fi/en/news/researchers-warn-that-skill-erosion-caused-by-ai-could-have-a-devastating-and-lasting-impact-on
[9] Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., Wilson, N. (2025): The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems 2025, April 2025. https://www.microsoft.com/en-us/research/publication/the-impact-of-generative-ai-on-critical-thinking-self-reported-reductions-in-cognitive-effort-and-confidence-effects-from-a-survey-of-knowledge-workers/
[10] Choudhuri, R., Sanchez, C. A., Burnett, M., Sarma, A. (2025): Why Johnny Can’t Think: GenAI’s Impacts on Cognitive Engagement. arXiv-Preprint. https://arxiv.org/abs/2601.22430
[11] Communications of the ACM (2025): The AI Deskilling Paradox. News, 10. November 2025. https://cacm.acm.org/news/the-ai-deskilling-paradox/
[12] ifo Institut (2026): Nur jeder fünfte Beschäftigte nutzt KI regelmäßig. Pressemitteilung zur DiWaBe 2.0-Studie, 5. Januar 2026. https://www.ifo.de/pressemitteilung/2026-01-05/nur-jeder-fuenfte-beschaeftigte-nutzt-ki-regelmaessig
[13] Institut der deutschen Wirtschaft Köln (2025): Wie wird KI die Produktivität in Deutschland verändern? Gutachten 2025. https://www.iwkoeln.de/fileadmin/user_upload/Studien/Gutachten/PDF/2025/Gutachten_2025-Produktivit%C3%A4t-KI-barrierefrei.pdf
Hinweis zum Einsatz von KI
Bei ZaKI.D setzen wir künstliche Intelligenz als Werkzeug ein – vorwiegend bei der Recherche und beim Verfassen unserer Artikel. KI hilft uns, Quellen zu erschließen, Inhalte zu strukturieren und Texte zu formulieren. Die redaktionelle Verantwortung liegt dabei immer bei Menschen: Wir prüfen Fakten, verifizieren Quellen und überarbeiten jeden Beitrag, bevor er erscheint. Einzelne Bilder und Grafiken können ebenfalls KI-generiert sein.
