Was ist ein KI-Reifegradmodell?
Ein KI-Reifegradmodell beantwortet die Frage „Wo stehen wir bei KI?“ mit einem Befund statt mit Bauchgefühl. Es zerlegt die KI-Einführung in Dimensionen, beschreibt für jede Dimension beobachtbare Stufen und zeigt damit, wo ein Unternehmen steht und was der nächste Schritt ist.
Road.MAP for AI ist das Reifegradmodell, das ich bei Storm Reply gemeinsam mit Kolleginnen und Kollegen entwickelt habe. Grundlage war eine detaillierte Analyse von sechs bestehenden Reifegradmodellen. Drei Befunde haben uns überrascht: Keine der sechs Quellen kennt eine Kostendimension, keine kennt eine agentische Zielstufe, und keine trennt Organisationsreife von Prozesseignung.
KI verstärkt, was da ist. Wer in fünf Dimensionen auf Stufe 4 steht und in einer auf Stufe 1, bekommt kein Mittelmaß – er bekommt das Problem der Stufe 1 in fünffacher Geschwindigkeit.
Das ist die Leseregel, um die sich das ganze Modell dreht.
Die fünf Stufen der KI-Reife
- Experimentieren – private Accounts, Copy-Paste, keine Liste, was überhaupt läuft.
- Pilot – Richtlinie, Budget und Use-Case-Liste existieren, erzwungen wird nichts davon.
- Kontrollierter Rollout – Gateway, SSO, Limits: Die Regeln greifen im System statt im Dokument.
- Skalierter Regelbetrieb – gemessen und verrechnet, Audit als Tagesgeschäft.
- Agentische Organisation – Agenten übernehmen Abläufe, Menschen führen über Ziele und Leitplanken.
Die härteste Grenze liegt zwischen Stufe 2 und Stufe 3, zwischen „beschlossen“ und „erzwungen“. Alles ist beschlossen, nichts ist erzwungen: Das ist Stufe 2 in einem Satz. Die Stufen gelten je Dimension. Ein Unternehmen steht nicht auf einer Stufe, sondern auf acht, und selten auf derselben. Stufe 5 ist auch nicht überall das Ziel; das Zielbild hängt vom Geschäft ab.
Die acht Dimensionen
Jede Dimension hat eine Leitfrage und für jede Stufe einen Kurzanker, an dem sich die eigene Stufe erkennen lässt:
| Dimension | Stufe 1 Experimentieren | Stufe 2 Pilot | Stufe 3 Kontrollierter Rollout | Stufe 4 Skalierter Regelbetrieb | Stufe 5 Agentische Organisation |
|---|---|---|---|---|---|
| Governance & RechtWer darf was, mit welchem Modell, unter welcher Regel? | Keine verbindliche Regel vorhanden. | Nutzungsrichtlinie ist verabschiedet und kommuniziert. | Nur freigegebene Modelle sind technisch erreichbar. | Jeder produktive Anwendungsfall ist eingestuft und auditierbar. | Regeln sind als Code hinterlegt, Nachweise entstehen automatisch. |
| Kosten & SteuerungWas kostet KI, wer verantwortet es, wie wird es begrenzt? | Kosten sind unbekannt. | Budget ist gesetzt, aber nicht gesteuert. | Kosten je Use Case sind sichtbar, Limits greifen technisch. | Kosten sind je Use Case und Nutzer verrechnet. | Kosten-Nutzen-Steuerung läuft automatisch zur Laufzeit. |
| Infrastruktur & RechteWie läuft KI technisch, sicher und unternehmensweit? | Nutzung nur über SaaS-Oberflächen, keine Integration. | Erste Anbindung, Key-Modell ungeklärt. | Zentrale Plattform mit SSO und serverseitiger Authentifizierung. | Der Agent handelt im Auftrag des Nutzers und erbt dessen Rechte. | Agent-to-Agent mit durchgängiger Rechtekette. |
| Sicherheit & RisikoWas passiert, wenn es schiefgeht – und merkt es jemand? | Kein Risikoblick. Eingaben landen ungeprüft bei Dritten. | Risiken sind benannt, Maßnahmen fehlen. | Schutz gegen Prompt-Injection und Datenabfluss greift technisch. | Agentenläufe protokolliert, Incident-Prozess erprobt. | Red Teaming und Angriffserkennung laufen im Betrieb. |
| Wissen & DatenWorauf greift die KI zu – und in welcher Qualität? | Kontext kommt per Copy-Paste. | RAG auf einer einzelnen Quelle. | Mehrere Quellen über Konnektoren, rechtekonform. | Unternehmensweiter Knowledge Hub, Qualität wird gemessen. | Wissen steht als Dienst für Menschen und Agenten bereit. |
| Organisation & BefähigungWer kann damit umgehen – und wer verantwortet den Betrieb? | Nur einzelne Enthusiasten, niemand ist zuständig. | Freiwillige Sessions, Verantwortung ungeklärt. | Lernpfade je Rolle, Ownership je Use Case benannt. | Verbindliches Curriculum, Betriebsmodell steht. | Lernen und Ownership tragen sich im Arbeitsfluss selbst. |
| Kultur & ChangeNehmen die Menschen KI an – und wer räumt die Widerstände aus? | Stimmung unbekannt, Sorgen kursieren ungesteuert. | Sorgen sind bekannt, Begleitung ist punktuell. | Change-Begleitung je Rollout, Führung nutzt KI sichtbar. | Stehendes Change-Programm, Adoption wird gemessen und gesteuert. | Veränderung trägt sich selbst, Belegschaft fordert KI ein. |
| Anwendungsfälle & WertbeitragWoran arbeitet KI – und woher weiß jemand, dass es sich lohnt? | Einzelexperimente, Nutzen wird behauptet. | Use-Case-Liste ohne Wertkriterium. | Priorisierung nach Wert und Machbarkeit, Zielgrößen je Fall. | Nutzen je Use Case gemessen, Portfolio wird gesteuert. | Fälle entstehen aus Prozessdaten, Nutzen wird laufend nachgeführt. |
Organisation & Befähigung und Kultur & Change waren anfangs ein Thema. Wir haben sie getrennt, weil sie zwei verschiedene Fragen beantworten: ob Menschen mit KI umgehen können und ob sie es wollen. Ein Team kann perfekt geschult sein und das Werkzeug trotzdem umgehen.
Warum ein Profil statt einer Gesamtnote?
Ein Beispiel aus dem Selbstcheck: 3,4 von 5 klingt nach einem soliden KI-Reifegrad. Im Profil dahinter laufen vier von acht Dimensionen im skalierten Regelbetrieb, aber Governance & Recht hängt auf Stufe 2. Die Richtlinie ist verabschiedet, lebt aber in einem Dokument, nicht in der Technik. Jeder neue Use Case wartet an derselben Bremse.
Der Durchschnitt glättet genau die Unwucht weg, um die es geht. Das Zackenprofil zeigt sie, und der Engpass sagt, womit man anfängt. Deshalb wird im Modell eine Dimension auch nach unten gedeckelt: Sie kann nicht auf Stufe 4 stehen, wenn eine ihrer Kernfragen auf Stufe 2 steht.
Wie wird eingestuft?
- Selbstcheck: 16 Fragen, rund fünf Minuten – für die erste Orientierung.
- Assessment: 128 Fragen, rollenbasiert. Jede Rolle beantwortet nur, was sie fachlich beurteilen kann.
- Verhaltensverankerte Antworten: Jede Kernfrage hat fünf beobachtbare Zustandsbeschreibungen statt einer Zahlenskala. Die gewählte Option ist die Stufe.
- Evidenzpflicht: Ab Stufe 3 gilt eine Bewertung nur, wenn ein benennbares Artefakt existiert – Richtlinie, Dashboard, Protokoll, Rollenbeschreibung. Ohne Nachweis wird auf Stufe 2 gedeckelt. Gespräche sind kein Nachweis.
- Mehrere Stimmen: Weichen Antworten derselben Frage um zwei oder mehr Stufen voneinander ab, ist das ein eigener Befund: eine Wahrnehmungslücke.
Worauf das Modell methodisch steht
Das Modell ist keine freie Erfindung. Die zentralen Bauentscheidungen stützen sich auf etablierte Rahmenwerke:
- Dimensionen entlang des Technology–Organization–Environment-Rahmens1.
- Stufenlogik nach CMMI2 und ISO/IEC 155043 (SPICE, heute ISO/IEC 330xx): Eine Stufe gilt erst, wenn ihre Merkmale erfüllt sind.
- Antwortskalen als Behaviourally Anchored Rating Scales4.
- Akzeptanz und Kultur über UTAUT/TAM (Venkatesh et al., 20035; Davis, 19896) und psychologische Sicherheit7.
- Governance und Sicherheit geschnitten gegen EU AI Act8, ISO/IEC 420019 und NIST AI RMF10 – damit sollen die Stufen 3 bis 5 auditanschlussfähig sein.
Die Grenzen gehören dazu: Die Fragebatterien sind an validierte Skalen angelehnt, in dieser Zusammenstellung aber nicht selbst validiert. Und Stufe 5 ist in der Praxis kaum belegbar, weil es zu wenige Organisationen gibt, die dort stehen. Ihre Anker sind konstruiert, nicht beobachtet.
Und die Softwareentwicklung?
Für die Softwareentwicklung gibt es eine eigene Landkarte: Wie weit dürfen KI-Agenten in jedem Schritt autonom arbeiten, und wie weit trägt die Verifikation? Der Leitsatz dort: Autonomie nur so weit, wie die Verifikation trägt. Mehr dazu auf der Themenseite Agentic Engineering.
Vertiefende Beiträge
Häufige Fragen zum KI-Reifegrad
Was ist Road.MAP for AI?
Road.MAP for AI ist ein Reifegradmodell für die Einführung von KI in Unternehmen. Es bewertet acht Dimensionen – Governance & Recht, Kosten & Steuerung, Infrastruktur & Rechte, Sicherheit & Risiko, Wissen & Daten, Organisation & Befähigung, Kultur & Change sowie Anwendungsfälle & Wertbeitrag – auf jeweils fünf Stufen. Entwickelt hat es Dr. Sven Seiler bei Storm Reply, gemeinsam mit Kolleginnen und Kollegen.
Welche Stufen der KI-Reife gibt es?
Fünf: Experimentieren, Pilot, Kontrollierter Rollout, Skalierter Regelbetrieb und Agentische Organisation. Die Stufen gelten je Dimension, ein Unternehmen hat also acht Stufen, nicht eine. Die größte Hürde liegt zwischen Stufe 2 und 3: Dort werden aus beschlossenen Regeln technisch erzwungene.
Warum gibt es keine Gesamtnote?
Weil ein Durchschnitt genau die Unwucht versteckt, die das Problem ist. KI verstärkt, was da ist: Die schwächste Dimension bremst alle anderen. Das Ergebnis ist deshalb ein Profil über acht Dimensionen, und die schwächste Dimension ist der Engpass, mit dem man anfängt.
Muss jedes Unternehmen Stufe 5 erreichen?
Nein. Stufe 5, die Agentische Organisation, ist nicht überall das Ziel. Welche Zielstufe je Dimension sinnvoll ist, hängt vom Geschäft ab. Im Assessment wird deshalb neben dem Ist auch das Soll erhoben.
Was unterscheidet Road.MAP for AI von anderen KI-Reifegradmodellen?
Drei Dinge fehlten in allen sechs Modellen, die wir analysiert haben: eine eigene Dimension für Kosten und Steuerung, eine agentische Zielstufe und die Trennung von Organisationsreife und Prozesseignung. Dazu kommen die Evidenzpflicht ab Stufe 3 und der Verzicht auf eine Gesamtnote.
Wie wird der KI-Reifegrad erhoben?
Zur Orientierung mit einem Selbstcheck aus 16 Fragen (rund fünf Minuten), vollständig mit einem rollenbasierten Assessment aus 128 Fragen. Ab Stufe 3 gilt eine Bewertung nur mit Nachweis, also einem benennbaren Artefakt wie einer Richtlinie oder einem Dashboard.
Quellen
- Tornatzky, Louis G.; Fleischer, Mitchell: „The Processes of Technological Innovation“, Lexington Books, Lexington (MA), 1990. ISBN 0-669-20348-3. openlibrary.org
- CMMI Product Team: „CMMI for Development, Version 1.3“ (CMU/SEI-2010-TR-033), Technical Report, Software Engineering Institute, Carnegie Mellon University, 2010. DOI: 10.1184/R1/6572342.v1. doi.org
- ISO/IEC: „ISO/IEC 15504-2:2003 Information technology — Process assessment — Part 2: Performing an assessment“, Norm, 2003 (zurückgezogen; ersetzt durch die Normenreihe ISO/IEC 330xx). iso.org
- Smith, Patricia C.; Kendall, Lorne M.: „Retranslation of expectations: An approach to the construction of unambiguous anchors for rating scales“, Journal of Applied Psychology 47(2), S. 149–155, 1963. DOI: 10.1037/h0047060. doi.org
- Venkatesh, Viswanath; Morris, Michael G.; Davis, Gordon B.; Davis, Fred D.: „User Acceptance of Information Technology: Toward a Unified View“, MIS Quarterly 27(3), S. 425–478, 2003. DOI: 10.2307/30036540. doi.org
- Davis, Fred D.: „Perceived Usefulness, Perceived Ease of Use, and User Acceptance of Information Technology“, MIS Quarterly 13(3), S. 319–340, 1989. DOI: 10.2307/249008. doi.org
- Edmondson, Amy: „Psychological Safety and Learning Behavior in Work Teams“, Administrative Science Quarterly 44(2), S. 350–383, 1999. DOI: 10.2307/2666999. doi.org
- Europäisches Parlament und Rat: „Verordnung (EU) 2024/1689 vom 13. Juni 2024 zur Festlegung harmonisierter Vorschriften für künstliche Intelligenz (Verordnung über künstliche Intelligenz)“, ABl. L, 2024/1689, 12. Juli 2024. eur-lex.europa.eu
- ISO/IEC: „ISO/IEC 42001:2023 Information technology — Artificial intelligence — Management system“, Norm, 2023. iso.org
- National Institute of Standards and Technology (Tabassi, Elham): „Artificial Intelligence Risk Management Framework (AI RMF 1.0)“, NIST AI 100-1, 26. Januar 2023. DOI: 10.6028/NIST.AI.100-1. doi.org