Warum eine sich selbst benotende KI kein Kompetenznachweis ist

Autorenbild folgtEin Beitrag aus unserer »Standpunkte«-Reihe von Christian Kirsch, Wolfenbüttel.

Generative KI kann Trainingssituationen erzeugen, Gespräche führen, Antworten transkribieren und in Sekunden ein ausführliches Feedback formulieren. Für die Weiterbildung ist das ein großer Fortschritt. Lernende können häufiger üben, Varianten durchspielen und Fehler machen, ohne auf einen festen Seminartermin zu warten. Problematisch wird es erst, wenn aus dieser Nützlichkeit ein Beweis konstruiert wird: Das System hat eine Antwort erzeugt, dieselbe Antwort interpretiert und anschließend festgestellt, dass die Übung erfolgreich war.

Ein solcher Kreislauf kann didaktisch hilfreich sein. Ein Kompetenznachweis ist er nicht. Wer die Qualität KI-gestützter Trainings beurteilen will, muss deshalb Erzeugung, Interpretation und Bewertung gedanklich trennen. Entscheidend ist nicht, wie überzeugend das System sein eigenes Urteil formuliert. Entscheidend ist, welche beobachtbaren Ereignisse dieses Urteil tragen.

Ein Transkript ist noch kein Verstehen

Spracherkennung macht Gesprochenes sichtbar. Das ist technisch anspruchsvoll und für ein digitales Training unverzichtbar. Trotzdem beantwortet ein korrektes Transkript nur eine enge Frage: Welche Wörter hat das System erkannt? Es sagt noch nichts darüber aus, ob eine Antwort zur Situation passte, vollständig war oder eine notwendige Handlung auslöste.
Man kann einen Satz fehlerfrei wiedergeben und seinen Sinn verfehlen. Umgekehrt kann eine fachlich richtige Antwort sprachlich variieren. In einem Kundengespräch kann die Tonlage angemessen sein, während eine verbindliche Zusage fehlt. In einer Sicherheitsunterweisung kann jemand alle richtigen Begriffe verwenden und trotzdem die Reihenfolge vertauschen. In einem Compliance-Training kann eine Antwort freundlich und plausibel klingen, obwohl ein vorgeschriebener Eskalationsschritt ausbleibt.

Das Transkript ist daher ein Belegstück, nicht das Urteil. Es muss mit dem Anlass, dem aktuellen Zustand und den erwarteten Bestandteilen verbunden werden. Erst dann lässt sich prüfen, was eine Person tatsächlich getan hat.

Plausibles Feedback ist noch keine belastbare Bewertung

Große Sprachmodelle sind besonders gut darin, offene Antworten sprachlich zu deuten. Sie erkennen Varianten, fassen Gedanken zusammen und formulieren Hinweise, die sich persönlich anfühlen. Genau diese Stärke verführt dazu, ihnen auch die abschließende Bewertung zu überlassen.

Doch ein plausibles Urteil bleibt ein probabilistisches Urteil. Schon kleine Änderungen an Formulierung, Reihenfolge oder Kontext können das Ergebnis beeinflussen. Forschungen zu Sprachmodellen als Bewerter untersuchen unter anderem Positions-, Stil- und Selbstpräferenz-Effekte. Eine 2025 in den Proceedings der EMNLP veröffentlichte Studie beschreibt, dass Modelle bei der Bewertung eigener oder stilistisch vertrauter Antworten nicht automatisch neutrale Schiedsrichter sind. Das bedeutet nicht, dass jede KI-Bewertung falsch ist. Es bedeutet, dass ihre Neutralität geprüft und nicht vorausgesetzt werden darf.

Besonders heikel wird die Konstruktion, wenn dasselbe Modell alle Rollen übernimmt. Es erfindet die Trainingsfigur, steuert deren Reaktion, interpretiert die Antwort des Lernenden und vergibt danach einen Score. Dann bleibt für Außenstehende oft unklar, ob das System fachlich prüft oder vor allem jene Antwort bevorzugt, die gut zu seiner eigenen Gesprächslogik passt.

Ein ausführliches Feedback kann diesen Mangel sogar verdecken. Je flüssiger die Begründung klingt, desto leichter wird sie mit Nachvollziehbarkeit verwechselt. Nachvollziehbar ist eine Bewertung aber erst, wenn sich zeigen lässt, welche konkrete Beobachtung zu welcher Entscheidung geführt hat.

Kompetenz zeigt sich in veränderten Situationen

Weiterbildung endet nicht bei der Wiedergabe einer Musterantwort. Im Arbeitsalltag ändern sich Gesprächspartner, Reihenfolge, Zeitdruck und verfügbare Informationen. Eine Person handelt kompetent, wenn sie das Gelernte unter veränderten Bedingungen anwenden kann.

Genau hier kann generative KI einen echten Beitrag leisten. Sie kann aus einer Grundsituation zahlreiche Varianten erzeugen. Ein Kunde reagiert anders als erwartet. Eine Führungskraft erhält nicht die vorbereitete Rückfrage. Eine Sicherheitslage entwickelt sich in eine neue Richtung. Der Lernende muss zuhören, auswählen und handeln, statt eine bekannte Formulierung zu reproduzieren.
Variation allein genügt jedoch nicht. Wenn mit jeder neuen Situation zugleich die Maßstäbe wechseln, ist am Ende nur schwer erkennbar, ob die Leistung besser wurde. Ein gutes Training braucht daher beides: variable Szenarien und stabile Bewertungskriterien. Die Oberfläche darf offen sein, der Bewertungsmaßstab nicht beliebig.

Für die Praxis folgt daraus eine einfache Unterscheidung. Die KI darf kreativ sein, wenn sie eine Situation gestaltet. Sie sollte gebunden sein, wenn sie über kritische Anforderungen entscheidet. Je größer die Folgen einer falschen Bewertung sind, desto wichtiger werden explizite Regeln, dokumentierte Zustände und menschlich geprüfte Referenzfälle.

Die beobachtbare Kette eines handlungsorientierten Trainings

Ein belastbares Training lässt sich als Folge von Ereignissen beschreiben. Am Anfang steht ein klarer Anlass. Der Lernende erhält eine Information, eine Frage oder eine veränderte Lage. Danach antwortet er frei. Erst diese freie Reaktion zeigt, was ohne vorgegebene Auswahl tatsächlich verfügbar ist.

Im nächsten Schritt werden die kritischen Bestandteile geprüft. Nicht jedes Wort ist gleich wichtig. Je nach Anwendung können eine Zahl, eine Grenze, eine Zustimmung, eine Eskalation oder eine verbindliche Rückfrage entscheidend sein. Diese Bestandteile sollten vorab feststehen und für Fachverantwortliche einsehbar sein. Ein Gesamtscore ohne diese Ebene hilft wenig, weil er nicht zeigt, was gefehlt hat.

Darauf muss eine nachvollziehbare Folge im Szenario entstehen. War die Antwort vollständig, darf die Situation weitergehen. Fehlt ein notwendiger Bestandteil, sollte das Training nicht so reagieren, als sei alles geklärt. Der Zustand bleibt bestehen, die Konsequenz wird sichtbar und der Lernende erhält eine konkrete Rückmeldung.

Schließlich braucht es die gezielte Wiederholung. Ein Fehler wird nicht dadurch behoben, dass das System eine längere Erklärung ausgibt. Der Lernende muss die misslungene Stelle erneut lösen. Danach sollte eine veränderte Situation folgen, um zu prüfen, ob die zugrunde liegende Fähigkeit übertragen werden kann.

Diese Kette lässt sich prüfen: Anlass, freie Antwort, kritische Bestandteile, Zustandsfolge, Wiederholung und Transfer. Sie liefert keinen perfekten Beweis für Kompetenz. Sie erzeugt aber deutlich bessere Evidenz als ein freundlicher Kommentar und eine Prozentzahl.

Welche Rolle KI sinnvoll übernehmen kann

Die Konsequenz ist kein Plädoyer gegen KI-gestützte Bewertung. Sprachmodelle können Antworten strukturieren, ungewöhnliche Formulierungen erkennen, Rückfragen erzeugen und Hinweise sprachlich an den Lernenden anpassen. Sie können Fachverantwortliche bei der Auswertung großer Mengen von Trainingsdaten unterstützen und Fälle markieren, die eine menschliche Prüfung verdienen.

Sie sollten jedoch nicht unbemerkt von der Lernhilfe zur alleinigen Prüfungsinstanz werden. Für kritische Kriterien braucht es einen nachvollziehbaren Maßstab außerhalb der jeweils erzeugten Antwort. Das kann eine explizite Regel, eine geprüfte Rubrik, ein definierter Szenariozustand oder eine fachlich kuratierte Referenz sein. Bei offenen und strittigen Fällen bleibt menschliche Beurteilung notwendig.

Auch eine Trennung verschiedener Modelle löst das Problem nicht automatisch. Zwei Sprachmodelle können dieselben blinden Flecken teilen. Wichtiger als die Zahl der eingesetzten Systeme ist die Qualität der Evidenz: Sind die Kriterien vor der Bewertung festgelegt? Können Fachverantwortliche das Urteil anhand der beobachteten Antwort prüfen? Wird dokumentiert, warum ein Szenario weiterlief oder stehen blieb? Gibt es regelmäßig menschlich bewertete Stichproben?

Das Generative-AI-Profil des US-amerikanischen National Institute of Standards and Technology empfiehlt, Risiken generativer Systeme über ihren Lebenszyklus zu messen und zu steuern. Für Weiterbildung bedeutet das: Nicht nur die Ausgabe des Modells braucht Qualitätskontrolle. Auch das Bewertungsverfahren selbst muss beobachtet, getestet und gegen geeignete Referenzen geprüft werden.

Was Weiterbildungsverantwortliche verlangen sollten

Wer ein KI-gestütztes Training auswählt, sollte sich deshalb nicht mit einer eindrucksvollen Demo zufriedengeben. Entscheidend sind konkrete Antworten auf wenige Fragen. Was genau muss ein Lernender in der Situation erkennen oder tun? Welche Kriterien sind fest definiert, welche werden vom Modell interpretiert? Welche Beobachtung hat zu welchem Feedback geführt? Was passiert im Szenario, wenn ein kritischer Bestandteil fehlt? Kann der Lernende genau diese Stelle wiederholen? Und wie wird geprüft, ob er das Gelernte in einer neuen Variante anwenden kann?

Ein Anbieter, der darauf nur mit Modellnamen, Genauigkeitswerten oder der Natürlichkeit des Dialogs antwortet, erklärt die Technik, aber noch nicht die Trainingsqualität. Gute Weiterbildung braucht keine lückenlose Automatisierung. Sie braucht eine klare Grenze zwischen dem, was die KI flexibel erzeugen darf, und dem, was als fachlicher Maßstab stabil bleiben muss.

Generative KI kann Übungsräume schaffen, die vor wenigen Jahren kaum wirtschaftlich umsetzbar gewesen wären. Sie kann mehr Sprechzeit, mehr Varianten und schnellere Rückmeldung ermöglichen. Ihr Wert wächst, wenn ihre Rolle präzise begrenzt wird. Die KI darf Gesprächspartnerin, Ideengeberin und Auswertungshilfe sein. Den Kompetenznachweis muss eine beobachtbare Kette tragen, die auch außerhalb der Selbsterzählung des Systems Bestand hat.


Literatur und Hinweise


Autorenbild folgt

Christian Kirsch ist Geschäftsführer der V1 Capital & Consulting GmbH

Das Unternehmen entwickelt mit FlyTalk eine browserbasierte Trainings- und Simulationssoftware für deutschen BZF- und VFR-Flugfunk. In diesem Kontext beschäftigt er sich mit der Frage, wie freie Sprache, explizite Bewertungskriterien und nachvollziehbare Szenariozustände in KI-gestützten Trainings zusammenwirken. 

In unserer Reihe »Standpunkte« bieten wir von Zeit zu Zeit engagierten Akteuren aus den Bereichen Weiterbildung, Personalentwicklung und Wissensmanagement die Möglichkeit, sich mit einem aktuellen Thema an unsere Leser zu wenden.
Unabhängig vom jeweiligen Inhalt weisen wir darauf hin, dass diese Artikel ausschließlich die Meinung des jeweiligen Autors wiedergeben und nicht zwangsläufig mit der Auffassung der Redaktion in Einklang zu bringen sind. 

  VERWEISE  

 

Das könnte Sie auch interessieren...

KI verändert die Arbeit – Begleitung bleibt aber oft aus Künstliche Intelligenz hat in deutschen Büros und Werkshallen längst Einzug gehalten, doch Führung und Weiterbildung hinken hinterher. Das zeigt eine repräsentative Studie der IU …

Menschliche Verantwortung bleibt Trumpf – auch im KI-Zeitalter Wer als Unternehmen komplett auf künstliche Intelligenz setzt, um nach außen zu kommunizieren, geht ein Risiko ein, das viele offenbar unterschätzen. Mehr als jede dritte deutsche …

Zwischen Aufbruch und Unsicherheit Innerhalb eines einzigen Jahres hat sich der Einsatz Künstlicher Intelligenz an deutschen Schulen spürbar beschleunigt – strukturell verankert ist er jedoch noch längst nicht. Das zeigt der zweite » …

Die verborgene Lücke: Warum KI-Kurse allein nicht reichen Die Künstliche Intelligenz ist im deutschen Arbeitsalltag angekommen – aber es fehlte etwas entscheidend Wichtiges. Eine neue Befragung des Stifterverbandes unter 1.001 Führungskräften …