Methodik · 6 MIN

Eine Zahl ohne Begründung

Ein Entscheidungsmodell liefert eine kalibrierte Wahrscheinlichkeit und nichts, was nach Erklärung aussieht. Das ist ehrlicher als die Alternative.

Eine Zahl ohne Begründung
LIEU
Weltweit
SÉRIE
Gouvernance & conformité de l'IA
AUTEUR
Aashwin Shrivastava
PUBLIÉ LE
18 sept. 2026
IMAGE
GÉNÉRÉ PAR IA

Jev gibt eine Wahrscheinlichkeit zurück. Es gibt keine Begründung zurück. Für die meiste Software ist das ein Vorteil, denn eine Begründung muss eine Maschine parsen, eine Wahrscheinlichkeit kann sie direkt verwenden.

Für alles, was den Antrag, den Anspruch, die Rechnung oder das Arbeitsverhältnis eines Menschen berührt, wirkt die fehlende Begründung zunächst wie das eigentliche Problem. Sie ist es nicht. Sie ist eine Aussage darüber, wo der Nachweis liegen muss.

01. Die generierte Begründung war nie ein Nachweis

Ein Sprachmodell, das einen Fall klassifiziert, kann um eine Begründung gebeten werden, und die liest sich gut. Genau darin liegt die Falle. Der Text entsteht im Nachhinein und ist kein Protokoll der Berechnung, die zur Entscheidung geführt hat. Er ist eine plausible Geschichte über eine Entscheidung, nicht die Entscheidung. Abgelegt wurde er trotzdem als Prüfspur.

Ein Entscheidungsmodell nimmt diese Illusion weg. Es liefert eine typisierte Ausgabe und eine kalibrierte Wahrscheinlichkeit, und nichts, was einer Begründung ähnelt. Der Nachweis muss also um das Modell herum gebaut werden statt von ihm angefordert.

02. Wie der Nachweis aussieht

In der Praxis protokolliert die Entscheidungsschicht den übergebenen Zustand, die exakt gestellte Frage, die typisierte Antwort, die Wahrscheinlichkeit, den zu diesem Zeitpunkt geltenden Schwellenwert und die Version des Fragensatzes. Das ist reproduzierbar. Bei gleichem Zustand lässt sich zeigen, was das System gefragt wurde und was es zurückgegeben hat. Ein generierter Absatz kann das nicht leisten.

Der Fragensatz selbst wird damit zum versionierten Artefakt. Ändert sich eine Frage, ändert sich die Grundlage aller späteren Entscheidungen, und das muss sichtbar sein. In Systemen, die wir bauen, liegt dieser Satz im Repository und nicht in einer Konfigurationsoberfläche.

03. Kalibrierung verdient einen präzisen Satz

Kalibrierung ist eine Eigenschaft einer Verteilung. Gibt das Modell über viele Fälle hinweg 0,8 an, sind davon etwa acht von zehn korrekt. Über den konkret vorliegenden Fall sagt das nichts.

Der Schwellenwert ist damit eine Richtungsentscheidung über akzeptierten Fehler und gehört in ein Dokument, das ein Mensch unterzeichnet hat, nicht in eine Konstante im Quellcode. Teams, die das ernst nehmen, messen die Kalibrierung auf einem zurückgehaltenen Teil der eigenen Daten nach, statt sie vorauszusetzen.

04. Aufsicht braucht Grenzen, keinen Fließtext

Die Anforderungen des EU AI Act an menschliche Aufsicht bei höherem Risiko zeigen in dieselbe Richtung. Aufsicht ist dann wirksam, wenn die prüfende Person sieht, was das System bekommen hat, was es entschieden hat und wo die Grenze liegt. Ein selbstbewusster Satz, erzeugt von genau dem System, das die Entscheidung getroffen hat, leistet das nicht. Ein protokollierter Zustand mit Frage, Score und Schwellenwert leistet es.

Es gibt eine Variante, die schlechter ist als beide Optionen. Ein Entscheidungsmodell liefert eine Zahl, und ein Sprachmodell wird anschließend gebeten, diese Zahl zu erklären. Das wirkt gründlich und ist es nicht. Die Erklärung wird aus der Ausgabe rekonstruiert, nie aus der Berechnung.

05. Die Form, auf die wir hinbauen

Typisierte Entscheidungen dort, wo die Antwort eine Klasse, ein Score oder ein Boolescher Wert ist. Generierung nur dort, wo ein Mensch tatsächlich Fließtext braucht. Ein Entscheidungsnachweis, der außerhalb von beidem liegt und nicht davon abhängt, dass eines von beidem einsehbar ist. Menschliche Prüfung ausgelöst durch das Wahrscheinlichkeitsband statt durch das Thema, damit die Fälle nahe der Grenze Aufmerksamkeit bekommen und nicht die Fälle, die jemand für heikel gehalten hat.

Als Prinzip ist daran nichts neu. Neu ist, dass die Entscheidungsschicht günstig genug geworden ist, damit sich die Architektur auch in gewöhnlichen B2B-Workloads lohnt und nicht nur in Systemen, an denen ohnehin eine Aufsichtsbehörde hängt.

← Signals

Wayne Dyer

“Si vous changez votre façon de voir les choses, les choses que vous voyez changent.”