Alle BeiträgeEngineering
Ein Konfidenzwert ist keine Trefferwahrscheinlichkeit
Die Zahl, die ein Modell zu seiner Antwort ausgibt, sagt nicht, wie wahrscheinlich die Antwort stimmt. Und die teuersten Fehler stecken ausgerechnet in den Segmenten, in denen das Modell am zuverlässigsten arbeitet. Wir haben Konfidenzschwellen deshalb durch eine Zulassung je Segment ersetzt: erworben an geprüften Fällen, automatisch entzogen, sobald sich etwas ändert.
Eine Finanzcontrollerin legte uns eine Rechnung vor. Das System hatte sie auf die falsche Kostenstelle kontiert und ohne Prüfung gebucht. Im Log stand neben der Entscheidung eine Konfidenz von 0,97. „Wenn das System zu 97 Prozent sicher war“, fragte sie, „warum lag es dann daneben?“
Es war sich nie zu 97 Prozent sicher, bei gar nichts. Die Zahl war ein Wert, den das Modell zu seiner eigenen Ausgabe erzeugt hatte. Über viele Rechnungen hinweg hing er mit richtigen Ergebnissen zusammen, ähnlich wie das Gefühl von Sicherheit bei einem Menschen. Eine gemessene Wahrscheinlichkeit war er nicht. Und für diesen Lieferanten, nachdem die Kostenstellen im Vormonat neu geordnet worden waren, taugte er nicht einmal als Anhaltspunkt.
Nach diesem Gespräch haben wir aufgehört, die Dunkelverarbeitung, also das Buchen ohne manuelle Prüfung, über Konfidenzschwellen zu steuern. Was wir stattdessen tun, ist weniger elegant und deutlich leichter zu prüfen.
Wer flüssig formuliert, klingt sicher
Das Problem ist gut belegt. In „On Calibration of Modern Neural Networks“ (ICML 2017) zeigten Guo und Kollegen, dass moderne tiefe neuronale Netze sich systematisch überschätzen: Die ausgegebene Konfidenz liegt über der tatsächlichen Genauigkeit. Untersuchungen zu Sprachmodellen weisen in dieselbe Richtung. Xiong und Kollegen stellten auf der ICLR 2024 fest, dass Modelle, die ihre Konfidenz selbst angeben sollen, sie tendenziell zu hoch ansetzen und sich bei hohen Werten häufen, gleich ob sie richtig liegen oder nicht.
Im laufenden Betrieb verschärft sich der Effekt aus einem strukturellen Grund. Fälle, in denen ein Modell danebenliegt, sehen meist unauffällig aus: ein bekannter Lieferant mit einer neuen Produktlinie, eine saubere Rechnung, kontiert auf eine Kostenstelle, die im Vormonat umorganisiert wurde. Nichts in den Eingangsdaten verrät, dass sich etwas geändert hat, also ändert sich auch die Selbsteinschätzung des Modells nicht. Selbstsichere Fehler sind deshalb keine seltenen Ausreißer. Sie sind die typische Fehlerform eines Systems, das flüssig formuliert, während sich das Geschäft unbemerkt verändert.
Dunkelverarbeitung wird je Segment zugelassen
Wir geben dem System keine Schwelle vor. Wir erteilen jedem Segment eine Zulassung. Ein Segment ist ein Lieferant oder eine Gruppe kleiner Lieferanten, jeweils kombiniert mit Belegart und Gesellschaft. Für die Dunkelverarbeitung zugelassen wird es nur, wenn die geprüften Fälle des Kunden drei Bedingungen erfüllen: eine Mindestzahl aufeinanderfolgender, von Menschen geprüfter Fälle, darunter kein einziger Fehler in einem zahlungsrelevanten Feld, und bei jedem dieser Fälle alle unabhängigen Prüfungen bestanden. Die Mindestzahl legt die Finanzleitung vor dem Go-live fest. Jede Zulassung wird in der Vorgangsdatenbank dokumentiert, mit Datum, den zugrunde liegenden Fällen und den eingesetzten Versionen von Modell und Regelwerk.
Ein Lieferant, der zum ersten Mal auftaucht, hat keine Zulassung. Seine ersten Rechnungen werden also immer geprüft, so sauber sie auch aussehen. Allein diese Folge beseitigt einen großen Teil der selbstsicheren Fehler, die wir früher gesehen haben, denn unbemerkte Fehllesungen häufen sich bei neuen Lieferanten und neuen Layouts.
Aus einer Statistikdebatte, die im Finanzbereich niemand führen will, wird so eine Regel, die ein Controller prüfen kann. Zeigen Sie mir die Zulassung. Zeigen Sie mir die Fälle, auf denen sie beruht. Zeigen Sie mir, was sie entziehen würde.
Belastbar sind Prüfungen, die auch hätten scheitern können
Der beste Beleg dafür, dass eine Antwort stimmt, kommt selten von dem Modell, das sie erzeugt hat. Er kommt aus Prüfungen, die jede für sich hätten fehlschlagen können.
Bei einer Lieferantenrechnung sind diese Prüfungen konkret. Der Lieferant stimmt mit den Kreditorenstammdaten überein, abgeglichen über die Steuernummer, nicht über den Namen. Die Positionen ergeben die Rechnungssumme, und die Summe passt innerhalb der vereinbarten Toleranz zur Bestellung. Es gibt einen Wareneingang, der die Menge deckt. Die vorgeschlagene Kostenstelle ist für die Gesellschaft gültig und wurde für diesen Lieferanten und diese Warengruppe schon verwendet. Jede Prüfung ist deterministisch und kostet wenig, und jedes Ergebnis wird am Vorgang festgehalten.
Besteht eine Antwort in einem zugelassenen Segment alle Prüfungen, wird sie gebucht, unabhängig von ihrem Konfidenzwert. Fällt sie bei einer Prüfung durch, geht sie an einen Menschen, egal wie hoch der Wert ist. Der Konfidenzwert bestimmt nur noch die Reihenfolge in der Prüf-Queue.
Die Tragweite zählt mehr als die Trefferquote
Eine Zulassung sagt, wie oft ein Segment richtig liegt. Sie sagt nichts darüber, was ein Fehler kostet. Eine falsche Kostenstelle auf einer kleinen Rechnung korrigiert man im Monatsabschluss mit einer Umbuchung. Eine geänderte Bankverbindung im Lieferantenstamm kann eine Zahlung an einen Betrüger auslösen.
Manche Entscheidungen laufen deshalb nie ohne Prüfung durch, ganz gleich, was die Zulassung sagt: Änderungen an Bankdaten, Beträge über einem vom Controller festgelegten Limit, Lieferanten auf einer Beobachtungsliste und alles, was kurz vor dem Abschluss konzerninterne Salden berührt. Das System bereitet diese Fälle vollständig vor. Freigeben muss sie ein Mensch.
Die zuverlässigsten Segmente brauchen die engste Kontrolle
Fehler, die im Hauptbuch landen, stammen selten aus unsauberen Segmenten. Unsaubere Lieferanten fallen bei den Prüfungen durch und landen in der manuellen Prüfung, wo Menschen die Fehler finden. Die schädlichen Fehler kommen aus Segmenten, die seit Monaten zuverlässig laufen. Sie sind zugelassen, niemand schaut mehr hin, und wenn der Lieferant sein Rechnungslayout ändert oder das Unternehmen seine Kostenstellen neu ordnet, bleibt die Selbsteinschätzung des Modells unverändert. Gerade die Zuverlässigkeit beseitigt die Kontrolle, die die Änderung bemerkt hätte.
Deshalb geht aus jedem zugelassenen Segment dauerhaft eine kleine Zufallsstichprobe in die Prüfung, und drei Ereignisse entziehen eine Zulassung automatisch: ein bestätigter Fehler in der Dunkelverarbeitung, jede Änderung am Modell oder an den Abgleichsregeln und ein neues Belegformat des Lieferanten, erkannt durch den Vergleich jedes Belegs mit den bisher bekannten Layouts. Ein Entzug ist kein Versagen. Er zeigt, dass das System bemerkt, wenn seine Nachweise veraltet sind.
Zulassungen werden an aktuellen Fällen aus dem Produktivbetrieb erworben und gehalten, nicht am Abnahmedatensatz, der nur eine Momentaufnahme der Vergangenheit ist. Und die Controllerin sieht nie eine einzige Genauigkeitszahl für das ganze System, denn die wird von den größten Lieferanten bestimmt und verdeckt die Segmente, in denen sich Fehler häufen. Sie sieht die zugelassenen Segmente, die Fälle hinter jeder Zulassung und jeden selbstsicheren Fehler seit dem letzten Bericht.
Eine Frage genügt
Wenn uns jemand ein System zeigt, das über Modellkonfidenz steuert, fragen wir: Wie viele Fälle, die im letzten Monat ohne Prüfung gebucht wurden, haben sich später als falsch erwiesen, und in welchen Segmenten? Wenn das niemand beantworten kann, weiß niemand, wie genau das System ist. Man weiß nur, wie sicher es klingt.