Zum Inhalt springen

Alle BeiträgeStrategie

Wartezeit, Bearbeitungszeit und Nacharbeit: messen, was KI im operativen Geschäft verändert

Eingesparte Stunden sind meist die unehrlichste Zahl in einem KI-Business-Case, weil sie Warten als Arbeit zählen. So bauen wir eine Wertaussage, die ein CFO auch ein Jahr später verteidigen kann: Wartezeit, Bearbeitungszeit und Nacharbeit getrennt gemessen, ein gestaffelter Rollout als Vergleich und keine Umsatzbehauptung ohne gemessenen Zusammenhang.

6. Mai 20255 min LesezeitGeschrieben von Alexandru Bene

Mehrere Tausend Stunden im Jahr. Das war die Einsparung in einem Business Case für eine Rechnungsautomatisierung, den eine CFO für ihren Vorstand erstellt hatte, bevor wir beteiligt waren. Die Rechnung multiplizierte die Anzahl der Rechnungen mit der Zeit, die eine Rechnung früher vom Eingang bis zur Zahlung gebraucht hatte. Der größte Teil dieser Zeit war Warten gewesen: im Postfach, in der Queue eines Freigebenden, auf den Wareneingang des Lagers. An den meisten dieser Tage hatte niemand an der Rechnung gearbeitet. Automatisierung würde das Warten verkürzen. Sie würde keine Stunden zurückgeben, die niemand aufgewendet hatte.

Die Zahl war nicht unehrlich. Sie war auf die gewöhnliche Art falsch, auf die die meisten KI-Wertzahlen falsch sind, und ein Jahr später wäre es die CFO gewesen, die man fragt, wo die Stunden geblieben sind.

McKinseys State of AI Survey (März 2025) ergab, dass die meisten Organisationen, die generative KI einsetzen, noch keinen wesentlichen Effekt auf das Ergebnis auf Unternehmensebene sehen. Ein Teil dieser Lücke ist real. Ein Teil davon ist nach unserer Erfahrung eine Frage der Messung: Wert, der in einer Form behauptet wird, die hinterher niemand wiederfindet. Deshalb beginnt jeder Workflow, den wir bauen, mit einer Wertaussage, die vor dem Bau vereinbart und danach berichtet wird.

Jeder Fall zerfällt in Wartezeit, Bearbeitungszeit und Nacharbeit

Wir zerlegen den Lebenslauf eines Falls in drei Teile, jeder aus seiner eigenen Quelle gemessen. Wartezeit ist Zeit, in der niemand an dem Fall arbeitet: im Postfach, in einer Freigabe-Queue, blockiert durch einen fehlenden Wareneingang. Bearbeitungszeit ist Zeit, in der ein Mensch aktiv an ihm arbeitet. Nacharbeit ist Bearbeitung, die ein zweites Mal anfällt, weil der erste Versuch falsch oder unvollständig war.

Die Durchlaufzeit ist die Summe aus allen dreien, und sie stammt aus Systemereignissen: eingegangen, erstmals geöffnet, Status geändert, freigegeben, gebucht, bezahlt. Bearbeitungszeit und Nacharbeit stammen aus der Zeitmessung an einer Stichprobe echter Fälle über eine volle Periode einschließlich eines Monatsabschlusses. Nie aus Interviews, denn Menschen erinnern sich an die schwierigen Fälle, vergessen die einfachen und können Arbeiten nicht von Warten unterscheiden.

Die Zerlegung zeigt, woher der Wert kommen wird, bevor etwas gebaut ist. Automatisierung beseitigt den Großteil der Wartezeit, einen großen Teil der Nacharbeit und einen kleineren Anteil der Bearbeitungszeit, weil die schwierigen Fälle weiterhin Menschen brauchen. Wer Durchlaufzeit mit Volumen multipliziert und das Ergebnis Aufwand nennt, zählt das gesamte Warten als Arbeit. Daher kamen die mehreren Tausend Stunden.

Ein gestaffelter Rollout liefert den Vergleich

Jede Wertaussage muss beantworten, was ohne das System passiert wäre. Eine Einführung verändert immer gleichzeitig andere Dinge. Stammdaten werden bereinigt, Lieferanten werden gebeten, Bestellnummern anzugeben, ein überflüssiger Freigabeschritt fällt weg. All das verbessert die Zahlen. Nichts davon ist die KI.

Die sauberste Antwort, die wir gefunden haben, ist ein gestaffelter Rollout. In einer Gruppe mit mehreren Gesellschaften, Märkten oder Teams geht der Workflow in einigen früher live als in anderen. Für einige Perioden bilden die Gesellschaften ohne ihn die Vergleichsgruppe, mit derselben Saison, demselben Volumentrend und, wenn sie sie auch bekommen, derselben Bereinigung. Der Unterschied zwischen den Gruppen ist der Effekt des Systems. Wo eine Staffelung nicht möglich ist, wird jede gleichzeitige Änderung in der Wertaussage aufgeführt und, wo möglich, getrennt gemessen. Manchmal bringt die Bereinigung mehr als das System, und dann steht das in der Wertaussage.

Kapazität wird in der Spitze gemessen

Für die meisten operativen Bereiche liegt der eigentliche Wert in der Kapazität: wie viel mehr Volumen dasselbe Team aufnehmen kann, bevor es zum Engpass wird. Das ist auch die Größe, die mit Wachstum zusammenhängt, und Wachstum ist meist der Grund, warum das Unternehmen investiert.

An einem durchschnittlichen Tag gemessen, schmeichelt Kapazität und nützt nichts. Wir messen sie in der Spitze des Monatsabschlusses: das Volumen, das an den stärksten Tagen innerhalb der Frist erledigt wurde, und die Größe der Prüf-Queue, die übrig bleibt. Ein Team, das die Spitze jetzt gut bewältigt, wo sie früher in den nächsten Monat rutschte, hat Kapazität, gegen die ein CFO Wachstum planen kann.

Bei einem Getränkehersteller ging der Weg von der Rechnung über Bestellung und Wareneingang bis zur Zahlung von 3 Tagen auf 15 Minuten zurück, und 94 % der Rechnungen wurden ohne einen Menschen abgeglichen. Das ist eine Messung von Durchlaufzeit und Abgleichsanteil aus Systemzeitstempeln vor und nach der Einführung. Sie zeigt Lieferanten, die pünktlich bezahlt werden, und ein Finanzteam, das nicht mehr auf dem kritischen Pfad liegt. Sie ist keine Aussage über Stunden, Personal oder Umsatz, und wir stellen sie nicht so dar.

Umsatz und vermiedene Fehler brauchen direkte Belege

Schnellere Angebote gewinnen vielleicht mehr Aufträge. Manchmal ist der Zusammenhang real, und fast nie ist er gemessen. Wir behaupten einen Umsatzeffekt nur, wenn der Kunde ihn mit einer Methode gemessen hat, die einer Prüfung durch das Finanzressort standhält: mit einer Vergleichsgruppe oder einem Vorher-nachher-Vergleich bei einer Größe, die der Workflow direkt steuert, etwa Anfragen, die früher unbeantwortet blieben.

Für vermiedene Fehler gilt dieselbe Disziplin. Eine gestoppte Doppelzahlung, eine erkannte geänderte Bankverbindung, eine Differenz, die vor dem Abschluss gefunden wurde: Jedes zählt nur, wenn das System es markiert und ein Mensch es als echtes Problem bestätigt hat, bewertet mit dem gefährdeten Betrag, nicht mit einer Vermutung über die Folgen.

Die Wertaussage hat eine feste Form

Die Aussage, die ein Sponsor erhält, enthält drei bis fünf Kennzahlen, nie zwanzig. Für jede: Definition, Quellsystem, Periode, Ausgangsbasis, aktueller Wert und was sich im selben Zeitraum sonst geändert hat. Eine Zahl, deren Methode sich nicht in einem Satz angeben lässt, bleibt draußen. Die Kennzahlen werden vor dem Bau festgelegt und ändern sich nach dem Go-live nicht, weil eine andere besser aussieht.

Zwei weitere Regeln. Eine Zahl, die das System über sich selbst berichtet, etwa seine Abgleichsquote oder seinen Dunkelverarbeitungsanteil, wird gegen die eigenen Daten von ERP und Bank geprüft, bevor sie in die Aussage kommt. Und berichtet wird ab der ersten vollen Periode, die einen Monatsabschluss enthält, denn die ersten Wochen vermischen den Reiz eines neuen Prozesses mit der Störung durch das Erlernen.

Zwei Sätze pro Zahl

Bevor eine Wertaussage an einen Vorstand geht, beantwortet der Sponsor zu jeder Zahl eine Frage laut: Wie wurde das gemessen, und was hat sich im selben Zeitraum sonst geändert? Braucht die Antwort mehr als zwei Sätze oder enthält sie das Wort „geschätzt“, ist die Zahl noch nicht so weit. So gemessen braucht gute Arbeit selten Hilfe, um wertvoll auszusehen.

Sprechen Sie mit unseren Engineers über Ihren Betrieb.

Beschreiben Sie einen Ablauf und die Systeme, auf die er angewiesen ist. Ein Senior Engineer antwortet innerhalb von zwei Werktagen mit einer ersten Einschätzung: was wir bauen würden, was nicht, und warum.

Ein Senior Engineer liest jede Anfrage und antwortet innerhalb von zwei Werktagen.

Oder direkt buchen: Termin für ein Erstgespräch