01 Sieben richtige Entwürfe verdeckten den Rückgang der Fehler
Sie haben eine weitere Überarbeitung bezahlt und möchten wissen, ob der Agent seine Arbeit jetzt besser macht. Im Bericht stehen weiterhin sieben vollständig richtige Ergebnisse. Bevor Sie daraus schließen, dass es nicht vorangeht, lohnt sich ein Blick auf die übrigen Fälle.
Genau das haben wir bei einem Agenten erlebt, der Auftragsentwürfe für einen Industriehändler in Deutschland vorbereitet. Er liest eingehende Bestellungen und gleicht sie mit dem Katalog ab. Gebucht wird weiterhin von Menschen. Nach drei Überarbeitungen lieferten dieselben 20 Testaufträge noch immer sieben vollständig richtige Entwürfe. Die Zahl falscher Entwürfe sank jedoch von sieben auf vier; korrekt an Menschen übergebene Fälle stiegen von sechs auf neun. Unser veröffentlichter Projektbericht beschreibt die Arbeit aus dem Juni 2026.[S1][S2]
Der Anteil vollständig richtiger Entwürfe lag damit vorher wie nachher bei 35%. Die Rechnung stimmt. Sie lässt aber eine Veränderung aus, die für die Auftragsbearbeitung wichtig ist: Weniger Fälle endeten mit einer falschen Antwort. Wer nur die 35% betrachtet, kann diesen Fortschritt übersehen. Wer nur die steigenden Übergaben betrachtet, kann übersehen, wie viel zusätzliche Arbeit beim Team landet.
Deshalb gehören die drei Zahlen zusammen. Erst danach lässt sich beurteilen, was das Ergebnis für die Menschen bedeutet, die damit weiterarbeiten.
02 Eine korrekte Übergabe muss bei einer zuständigen Person ankommen
Im Auftragsbeispiel heißt „vollständig richtig“: Alle erforderlichen Felder des Entwurfs stimmen, ohne dass ein Mensch sie korrigieren muss. „Korrekt übergeben“ heißt: Der Agent erkennt, was er nicht entscheiden kann, und gibt den Fall samt Quelle an die richtige Person weiter. „Falsch“ heißt: Er entscheidet, und das Ergebnis erfüllt die vereinbarten Kriterien nicht.[S1]
Nehmen wir als Beispiel eine Bestellung mit unklarer Kundennummer. Rät der Agent eine plausibel wirkende Nummer, kann daraus ein falscher Datensatz werden. Gibt er die ursprüngliche Bestellung mit der offenen Frage an die zuständige Kollegin weiter, kann sie den Fall klären. Dieser Unterschied ist wichtig, obwohl keiner der beiden Wege sofort einen brauchbaren Entwurf liefert.
Der Status „übergeben“ reicht dafür allerdings nicht aus. Prüfen Sie, wer den Fall erhalten hat, ob die Bestellung beiliegt und ob die Nachricht rechtzeitig ankam. Bleibt sie in einem unbeaufsichtigten Postfach liegen, hat die Übergabe ihren Zweck verfehlt. Erfassen Sie diesen Fehler, statt den Fall als erfolgreich übergeben zu zählen.
Ebenso wenig sollte ein Agent jeden gewöhnlichen Fall zurückgeben. Lesen Sie die Gründe für die wachsende mittlere Gruppe. Manche zeigen angemessene Vorsicht. Andere zeigen fehlende Daten, unnötige Einschränkungen oder eine Aufgabe, die der Agent noch nicht beherrscht. Die Zahl zeigt Ihnen, wo Sie nachsehen sollten. Die Bewertung nimmt sie Ihnen nicht ab.
03 Wir lehnten eine Änderung ab, die mehr falsche Entwürfe erzeugt hätte
Unser Werkzeug schlug vor, einen Schwellenwert zu senken, ab dem der Agent einen Entwurf als ausreichend sicher behandelt. Damit sollten mehr fehlerfreie Entwürfe entstehen. Wir haben die Änderung zunächst simuliert. Laut Projektbericht hätte sie vier zusätzliche fehlerfreie Entwürfe geliefert, zugleich aber zwei weitere Entwürfe mit falschen Daten. Wir verwarfen den Vorschlag: Für das Projekt war vorher festgelegt worden, dass keine unbemerkt falschen Daten übernommen werden dürfen.[S1]
Das waren Ergebnisse einer Simulation. Wir haben diese Änderung nicht ausgeliefert; die Zahlen beschreiben keine zwei falsch gebuchten Aufträge im produktiven Betrieb. Sie erklären, warum eine schönere Kennzahl zu einer schlechten Freigabeentscheidung geführt hätte.
Halten Sie vor einer solchen Änderung fest, welchen Tausch Sie akzeptieren würden. Welche Fehler verhindern eine Freigabe? Wer prüft die weiterhin unklaren Fälle? Wer darf dem Agenten mehr Entscheidungsfreiheit geben? Legen Sie diese Vereinbarung neben die Ergebnisse. So kann ein höherer Wert nicht stillschweigend die ursprüngliche Grenze ersetzen.
04 Vergleichen Sie dieselben Aufgaben und prüfen Sie fehlende Eingänge
Halten Sie beim nächsten Test die Eingaben, Abnahmekriterien und Betriebsbedingungen fest. Eine andere Mischung von Aufträgen kann die Kennzahl verändern, ohne dass Sie wissen, ob Ihre Änderung geholfen hat. Auch Anthropics Anleitung zur Agentenbewertung empfiehlt wiederholte Durchläufe und die Prüfung des tatsächlichen Ergebnisses. Der Bericht des Agenten über seine Arbeit reicht dafür nicht aus.[S3]
Die drei Gruppen erfassen die bewerteten Fälle, nicht automatisch alles, was im Unternehmen hätte bearbeitet werden sollen. Gleichen Sie erwartete Eingänge damit ab, was den Agenten tatsächlich erreicht hat. Halten Sie fehlende Eingänge, abgebrochene Durchläufe und noch nicht bewertete Fälle gesondert sichtbar. Sie dürfen weder aus der Bezugsgröße verschwinden noch als richtig gelten. Unsere Antwort zum Protokoll eines KI-Agenten zeigt, wie Auftrag und tatsächliches Ergebnis zusammenfinden.
Betrachten Sie anschließend die Arbeit der Menschen. Wie lange warten übergebene Fälle? Wie viele Minuten braucht jemand, um Entwürfe zu prüfen und zu korrigieren? Kommt die fertige Arbeit rechtzeitig an? Erfassen Sie diese Werte neben den drei Fallzahlen. Die Antwort zu den laufenden Kosten eines Agenten erklärt, warum brauchbare Ergebnisse und menschlicher Aufwand in dieselbe Betriebsentscheidung gehören.
| Was sichtbar bleiben muss | Vor dem Vergleich festlegen |
|---|---|
| Vollständig richtig, korrekt übergeben, falsch | Anzahl und Anteil an derselben bewerteten Fallgruppe; Kriterien für jede Kategorie. |
| Fehlende oder unfertige Arbeit | Erwartete und tatsächlich eingegangene Aufgaben sowie noch nicht bewertete Fälle. |
| Menschlicher Prüfaufwand | Minuten je Fall einschließlich Korrekturen; benennen, welche Fälle erfasst sind. |
| Wartezeit und Abschluss | Zeit vom Eingang bis zum vereinbarten Ergebnis und am Stichtag noch offene Fälle. |
05 Prüfen Sie eine Fallgruppe gemeinsam mit der Person, die die Arbeit abnimmt
Wählen Sie eine dokumentierte Gruppe jüngerer Fälle und ordnen Sie sie gemeinsam mit der fachlich verantwortlichen Person ein. Vereinbaren Sie vor der Bewertung, was als richtig zählt. Prüfen Sie jede angeblich erfolgreiche Übergabe in dieser Gruppe und lassen Sie ungeklärte Bewertungen offen. Der Quellenartikel schlägt als Einstieg hundert Fälle vor. Das ist eine Übung, keine allgemeingültige Stichprobengröße und kein Versprechen, dass ein Nachmittag dafür reicht.[S1]
Entscheiden Sie anhand der Ergebnisse, was als Nächstes geändert werden muss: eine Datenlücke schließen, eine Übergabe verbessern, eine Grenze enger setzen oder eine Fähigkeit erneut testen. Unsere Antwort zur Abnahme eines KI-Agenten hilft, daraus einen begrenzten Test zu machen. Wenn MING Sie dabei unterstützen soll, bringen Sie die Aufgabe, die drei Fallzahlen und einen strittigen Fall in ein Gespräch über Ihre Hybrid-Organisation mit.
Was der Vergleich belegt
- Der Vergleich mit 20 Aufträgen ist veröffentlichte MING-Erfahrung aus einem Projekt. Die zugrunde liegenden Protokolle sind privat und werden hier nicht unabhängig nachgeprüft. Beitrag und Artikel gehören zur selben Quellenfamilie.
- Gezählt wurden Entwürfe. Die separate Stichprobe mit 115 Aufträgen im Quellenartikel ist hier nicht die Bezugsgröße. Aus den Gesamtzahlen lässt sich nicht ablesen, welche einzelnen Fälle die Gruppe gewechselt haben.
- Die vorgeschlagenen Kennzahlen und Prüfschritte belegen weder eine allgemeine Zuverlässigkeit noch eingesparte Zeit oder eine Freigabe für mehr Autonomie. Mehr Übergaben sind nur dann nützlich, wenn sie der Aufgabe dienen und das Team sie bewältigen kann.