Antwort

Woran erkennen Sie, ob ein KI-Agent besser wird?

Zählen Sie bei denselben Testfällen getrennt, was vollständig richtig war, was korrekt an Menschen übergeben wurde und was falsch blieb. Prüfen Sie außerdem fehlende Eingänge, Wartezeit und menschlichen Prüfaufwand. In unserem berichteten Test mit 20 Aufträgen sank die Zahl falscher Entwürfe von sieben auf vier. Die Zahl vollständig richtiger blieb bei sieben. Das ist ein Fortschritt, belegt aber keine Freigabe zum selbstständigen Buchen.[S1][S2]

Berichteter MING-Fall · Juni 2026 · 20 Testaufträge

Bei denselben 20 Aufträgen entstanden weniger falsche Entwürfe.

Dieselben 20 Testaufträge vor und nach der Überarbeitung:

ErgebnisVorherNachher
Vollständig richtig77
Korrekt übergeben69
Falsch74
Vollständig richtig blieben 7 von 20 (35%). Falsche Entwürfe sanken von 7 auf 4; korrekt übergebene Fälle stiegen von 6 auf 9. Das sind berichtete Entwurfsergebnisse aus einem Projekt, keine automatisch gebuchten Aufträge. Veröffentlichter Projektbericht.
Aktualisiert: | Nächste Prüfung: Veröffentlichte MING-Erfahrung Maschinenlesbare Fassung

Von MING Labs · Redaktion

01 Sieben richtige Entwürfe verdeckten den Rückgang der Fehler

Sie haben eine weitere Überarbeitung bezahlt und möchten wissen, ob der Agent seine Arbeit jetzt besser macht. Im Bericht stehen weiterhin sieben vollständig richtige Ergebnisse. Bevor Sie daraus schließen, dass es nicht vorangeht, lohnt sich ein Blick auf die übrigen Fälle.

Genau das haben wir bei einem Agenten erlebt, der Auftragsentwürfe für einen Industriehändler in Deutschland vorbereitet. Er liest eingehende Bestellungen und gleicht sie mit dem Katalog ab. Gebucht wird weiterhin von Menschen. Nach drei Überarbeitungen lieferten dieselben 20 Testaufträge noch immer sieben vollständig richtige Entwürfe. Die Zahl falscher Entwürfe sank jedoch von sieben auf vier; korrekt an Menschen übergebene Fälle stiegen von sechs auf neun. Unser veröffentlichter Projektbericht beschreibt die Arbeit aus dem Juni 2026.[S1][S2]

Der Anteil vollständig richtiger Entwürfe lag damit vorher wie nachher bei 35%. Die Rechnung stimmt. Sie lässt aber eine Veränderung aus, die für die Auftragsbearbeitung wichtig ist: Weniger Fälle endeten mit einer falschen Antwort. Wer nur die 35% betrachtet, kann diesen Fortschritt übersehen. Wer nur die steigenden Übergaben betrachtet, kann übersehen, wie viel zusätzliche Arbeit beim Team landet.

Deshalb gehören die drei Zahlen zusammen. Erst danach lässt sich beurteilen, was das Ergebnis für die Menschen bedeutet, die damit weiterarbeiten.

02 Eine korrekte Übergabe muss bei einer zuständigen Person ankommen

Im Auftragsbeispiel heißt „vollständig richtig“: Alle erforderlichen Felder des Entwurfs stimmen, ohne dass ein Mensch sie korrigieren muss. „Korrekt übergeben“ heißt: Der Agent erkennt, was er nicht entscheiden kann, und gibt den Fall samt Quelle an die richtige Person weiter. „Falsch“ heißt: Er entscheidet, und das Ergebnis erfüllt die vereinbarten Kriterien nicht.[S1]

Nehmen wir als Beispiel eine Bestellung mit unklarer Kundennummer. Rät der Agent eine plausibel wirkende Nummer, kann daraus ein falscher Datensatz werden. Gibt er die ursprüngliche Bestellung mit der offenen Frage an die zuständige Kollegin weiter, kann sie den Fall klären. Dieser Unterschied ist wichtig, obwohl keiner der beiden Wege sofort einen brauchbaren Entwurf liefert.

Der Status „übergeben“ reicht dafür allerdings nicht aus. Prüfen Sie, wer den Fall erhalten hat, ob die Bestellung beiliegt und ob die Nachricht rechtzeitig ankam. Bleibt sie in einem unbeaufsichtigten Postfach liegen, hat die Übergabe ihren Zweck verfehlt. Erfassen Sie diesen Fehler, statt den Fall als erfolgreich übergeben zu zählen.

Ebenso wenig sollte ein Agent jeden gewöhnlichen Fall zurückgeben. Lesen Sie die Gründe für die wachsende mittlere Gruppe. Manche zeigen angemessene Vorsicht. Andere zeigen fehlende Daten, unnötige Einschränkungen oder eine Aufgabe, die der Agent noch nicht beherrscht. Die Zahl zeigt Ihnen, wo Sie nachsehen sollten. Die Bewertung nimmt sie Ihnen nicht ab.

03 Wir lehnten eine Änderung ab, die mehr falsche Entwürfe erzeugt hätte

Unser Werkzeug schlug vor, einen Schwellenwert zu senken, ab dem der Agent einen Entwurf als ausreichend sicher behandelt. Damit sollten mehr fehlerfreie Entwürfe entstehen. Wir haben die Änderung zunächst simuliert. Laut Projektbericht hätte sie vier zusätzliche fehlerfreie Entwürfe geliefert, zugleich aber zwei weitere Entwürfe mit falschen Daten. Wir verwarfen den Vorschlag: Für das Projekt war vorher festgelegt worden, dass keine unbemerkt falschen Daten übernommen werden dürfen.[S1]

Das waren Ergebnisse einer Simulation. Wir haben diese Änderung nicht ausgeliefert; die Zahlen beschreiben keine zwei falsch gebuchten Aufträge im produktiven Betrieb. Sie erklären, warum eine schönere Kennzahl zu einer schlechten Freigabeentscheidung geführt hätte.

Halten Sie vor einer solchen Änderung fest, welchen Tausch Sie akzeptieren würden. Welche Fehler verhindern eine Freigabe? Wer prüft die weiterhin unklaren Fälle? Wer darf dem Agenten mehr Entscheidungsfreiheit geben? Legen Sie diese Vereinbarung neben die Ergebnisse. So kann ein höherer Wert nicht stillschweigend die ursprüngliche Grenze ersetzen.

04 Vergleichen Sie dieselben Aufgaben und prüfen Sie fehlende Eingänge

Halten Sie beim nächsten Test die Eingaben, Abnahmekriterien und Betriebsbedingungen fest. Eine andere Mischung von Aufträgen kann die Kennzahl verändern, ohne dass Sie wissen, ob Ihre Änderung geholfen hat. Auch Anthropics Anleitung zur Agentenbewertung empfiehlt wiederholte Durchläufe und die Prüfung des tatsächlichen Ergebnisses. Der Bericht des Agenten über seine Arbeit reicht dafür nicht aus.[S3]

Die drei Gruppen erfassen die bewerteten Fälle, nicht automatisch alles, was im Unternehmen hätte bearbeitet werden sollen. Gleichen Sie erwartete Eingänge damit ab, was den Agenten tatsächlich erreicht hat. Halten Sie fehlende Eingänge, abgebrochene Durchläufe und noch nicht bewertete Fälle gesondert sichtbar. Sie dürfen weder aus der Bezugsgröße verschwinden noch als richtig gelten. Unsere Antwort zum Protokoll eines KI-Agenten zeigt, wie Auftrag und tatsächliches Ergebnis zusammenfinden.

Betrachten Sie anschließend die Arbeit der Menschen. Wie lange warten übergebene Fälle? Wie viele Minuten braucht jemand, um Entwürfe zu prüfen und zu korrigieren? Kommt die fertige Arbeit rechtzeitig an? Erfassen Sie diese Werte neben den drei Fallzahlen. Die Antwort zu den laufenden Kosten eines Agenten erklärt, warum brauchbare Ergebnisse und menschlicher Aufwand in dieselbe Betriebsentscheidung gehören.

Was sichtbar bleiben mussVor dem Vergleich festlegen
Vollständig richtig, korrekt übergeben, falschAnzahl und Anteil an derselben bewerteten Fallgruppe; Kriterien für jede Kategorie.
Fehlende oder unfertige ArbeitErwartete und tatsächlich eingegangene Aufgaben sowie noch nicht bewertete Fälle.
Menschlicher PrüfaufwandMinuten je Fall einschließlich Korrekturen; benennen, welche Fälle erfasst sind.
Wartezeit und AbschlussZeit vom Eingang bis zum vereinbarten Ergebnis und am Stichtag noch offene Fälle.

05 Prüfen Sie eine Fallgruppe gemeinsam mit der Person, die die Arbeit abnimmt

Wählen Sie eine dokumentierte Gruppe jüngerer Fälle und ordnen Sie sie gemeinsam mit der fachlich verantwortlichen Person ein. Vereinbaren Sie vor der Bewertung, was als richtig zählt. Prüfen Sie jede angeblich erfolgreiche Übergabe in dieser Gruppe und lassen Sie ungeklärte Bewertungen offen. Der Quellenartikel schlägt als Einstieg hundert Fälle vor. Das ist eine Übung, keine allgemeingültige Stichprobengröße und kein Versprechen, dass ein Nachmittag dafür reicht.[S1]

Entscheiden Sie anhand der Ergebnisse, was als Nächstes geändert werden muss: eine Datenlücke schließen, eine Übergabe verbessern, eine Grenze enger setzen oder eine Fähigkeit erneut testen. Unsere Antwort zur Abnahme eines KI-Agenten hilft, daraus einen begrenzten Test zu machen. Wenn MING Sie dabei unterstützen soll, bringen Sie die Aufgabe, die drei Fallzahlen und einen strittigen Fall in ein Gespräch über Ihre Hybrid-Organisation mit.

Was der Vergleich belegt

  • Der Vergleich mit 20 Aufträgen ist veröffentlichte MING-Erfahrung aus einem Projekt. Die zugrunde liegenden Protokolle sind privat und werden hier nicht unabhängig nachgeprüft. Beitrag und Artikel gehören zur selben Quellenfamilie.
  • Gezählt wurden Entwürfe. Die separate Stichprobe mit 115 Aufträgen im Quellenartikel ist hier nicht die Bezugsgröße. Aus den Gesamtzahlen lässt sich nicht ablesen, welche einzelnen Fälle die Gruppe gewechselt haben.
  • Die vorgeschlagenen Kennzahlen und Prüfschritte belegen weder eine allgemeine Zuverlässigkeit noch eingesparte Zeit oder eine Freigabe für mehr Autonomie. Mehr Übergaben sind nur dann nützlich, wenn sie der Aufgabe dienen und das Team sie bewältigen kann.

Dieselben 20 Testaufträge aus einem Projekt im Juni 2026. Berichtete Entwurfsergebnisse, keine allgemeine Zuverlässigkeitsquote oder automatische Verbuchung.

Quellen

[S1]
Every fix worked. The accuracy number never moved. Sebastian Mueller, The Hybrid Company / Medium · 2026-09-30 Belegt: Berichtete Auftragsentwürfe aus Juni 2026, Definitionen, Beschränkung auf Entwürfe und verworfene Schwellenwert-Simulation Veröffentlichte MING-Erfahrung. Vollständigen Originalartikel und sechs Grafiken erneut gelesen. Technische Protokolle sind privat und nicht unabhängig geprüft.
[S2]
The same 20 test orders, before and after Sebastian Mueller, LinkedIn · Abgerufen am 08.10.2026; Anzeige: 5 Tage Belegt: Ausdrückliche Bestätigung, dass vorher und nachher dieselben 20 Testaufträge bewertet wurden Vollständigen Originalbeitrag und Grafik gelesen. Dieselbe Quellenfamilie wie S1, keine unabhängige Bestätigung.
[S3]
Demystifying evals for AI agents Anthropic · 2026-01-09; geprüft am 08.10.2026 Belegt: Klare Aufgaben- und Abnahmekriterien, wiederholte Durchläufe und Prüfung des tatsächlichen Ergebnisses Primäre technische Anleitung, kein Beleg für das Ergebnis im MING-Projekt.

Häufige Fragen

Sind mehr Übergaben an Menschen gut oder schlecht?
Das hängt davon ab, welche Fälle vorher anders behandelt wurden und ob die Übergabe funktioniert. Eine gefährliche Vermutung abzufangen kann ein Fortschritt sein. Unnötige Rückgaben alltäglicher Aufgaben können das Team überlasten. Vergleichen Sie dieselben Aufgaben, prüfen Sie den Grund jeder Übergabe und messen Sie, ob ein Mensch sie rechtzeitig erhält und bearbeitet.
Belegen 20 Testaufträge die Zuverlässigkeit eines Agenten?
Nein. Die berichtete Stichprobe erklärt eine Entwicklungsentscheidung. Sie belegt keine Zuverlässigkeit über den gesamten produktiven Betrieb. Wählen Sie Testfälle passend zur Aufgabe und den möglichen Fehlerfolgen, nehmen Sie gewöhnliche und schwierige Fälle auf und wiederholen Sie Durchläufe. Trennen Sie diese Tests von der Beobachtung des laufenden Betriebs.
Heißt vollständig richtig, dass der Auftrag automatisch gebucht wurde?
In diesem Fall nicht. Der Agent bereitete Auftragsentwürfe vor und buchte nie selbstständig. Vollständig richtig bezieht sich auf die Felder im Entwurf. Benennen Sie bei Ihrer Messung das tatsächlich abgenommene Ergebnis: Ein Entwurf, eine von einem Menschen freigegebene Buchung und ein ausgelieferter Auftrag sind verschiedene Dinge.
Welche Kennzahl sollten wir zuerst verbessern?
Vereinbaren Sie das mit der Person, die den Prozess verantwortet. Beginnen Sie bei unzulässigen Fehlern und ihren Folgen. Beurteilen Sie danach brauchbare Ergebnisse, menschlichen Aufwand und Bearbeitungszeit gemeinsam. Im berichteten Projekt war vorab vereinbart, dass keine unbemerkt falschen Daten übernommen werden dürfen. Das bedeutet nicht, dass bereits alle Fehler beseitigt waren.
Alle Insights (Englisch)