{
  "format": "minglabs/v1",
  "surface": "insights-answer",
  "slug": "woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
  "inLanguage": "de",
  "translationOf": "https://www.minglabs.com/insights/answers/which-metrics-show-whether-an-ai-agent-is-improving",
  "sourceDateModified": "2026-10-08",
  "languages": [
    {
      "language": "en",
      "label": "English",
      "path": "/insights/answers/which-metrics-show-whether-an-ai-agent-is-improving",
      "url": "https://www.minglabs.com/insights/answers/which-metrics-show-whether-an-ai-agent-is-improving",
      "jsonUrl": "https://www.minglabs.com/insights/answers/which-metrics-show-whether-an-ai-agent-is-improving.json",
      "markdownUrl": "https://www.minglabs.com/insights/answers/which-metrics-show-whether-an-ai-agent-is-improving.md"
    },
    {
      "language": "de",
      "label": "Deutsch",
      "path": "/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
      "url": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
      "jsonUrl": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird.json",
      "markdownUrl": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird.md"
    }
  ],
  "kind": "answer",
  "pageType": "Answer",
  "question": "Woran erkennen Sie, ob ein KI-Agent besser wird?",
  "anchorTermConceptSlug": "what-is-hybrid-organisation",
  "topic": "Die Qualität der Arbeit eines KI-Agenten beurteilen",
  "targetQueries": [
    "Woran erkennen Sie, ob ein KI-Agent besser wird?",
    "KI-Agent Qualität messen",
    "KI-Agent Kennzahlen"
  ],
  "url": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
  "htmlUrl": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
  "partOf": "https://www.minglabs.com/insights/answers",
  "title": "Woran erkennen Sie, ob ein KI-Agent besser wird?",
  "standout": null,
  "hook": "Zählen Sie bei denselben Testfällen getrennt, was vollständig richtig war, was korrekt an Menschen übergeben wurde und was falsch blieb. Prüfen Sie außerdem fehlende Eingänge, Wartezeit und menschlichen Prüfaufwand. In unserem berichteten Test mit 20 Aufträgen sank die Zahl falscher Entwürfe von sieben auf vier. Die Zahl vollständig richtiger blieb bei sieben. Das ist ein Fortschritt, belegt aber keine Freigabe zum selbstständigen Buchen.",
  "citableAnswer": "MING Labs empfiehlt, vollständig richtige Ergebnisse, korrekte Übergaben an Menschen und falsche Ergebnisse an denselben Aufgaben mit klaren Abnahmekriterien zu vergleichen. Eine unveränderte Trefferquote kann weniger falsche Entwürfe verdecken. Mehr Übergaben können zugleich das Team stärker belasten. Prüfen Sie deshalb, ob sie rechtzeitig bei der zuständigen Person ankommen, und erfassen Sie fehlende Eingänge sowie Prüfaufwand gesondert.",
  "hookSourceIds": [
    "S1",
    "S2"
  ],
  "author": {
    "name": "MING Labs",
    "role": "Redaktion"
  },
  "evidenceNote": "Dieselben 20 Testaufträge aus einem Projekt im Juni 2026. Berichtete Entwurfsergebnisse, keine allgemeine Zuverlässigkeitsquote oder automatische Verbuchung.",
  "evidenceLabel": "Veröffentlichte MING-Erfahrung",
  "summary": "Ein berichteter Test mit 20 Aufträgen zeigt, was die Trefferquote verdeckt, welche Kennzahlen bei KI-Agenten helfen und wann eine Änderung mehr Fehler zulässt.",
  "pillar": "Hybrid Organisation",
  "datePublished": "2026-10-08",
  "dateModified": "2026-10-08",
  "freshness": {
    "updated": "Oktober 2026",
    "nextReview": "Januar 2027",
    "nextReviewDate": "2027-01-08"
  },
  "evidenceTier": "proprietary",
  "confidence": "B",
  "sources": [
    {
      "id": "S1",
      "title": "Every fix worked. The accuracy number never moved.",
      "publisher": "Sebastian Mueller, The Hybrid Company / Medium",
      "date": "2026-09-30",
      "url": "https://medium.com/the-hybrid-company/every-fix-worked-the-accuracy-number-never-moved-3589daa95750",
      "supports": [
        "Berichtete Auftragsentwürfe aus Juni 2026, Definitionen, Beschränkung auf Entwürfe und verworfene Schwellenwert-Simulation"
      ],
      "method": "Veröffentlichte MING-Erfahrung. Vollständigen Originalartikel und sechs Grafiken erneut gelesen. Technische Protokolle sind privat und nicht unabhängig geprüft."
    },
    {
      "id": "S2",
      "title": "The same 20 test orders, before and after",
      "publisher": "Sebastian Mueller, LinkedIn",
      "date": "Abgerufen am 08.10.2026; Anzeige: 5 Tage",
      "url": "https://www.linkedin.com/posts/smueller1512_ai-agents-transformation-share-7511712327352635395-HY12/",
      "supports": [
        "Ausdrückliche Bestätigung, dass vorher und nachher dieselben 20 Testaufträge bewertet wurden"
      ],
      "method": "Vollständigen Originalbeitrag und Grafik gelesen. Dieselbe Quellenfamilie wie S1, keine unabhängige Bestätigung."
    },
    {
      "id": "S3",
      "title": "Demystifying evals for AI agents",
      "publisher": "Anthropic",
      "date": "2026-01-09; geprüft am 08.10.2026",
      "url": "https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents",
      "supports": [
        "Klare Aufgaben- und Abnahmekriterien, wiederholte Durchläufe und Prüfung des tatsächlichen Ergebnisses"
      ],
      "method": "Primäre technische Anleitung, kein Beleg für das Ergebnis im MING-Projekt."
    }
  ],
  "faqs": [
    {
      "q": "Sind mehr Übergaben an Menschen gut oder schlecht?",
      "a": "Das hängt davon ab, welche Fälle vorher anders behandelt wurden und ob die Übergabe funktioniert. Eine gefährliche Vermutung abzufangen kann ein Fortschritt sein. Unnötige Rückgaben alltäglicher Aufgaben können das Team überlasten. Vergleichen Sie dieselben Aufgaben, prüfen Sie den Grund jeder Übergabe und messen Sie, ob ein Mensch sie rechtzeitig erhält und bearbeitet."
    },
    {
      "q": "Belegen 20 Testaufträge die Zuverlässigkeit eines Agenten?",
      "a": "Nein. Die berichtete Stichprobe erklärt eine Entwicklungsentscheidung. Sie belegt keine Zuverlässigkeit über den gesamten produktiven Betrieb. Wählen Sie Testfälle passend zur Aufgabe und den möglichen Fehlerfolgen, nehmen Sie gewöhnliche und schwierige Fälle auf und wiederholen Sie Durchläufe. Trennen Sie diese Tests von der Beobachtung des laufenden Betriebs."
    },
    {
      "q": "Heißt vollständig richtig, dass der Auftrag automatisch gebucht wurde?",
      "a": "In diesem Fall nicht. Der Agent bereitete Auftragsentwürfe vor und buchte nie selbstständig. Vollständig richtig bezieht sich auf die Felder im Entwurf. Benennen Sie bei Ihrer Messung das tatsächlich abgenommene Ergebnis: Ein Entwurf, eine von einem Menschen freigegebene Buchung und ein ausgelieferter Auftrag sind verschiedene Dinge."
    },
    {
      "q": "Welche Kennzahl sollten wir zuerst verbessern?",
      "a": "Vereinbaren Sie das mit der Person, die den Prozess verantwortet. Beginnen Sie bei unzulässigen Fehlern und ihren Folgen. Beurteilen Sie danach brauchbare Ergebnisse, menschlichen Aufwand und Bearbeitungszeit gemeinsam. Im berichteten Projekt war vorab vereinbart, dass keine unbemerkt falschen Daten übernommen werden dürfen. Das bedeutet nicht, dass bereits alle Fehler beseitigt waren."
    }
  ],
  "parentArticleSlug": null,
  "relatedConceptSlugs": [
    "what-is-hybrid-organisation"
  ],
  "relatedArticleSlugs": [],
  "metadata": {
    "title": "Woran erkennen Sie, ob ein KI-Agent besser wird? — MING Labs",
    "description": "Ein berichteter Test mit 20 Aufträgen zeigt, was die Trefferquote verdeckt, welche Kennzahlen bei KI-Agenten helfen und wann eine Änderung mehr Fehler zulässt.",
    "canonical": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
    "inLanguage": "de",
    "openGraph": {
      "title": "Woran erkennen Sie, ob ein KI-Agent besser wird?",
      "description": "Ein berichteter Test mit 20 Aufträgen zeigt, was die Trefferquote verdeckt, welche Kennzahlen bei KI-Agenten helfen und wann eine Änderung mehr Fehler zulässt.",
      "url": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird",
      "image": "https://www.minglabs.com/og/ki-agent-qualitaet.png"
    },
    "twitter": {
      "card": "summary_large_image",
      "title": "Woran erkennen Sie, ob ein KI-Agent besser wird?",
      "description": "Ein berichteter Test mit 20 Aufträgen zeigt, was die Trefferquote verdeckt, welche Kennzahlen bei KI-Agenten helfen und wann eine Änderung mehr Fehler zulässt.",
      "image": "https://www.minglabs.com/og/ki-agent-qualitaet.png"
    }
  },
  "actions": [
    {
      "id": "navigation",
      "label": "Kontakt (EN)",
      "accessibleName": "Kontakt (EN)",
      "kind": "navigate",
      "requiresBrowser": false,
      "url": "https://www.minglabs.com/contact"
    },
    {
      "id": "copy-briefing",
      "label": "Antwort für meine KI kopieren",
      "accessibleName": "Antwort für meine KI kopieren",
      "kind": "copy",
      "requiresBrowser": true,
      "contentUrl": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird.md"
    }
  ],
  "markdownUrl": "https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird.md",
  "contentMarkdown": "---\ntitle: \"Woran erkennen Sie, ob ein KI-Agent besser wird? — MING Labs\"\ndescription: \"Ein berichteter Test mit 20 Aufträgen zeigt, was die Trefferquote verdeckt, welche Kennzahlen bei KI-Agenten helfen und wann eine Änderung mehr Fehler zulässt.\"\ncanonical: https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird\nlang: de\nlast-updated: 2026-10-08\n---\n\n# Woran erkennen Sie, ob ein KI-Agent besser wird?\n\n[Start (EN)](/)  [Insights (EN)](/insights)  [Antworten (EN)](/insights/answers)  Woran erkennen Sie, ob ein KI-Agent besser wird?\n\n[English](/insights/answers/which-metrics-show-whether-an-ai-agent-is-improving)[Deutsch](/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird)\n\nAntwort\n\n\n\nZählen Sie bei denselben Testfällen getrennt, was vollständig richtig war, was korrekt an Menschen übergeben wurde und was falsch blieb. Prüfen Sie außerdem fehlende Eingänge, Wartezeit und menschlichen Prüfaufwand. In unserem berichteten Test mit 20 Aufträgen sank die Zahl falscher Entwürfe von sieben auf vier. Die Zahl vollständig richtiger blieb bei sieben. Das ist ein Fortschritt, belegt aber keine Freigabe zum selbstständigen Buchen.[\\[S1\\]](#source-s1)[\\[S2\\]](#source-s2)\n\nBerichteter MING-Fall · Juni 2026 · 20 Testaufträge\n\nBei denselben 20 Aufträgen entstanden weniger falsche Entwürfe.\n\nDieselben 20 Testaufträge vor und nach der Überarbeitung:\n\n| Ergebnis | Vorher | Nachher |\n| --- | --- | --- |\n| Vollständig richtig | 7 | 7 |\n| Korrekt übergeben | 6 | 9 |\n| Falsch | 7 | 4 |\n\nVollständig richtig blieben 7 von 20 (35%). Falsche Entwürfe sanken von 7 auf 4; korrekt übergebene Fälle stiegen von 6 auf 9. Das sind berichtete Entwurfsergebnisse aus einem Projekt, keine automatisch gebuchten Aufträge. [Veröffentlichter Projektbericht](https://medium.com/the-hybrid-company/every-fix-worked-the-accuracy-number-never-moved-3589daa95750).\n\nAktualisiert: Oktober 2026 | Nächste Prüfung: Januar 2027 Veröffentlichte MING-Erfahrung [Maschinenlesbare Fassung ](/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird.json)\n\nVon MING Labs · Redaktion\n\nDie Antwort im Überblick\n\n1.  [Bei denselben Aufträgen entstanden weniger falsche Entwürfe.](#orders)\n2.  [Eine Übergabe hilft erst, wenn jemand damit weiterarbeiten kann.](#handover)\n3.  [Prüfen Sie, was eine schönere Kennzahl kosten würde.](#trade)\n\n## 01 Sieben richtige Entwürfe verdeckten den Rückgang der Fehler\n\nSie haben eine weitere Überarbeitung bezahlt und möchten wissen, ob der Agent seine Arbeit jetzt besser macht. Im Bericht stehen weiterhin sieben vollständig richtige Ergebnisse. Bevor Sie daraus schließen, dass es nicht vorangeht, lohnt sich ein Blick auf die übrigen Fälle.\n\nGenau das haben wir bei einem Agenten erlebt, der Auftragsentwürfe für einen Industriehändler in Deutschland vorbereitet. Er liest eingehende Bestellungen und gleicht sie mit dem Katalog ab. Gebucht wird weiterhin von Menschen. Nach drei Überarbeitungen lieferten dieselben 20 Testaufträge noch immer sieben vollständig richtige Entwürfe. Die Zahl falscher Entwürfe sank jedoch von sieben auf vier; korrekt an Menschen übergebene Fälle stiegen von sechs auf neun. Unser veröffentlichter Projektbericht beschreibt die Arbeit aus dem Juni 2026.[\\[S1\\]](#source-s1)[\\[S2\\]](#source-s2)\n\nDer Anteil vollständig richtiger Entwürfe lag damit vorher wie nachher bei 35%. Die Rechnung stimmt. Sie lässt aber eine Veränderung aus, die für die Auftragsbearbeitung wichtig ist: Weniger Fälle endeten mit einer falschen Antwort. Wer nur die 35% betrachtet, kann diesen Fortschritt übersehen. Wer nur die steigenden Übergaben betrachtet, kann übersehen, wie viel zusätzliche Arbeit beim Team landet.\n\nDeshalb gehören die drei Zahlen zusammen. Erst danach lässt sich beurteilen, was das Ergebnis für die Menschen bedeutet, die damit weiterarbeiten.\n\n## 02 Eine korrekte Übergabe muss bei einer zuständigen Person ankommen\n\nIm Auftragsbeispiel heißt „vollständig richtig“: Alle erforderlichen Felder des Entwurfs stimmen, ohne dass ein Mensch sie korrigieren muss. „Korrekt übergeben“ heißt: Der Agent erkennt, was er nicht entscheiden kann, und gibt den Fall samt Quelle an die richtige Person weiter. „Falsch“ heißt: Er entscheidet, und das Ergebnis erfüllt die vereinbarten Kriterien nicht.[\\[S1\\]](#source-s1)\n\nNehmen wir als Beispiel eine Bestellung mit unklarer Kundennummer. Rät der Agent eine plausibel wirkende Nummer, kann daraus ein falscher Datensatz werden. Gibt er die ursprüngliche Bestellung mit der offenen Frage an die zuständige Kollegin weiter, kann sie den Fall klären. Dieser Unterschied ist wichtig, obwohl keiner der beiden Wege sofort einen brauchbaren Entwurf liefert.\n\nDer Status „übergeben“ reicht dafür allerdings nicht aus. Prüfen Sie, wer den Fall erhalten hat, ob die Bestellung beiliegt und ob die Nachricht rechtzeitig ankam. Bleibt sie in einem unbeaufsichtigten Postfach liegen, hat die Übergabe ihren Zweck verfehlt. Erfassen Sie diesen Fehler, statt den Fall als erfolgreich übergeben zu zählen.\n\nEbenso wenig sollte ein Agent jeden gewöhnlichen Fall zurückgeben. Lesen Sie die Gründe für die wachsende mittlere Gruppe. Manche zeigen angemessene Vorsicht. Andere zeigen fehlende Daten, unnötige Einschränkungen oder eine Aufgabe, die der Agent noch nicht beherrscht. Die Zahl zeigt Ihnen, wo Sie nachsehen sollten. Die Bewertung nimmt sie Ihnen nicht ab.\n\n## 03 Wir lehnten eine Änderung ab, die mehr falsche Entwürfe erzeugt hätte\n\nUnser Werkzeug schlug vor, einen Schwellenwert zu senken, ab dem der Agent einen Entwurf als ausreichend sicher behandelt. Damit sollten mehr fehlerfreie Entwürfe entstehen. Wir haben die Änderung zunächst simuliert. Laut Projektbericht hätte sie vier zusätzliche fehlerfreie Entwürfe geliefert, zugleich aber zwei weitere Entwürfe mit falschen Daten. Wir verwarfen den Vorschlag: Für das Projekt war vorher festgelegt worden, dass keine unbemerkt falschen Daten übernommen werden dürfen.[\\[S1\\]](#source-s1)\n\nDas waren Ergebnisse einer Simulation. Wir haben diese Änderung nicht ausgeliefert; die Zahlen beschreiben keine zwei falsch gebuchten Aufträge im produktiven Betrieb. Sie erklären, warum eine schönere Kennzahl zu einer schlechten Freigabeentscheidung geführt hätte.\n\nHalten Sie vor einer solchen Änderung fest, welchen Tausch Sie akzeptieren würden. Welche Fehler verhindern eine Freigabe? Wer prüft die weiterhin unklaren Fälle? Wer darf dem Agenten mehr Entscheidungsfreiheit geben? Legen Sie diese Vereinbarung neben die Ergebnisse. So kann ein höherer Wert nicht stillschweigend die ursprüngliche Grenze ersetzen.\n\n## 04 Vergleichen Sie dieselben Aufgaben und prüfen Sie fehlende Eingänge\n\nHalten Sie beim nächsten Test die Eingaben, Abnahmekriterien und Betriebsbedingungen fest. Eine andere Mischung von Aufträgen kann die Kennzahl verändern, ohne dass Sie wissen, ob Ihre Änderung geholfen hat. Auch Anthropics Anleitung zur Agentenbewertung empfiehlt wiederholte Durchläufe und die Prüfung des tatsächlichen Ergebnisses. Der Bericht des Agenten über seine Arbeit reicht dafür nicht aus.[\\[S3\\]](#source-s3)\n\nDie drei Gruppen erfassen die bewerteten Fälle, nicht automatisch alles, was im Unternehmen hätte bearbeitet werden sollen. Gleichen Sie erwartete Eingänge damit ab, was den Agenten tatsächlich erreicht hat. Halten Sie fehlende Eingänge, abgebrochene Durchläufe und noch nicht bewertete Fälle gesondert sichtbar. Sie dürfen weder aus der Bezugsgröße verschwinden noch als richtig gelten. Unsere Antwort zum [Protokoll eines KI-Agenten](/de/insights/answers/was-gehoert-in-das-protokoll-eines-ki-agenten) zeigt, wie Auftrag und tatsächliches Ergebnis zusammenfinden.\n\nBetrachten Sie anschließend die Arbeit der Menschen. Wie lange warten übergebene Fälle? Wie viele Minuten braucht jemand, um Entwürfe zu prüfen und zu korrigieren? Kommt die fertige Arbeit rechtzeitig an? Erfassen Sie diese Werte neben den drei Fallzahlen. Die Antwort zu den [laufenden Kosten eines Agenten](/de/insights/answers/was-kostet-ein-ki-agent-im-laufenden-betrieb) erklärt, warum brauchbare Ergebnisse und menschlicher Aufwand in dieselbe Betriebsentscheidung gehören.\n\n| Was sichtbar bleiben muss | Vor dem Vergleich festlegen |\n| --- | --- |\n| Vollständig richtig, korrekt übergeben, falsch | Anzahl und Anteil an derselben bewerteten Fallgruppe; Kriterien für jede Kategorie. |\n| Fehlende oder unfertige Arbeit | Erwartete und tatsächlich eingegangene Aufgaben sowie noch nicht bewertete Fälle. |\n| Menschlicher Prüfaufwand | Minuten je Fall einschließlich Korrekturen; benennen, welche Fälle erfasst sind. |\n| Wartezeit und Abschluss | Zeit vom Eingang bis zum vereinbarten Ergebnis und am Stichtag noch offene Fälle. |\n\n## 05 Prüfen Sie eine Fallgruppe gemeinsam mit der Person, die die Arbeit abnimmt\n\nWählen Sie eine dokumentierte Gruppe jüngerer Fälle und ordnen Sie sie gemeinsam mit der fachlich verantwortlichen Person ein. Vereinbaren Sie vor der Bewertung, was als richtig zählt. Prüfen Sie jede angeblich erfolgreiche Übergabe in dieser Gruppe und lassen Sie ungeklärte Bewertungen offen. Der Quellenartikel schlägt als Einstieg hundert Fälle vor. Das ist eine Übung, keine allgemeingültige Stichprobengröße und kein Versprechen, dass ein Nachmittag dafür reicht.[\\[S1\\]](#source-s1)\n\nEntscheiden Sie anhand der Ergebnisse, was als Nächstes geändert werden muss: eine Datenlücke schließen, eine Übergabe verbessern, eine Grenze enger setzen oder eine Fähigkeit erneut testen. Unsere Antwort zur [Abnahme eines KI-Agenten](/de/insights/answers/wie-pruefen-sie-einen-ki-agenten-vor-dem-produktiven-einsatz) hilft, daraus einen begrenzten Test zu machen. Wenn MING Sie dabei unterstützen soll, bringen Sie die Aufgabe, die drei Fallzahlen und einen strittigen Fall in ein [Gespräch über Ihre Hybrid-Organisation](/hybrid-organisation) mit.\n\nWas der Vergleich belegt\n\n-   Der Vergleich mit 20 Aufträgen ist veröffentlichte MING-Erfahrung aus einem Projekt. Die zugrunde liegenden Protokolle sind privat und werden hier nicht unabhängig nachgeprüft. Beitrag und Artikel gehören zur selben Quellenfamilie.\n-   Gezählt wurden Entwürfe. Die separate Stichprobe mit 115 Aufträgen im Quellenartikel ist hier nicht die Bezugsgröße. Aus den Gesamtzahlen lässt sich nicht ablesen, welche einzelnen Fälle die Gruppe gewechselt haben.\n-   Die vorgeschlagenen Kennzahlen und Prüfschritte belegen weder eine allgemeine Zuverlässigkeit noch eingesparte Zeit oder eine Freigabe für mehr Autonomie. Mehr Übergaben sind nur dann nützlich, wenn sie der Aufgabe dienen und das Team sie bewältigen kann.\n\nKurzantwort zum Zitieren\n\nMING Labs empfiehlt, vollständig richtige Ergebnisse, korrekte Übergaben an Menschen und falsche Ergebnisse an denselben Aufgaben mit klaren Abnahmekriterien zu vergleichen. Eine unveränderte Trefferquote kann weniger falsche Entwürfe verdecken. Mehr Übergaben können zugleich das Team stärker belasten. Prüfen Sie deshalb, ob sie rechtzeitig bei der zuständigen Person ankommen, und erfassen Sie fehlende Eingänge sowie Prüfaufwand gesondert.\n\nDieselben 20 Testaufträge aus einem Projekt im Juni 2026. Berichtete Entwurfsergebnisse, keine allgemeine Zuverlässigkeitsquote oder automatische Verbuchung.\n\n## Quellen\n\n\\[S1\\]\n\n[Every fix worked. The accuracy number never moved.](https://medium.com/the-hybrid-company/every-fix-worked-the-accuracy-number-never-moved-3589daa95750) Sebastian Mueller, The Hybrid Company / Medium · 2026-09-30 Belegt: Berichtete Auftragsentwürfe aus Juni 2026, Definitionen, Beschränkung auf Entwürfe und verworfene Schwellenwert-Simulation Veröffentlichte MING-Erfahrung. Vollständigen Originalartikel und sechs Grafiken erneut gelesen. Technische Protokolle sind privat und nicht unabhängig geprüft.\n\n\\[S2\\]\n\n[The same 20 test orders, before and after](https://www.linkedin.com/posts/smueller1512_ai-agents-transformation-share-7511712327352635395-HY12/) Sebastian Mueller, LinkedIn · Abgerufen am 08.10.2026; Anzeige: 5 Tage Belegt: Ausdrückliche Bestätigung, dass vorher und nachher dieselben 20 Testaufträge bewertet wurden Vollständigen Originalbeitrag und Grafik gelesen. Dieselbe Quellenfamilie wie S1, keine unabhängige Bestätigung.\n\n\\[S3\\]\n\n[Demystifying evals for AI agents](https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents) Anthropic · 2026-01-09; geprüft am 08.10.2026 Belegt: Klare Aufgaben- und Abnahmekriterien, wiederholte Durchläufe und Prüfung des tatsächlichen Ergebnisses Primäre technische Anleitung, kein Beleg für das Ergebnis im MING-Projekt.\n\n## Häufige Fragen\n\nSind mehr Übergaben an Menschen gut oder schlecht?\n\nDas hängt davon ab, welche Fälle vorher anders behandelt wurden und ob die Übergabe funktioniert. Eine gefährliche Vermutung abzufangen kann ein Fortschritt sein. Unnötige Rückgaben alltäglicher Aufgaben können das Team überlasten. Vergleichen Sie dieselben Aufgaben, prüfen Sie den Grund jeder Übergabe und messen Sie, ob ein Mensch sie rechtzeitig erhält und bearbeitet.\n\nBelegen 20 Testaufträge die Zuverlässigkeit eines Agenten?\n\nNein. Die berichtete Stichprobe erklärt eine Entwicklungsentscheidung. Sie belegt keine Zuverlässigkeit über den gesamten produktiven Betrieb. Wählen Sie Testfälle passend zur Aufgabe und den möglichen Fehlerfolgen, nehmen Sie gewöhnliche und schwierige Fälle auf und wiederholen Sie Durchläufe. Trennen Sie diese Tests von der Beobachtung des laufenden Betriebs.\n\nHeißt vollständig richtig, dass der Auftrag automatisch gebucht wurde?\n\nIn diesem Fall nicht. Der Agent bereitete Auftragsentwürfe vor und buchte nie selbstständig. Vollständig richtig bezieht sich auf die Felder im Entwurf. Benennen Sie bei Ihrer Messung das tatsächlich abgenommene Ergebnis: Ein Entwurf, eine von einem Menschen freigegebene Buchung und ein ausgelieferter Auftrag sind verschiedene Dinge.\n\nWelche Kennzahl sollten wir zuerst verbessern?\n\nVereinbaren Sie das mit der Person, die den Prozess verantwortet. Beginnen Sie bei unzulässigen Fehlern und ihren Folgen. Beurteilen Sie danach brauchbare Ergebnisse, menschlichen Aufwand und Bearbeitungszeit gemeinsam. Im berichteten Projekt war vorab vereinbart, dass keine unbemerkt falschen Daten übernommen werden dürfen. Das bedeutet nicht, dass bereits alle Fehler beseitigt waren.\n\n## Begriffe erklärt\n\n[What is a Hybrid Organisation? (Englisch)](/insights/concepts/what-is-hybrid-organisation)\n\n## Verfügbare Aktionen\n\n- **Antwort für meine KI kopieren**: kopiert die [vollständige Antwort](https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird.md) im Browser in die Zwischenablage.\n\n---\n\nCanonical: https://www.minglabs.com/de/insights/answers/woran-erkennen-sie-ob-ein-ki-agent-besser-wird\nMaschinenlesbarer Index: https://www.minglabs.com/llms.txt\n"
}
