---
title: "PoC eines KI-Agenten bewerten, bevor Sie skalieren"
description: "So bewerten Sie den Proof of Concept eines KI-Agenten: Erfolgskriterien, Testsets, Kosten, Latenz, menschliche Prüfung, Datengrenzen, Sicherheit, Fehlerbilder."
canonical: https://sdk.enterprises/de/insights/evaluating-an-ai-agent-proof-of-concept
language: de
---

# PoC eines KI-Agenten bewerten, bevor Sie skalieren

Aktualisiert: 2026-09-26

> Bewerten Sie den Proof of Concept (PoC) eines KI-Agenten anhand von Erfolgskriterien, die vor seinem Bau festgelegt wurden, und auf einem festen Satz echter Fälle, der auch die schwierigen enthält. Messen Sie Genauigkeit, Kosten pro Aufgabe und Latenz, prüfen Sie, auf welche Daten und Tools er zugreifen kann und wie er scheitert, und skalieren Sie erst, wenn die Ergebnisse auch außerhalb der Demo tragen.

## Eine überzeugende Demo ist kein Beweis

Eine Demo zeigt einen KI-Agenten von seiner besten Seite, denn sie läuft auf Beispielen, die seine Entwickler ausgewählt und geprobt haben. Vor dem Skalieren lautet die Frage anders: Wie oft erledigt der Agent echte Arbeit richtig, was kostet jede Aufgabe, und was passiert an den Tagen, an denen er danebenliegt?

Behandeln Sie den PoC als Experiment, das mit einer Entscheidung endet: skalieren, ändern oder stoppen. Diese Entscheidung braucht Kriterien, die feststehen, bevor die Ergebnisse vorliegen; sonst lässt sich fast jedes Ergebnis als vielversprechend deuten.

## Legen Sie die Erfolgskriterien fest, bevor der Agent gebaut wird

Definieren Sie, was für das Geschäft „gut genug“ bedeutet, und übersetzen Sie es in messbare Zahlen. Bei einem Agenten, der Supportanfragen sortiert, könnte das der Anteil der Anfragen sein, die beim richtigen Team landen, der Anteil, den er zu Recht nicht bearbeitet, und die Zeit, die ein Mensch für die Prüfung jeder Anfrage braucht.

- Erfolgsquote bei realistischen Fällen, mit einer schriftlichen Definition eines korrekten Ergebnisses
- Die Fehler, die Sie tolerieren können, und die, die Sie nicht tolerieren können, etwa eine falsche Antwort an einen Kunden
- Kosten pro erledigter Aufgabe, einschließlich Modellnutzung und der Zeit der Person, die die Arbeit prüft
- Eine Antwortzeit, die zum Ablauf passt, je nachdem, ob jemand auf die Antwort wartet
- Die Ausgangsbasis: wie lange Ihre Leute heute für die Aufgabe brauchen und wie oft sie ihnen richtig gelingt

## Testen Sie mit einem festen Evaluierungsset aus echten Fällen

Sammeln Sie echte Eingaben aus Ihrer eigenen Historie, halten Sie für jede das korrekte Ergebnis fest und lassen Sie das Set unverändert. Nehmen Sie einfache, mehrdeutige und seltene Fälle auf sowie einige, die der Agent ablehnen sollte. Ein kleineres Set gut gewählter Fälle sagt mehr aus als ein großes Set einfacher Fälle.

Lassen Sie den Agenten jedes Mal über das gesamte Set laufen, wenn sich Prompt, Modell, Tools oder Daten ändern, und vergleichen Sie die Ergebnisse mit dem vorherigen Lauf. Modellausgaben schwanken von Lauf zu Lauf: Führen Sie jeden Fall mehrmals aus und achten Sie auf Konstanz, nicht nur auf die beste Antwort. Halten Sie die Fälle aus dem Prompt und aus allen Beispielen heraus, die der Agent sieht, sonst schönt das den Wert.

Prüfen Sie auch, wie Sie bewerten. Automatische Prüfungen funktionieren bei strukturierten Ausgaben. Freitext braucht meist einen Menschen oder ein zweites Modell, dessen Urteile Sie an einer Stichprobe mit denen eines Menschen verglichen haben.

## Messen Sie Kosten und Latenz beim erwarteten Volumen

Ein PoC, der ein paar Dutzend Anfragen am Tag bearbeitet, kann Kosten verbergen, die bei Tausenden ins Gewicht fallen. Erfassen Sie pro Aufgabe die Modellaufrufe, Tokens und Tool-Aufrufe sowie die Dauer. Agenten, die in Schleifen laufen, Versuche wiederholen oder lange Dokumente lesen, können bei manchen Eingaben weit mehr kosten als der Durchschnitt. Untersuchen Sie deshalb die langsamsten und teuersten Fälle, nicht nur den Mittelwert.

Rechnen Sie die Kosten dann auf Ihr erwartetes Volumen hoch und vergleichen Sie sie mit dem, was die Arbeit heute kostet, einschließlich der Zeit, die Menschen weiterhin mit der Prüfung verbringen. Setzen Sie pro Aufgabe harte Grenzen für Schritte, Tokens und Zeit, damit eine einzige fehlerhafte Eingabe keine hohe Rechnung verursachen kann. Die OWASP Top 10 for LLM Applications führen dieses Risiko als „Unbounded Consumption“, also unbegrenzten Verbrauch.

## Gestalten Sie die menschliche Prüfung bewusst und messen Sie sie

Die menschliche Prüfung ist Teil des Designs, kein vorübergehendes Sicherheitsnetz. Entscheiden Sie, welche Aktionen der Agent selbst ausführen darf, welche er nur vorschlagen darf und welche er nie ausführen darf. Alles Unumkehrbare oder für Kunden Sichtbare, etwa eine Nachricht senden, einen Datensatz ändern oder Geld ausgeben, sollte auf die Freigabe eines Menschen warten, bis sich der Agent lange bewährt hat.

Messen Sie die Prüfung selbst: wie lange sie dauert, wie oft die Prüfenden das Ergebnis ändern und wie oft sie ohne echte Kontrolle freigeben. Wenn die Prüfung fast so lange dauert wie die Aufgabe selbst, spart der Agent noch keine Zeit. Falls Ihr Anwendungsfall nach der KI-Verordnung der EU (AI Act) als hochriskant gelten könnte, ist eine wirksame menschliche Aufsicht nach Artikel 14 eine gesetzliche Pflicht und keine Designvorliebe. Ziehen Sie daher früh Ihre Rechtsberatung hinzu.

## Setzen Sie Daten- und Sicherheitsgrenzen, bevor Sie skalieren

Skalierung bringt mehr Daten, mehr Nutzer und mehr Tools, und genau dann werden schwache Grenzen zum Problem. Die OWASP Top 10 for LLM Applications führen Prompt Injection an erster Stelle: Text, den der Agent liest, etwa eine E-Mail, ein Ticket oder eine Webseite, kann Anweisungen enthalten, die ihn umlenken. Sie nennen auch „Excessive Agency“, also mehr Funktionen, Berechtigungen oder Autonomie, als die Aufgabe erfordert. Klären Sie diese Punkte, bevor der Pilot wächst.

- Welche Daten der Agent lesen darf und ob personenbezogene oder vertrauliche Daten an einen Modellanbieter gehen, unter welchem Vertrag und mit welchen Aufbewahrungsregeln
- Welche Tools er aufrufen darf, mit den engsten Berechtigungen und eigenen Zugangsdaten für jeden Agenten
- Was er ändern darf und ob sich jede Änderung nachverfolgen und rückgängig machen lässt
- Was protokolliert wird: jeder Tool-Aufruf mit Ein- und Ausgaben, ohne dass personenbezogene Daten nach außen gelangen
- Wie die Daten jedes Kunden oder Teams von denen der anderen getrennt bleiben

## Untersuchen Sie, wie er scheitert, und entscheiden Sie dann

Lesen Sie vor der Entscheidung die Fehlschläge, nicht nur die Punktzahl. Ordnen Sie sie nach Art: selbstbewusst falsche Antworten, berechtigte Ablehnungen, ausgelassene Schritte, falsche Tool-Nutzung, Zeitüberschreitungen. Ein Agent, der scheitert, indem er um Hilfe bittet, lässt sich weit leichter einsetzen als einer, der still mit einer plausiblen Antwort scheitert.

Dann entscheiden Sie. Skalieren Sie, wenn die Kriterien auf dem Evaluierungsset erfüllt sind und Ihr Prozess die verbleibenden Fehler auffangen kann. Verkleinern Sie den Umfang, wenn der Agent nur bei einem Teil der Aufgabe gut abschneidet. Stoppen Sie, wenn er die Ausgangsbasis nicht übertrifft, und bewahren Sie das Evaluierungsset für den nächsten Versuch auf. Unsere KI-Agenten-Projekte folgen derselben Abfolge: eine Aufgabe, echte Beispiele, Prüfung durch Ihr Team und mehr Umfang erst, wenn sich der Agent Vertrauen erarbeitet hat. Wenn Sie einen PoC bewerten lassen möchten, können Sie ihn über unser Formular „Projekt starten“ beschreiben.

## Das Wichtigste in Kürze

- Legen Sie Erfolgskriterien und eine Ausgangsbasis fest, bevor der Agent gebaut wird, damit sich das Ergebnis ehrlich beurteilen lässt.
- Testen Sie auf einem festen Set echter Fälle, einschließlich schwieriger und mehrdeutiger, und wiederholen Sie den Test nach jeder Änderung.
- Messen Sie Kosten pro Aufgabe und Latenz beim erwarteten Volumen, mit Blick auf die schlechtesten Fälle ebenso wie auf den Durchschnitt.
- Gestalten Sie die menschliche Prüfung bewusst und messen Sie, wie lange sie dauert und was sie findet.
- Setzen Sie vor dem Skalieren Grenzen für Daten, Tools und Protokollierung, denn Prompt Injection und Excessive Agency sind bekannte Risiken.

## FAQ

### Wie viele Fälle braucht ein Evaluierungsset für einen KI-Agenten?

Es gibt keine feste Zahl. Es braucht genug Fälle, um die wichtigsten Varianten der Aufgabe abzudecken, die schwierigen und mehrdeutigen Fälle und die, die der Agent ablehnen sollte. Beginnen Sie mit dem, was Sie sorgfältig annotieren können, und fügen Sie jeden echten Fehlschlag hinzu, den Sie später finden.

### Kann ein anderes Modell die Ausgaben des Agenten bewerten?

Ja, bei Freitext-Ausgaben, die sich schwer automatisch prüfen lassen, aber erst, nachdem Sie seine Urteile an einer Stichprobe mit denen eines Menschen verglichen haben. Prüfen Sie diese Übereinstimmung erneut, sobald Sie Modell oder Prompt ändern.

### Wann sollte man den PoC eines KI-Agenten abbrechen?

Wenn er die heutige Arbeitsweise gemessen an Ihren Erfolgskriterien nicht übertrifft oder wenn die nötige Prüfung so viel Zeit kostet, wie er spart. Ein klarer Abbruch ist ein nützliches Ergebnis: Bewahren Sie das Evaluierungsset auf, denn ein neueres Modell oder eine enger gefasste Aufgabe besteht es vielleicht später.

## Starten Sie bei Ihrem Bedarf

- [KI für KMU](https://sdk.enterprises/de/ai-for-smes)
- [Kostenloses KI-Audit](https://sdk.enterprises/de/free-ai-audit)

## Passende Leistungen

- [KI-Agenten](https://sdk.enterprises/de/services/ai-agents)
- [Anwendungssicherheit](https://sdk.enterprises/de/services/secure-systems)

## Weiterlesen

- [KI-Agenten sicher einsetzen: Code-Review, Tests, Deployment](https://sdk.enterprises/de/insights/ai-agents-engineering-workflows)
- [API-Sicherheit: sensible und regulierte Daten schützen](https://sdk.enterprises/de/insights/securing-regulated-data-apis)
