Proof of concept AI agenta posuzujte podle kritérií úspěchu sepsaných ještě před jeho vývojem, na pevné sadě skutečných případů, včetně těch obtížných. Změřte přesnost, náklady na úlohu a latenci, ověřte, k jakým datům a nástrojům má přístup a jak selhává, a rozšiřujte ho, jen když výsledky obstojí i mimo ukázku.
Přesvědčivá ukázka není důkaz
Ukázka předvádí AI agenta v jeho nejlepší podobě, protože běží na příkladech, které autoři vybrali a nacvičili. Před rozšířením je otázka jiná: jak často agent zvládne skutečnou práci správně, kolik stojí každá úloha a co se děje ve dnech, kdy se mýlí?
Berte proof of concept jako experiment, který končí rozhodnutím: rozšířit, upravit, nebo zastavit. Takové rozhodnutí potřebuje kritéria sepsaná dřív, než přijdou výsledky; jinak se dá téměř jakýkoli výsledek vyložit jako slibný.
Kritéria úspěchu sepište dřív, než agent vznikne
Definujte, co pro firmu znamená „dost dobré“, a převeďte to na měřitelná čísla. U agenta, který třídí požadavky na podporu, to může být podíl požadavků přidělených správnému týmu, podíl těch, které správně odmítne zpracovat, a čas, který člověk stráví kontrolou každého z nich.
- Úspěšnost úloh na realistických případech, s písemnou definicí správného výsledku
- Chyby, které snesete, a ty, které ne, například špatnou odpověď odeslanou zákazníkovi
- Náklady na dokončenou úlohu, včetně využití modelu a času člověka, který práci kontroluje
- Doba odezvy odpovídající pracovnímu postupu, podle toho, zda na odpověď někdo čeká
- Výchozí stav: jak dlouho dnes úloha trvá lidem a jak často ji dělají správně
Testujte na pevné vyhodnocovací sadě ze skutečných případů
Shromážděte skutečné vstupy z vlastní historie, ke každému zaznamenejte správný výsledek a sadu neměňte. Zařaďte snadné případy, nejednoznačné, vzácné a několik takových, které by agent měl odmítnout. Menší sada dobře vybraných případů vám řekne víc než velká sada snadných.
Spusťte agenta na celé sadě pokaždé, když se změní prompt, model, nástroje nebo data, a výsledky porovnejte s předchozím během. Výstupy modelu se mezi běhy liší, proto každý případ spusťte víckrát a sledujte konzistenci, ne jen nejlepší odpověď. Případy nedávejte do promptu ani do příkladů, které agent vidí, jinak mu skóre bude lichotit.
Zkontrolujte i způsob hodnocení. Automatické kontroly fungují u strukturovaných výstupů. Volný text obvykle potřebuje člověka, nebo druhý model, jehož úsudky jste na vzorku porovnali s úsudky člověka.
Náklady a latenci měřte při objemu, který očekáváte
Proof of concept, který zpracuje pár desítek požadavků denně, může skrývat náklady, které při tisících začnou hrát roli. Zaznamenávejte volání modelu, tokeny a volání nástrojů na úlohu a dobu trvání každé úlohy. Agenti, kteří se zacyklí, opakují pokusy nebo čtou dlouhé dokumenty, mohou u některých vstupů stát mnohem víc než průměr, proto zkoumejte nejpomalejší a nejdražší případy, ne jen průměr.
Pak odhadněte náklady při očekávaném objemu a porovnejte je s tím, kolik práce stojí dnes, včetně času, který lidé budou dál trávit kontrolou. Nastavte pevné limity na úlohu pro kroky, tokeny a čas, aby jeden špatný vstup nemohl způsobit vysoký účet. OWASP Top 10 for LLM Applications toto riziko uvádí jako neomezenou spotřebu (unbounded consumption).
Kontrolu člověkem navrhněte záměrně a pak ji měřte
Kontrola člověkem je součástí návrhu, ne dočasnou záchrannou sítí. Rozhodněte, které akce smí agent provést sám, které smí jen navrhnout a které nesmí provést nikdy. Vše nevratné nebo viditelné pro zákazníky, například odeslání zprávy, změna záznamu nebo utracení peněz, by mělo čekat na schválení člověkem, dokud agent nemá za sebou dlouhou řadu úspěchů.
Měřte i samotnou kontrolu: jak dlouho trvá, jak často kontrolující výstup mění a jak často schvalují, aniž by skutečně kontrolovali. Pokud kontrola trvá skoro stejně dlouho jako samotná úloha, agent zatím čas nešetří. Pokud by váš případ užití mohl podle evropského aktu o umělé inteligenci (AI Act) spadat mezi vysoce rizikové, je účinný lidský dohled podle článku 14 zákonnou povinností, ne volbou při návrhu, proto zapojte své právní poradce včas.
Hranice pro data a bezpečnost nastavte před rozšířením
Rozšíření přináší víc dat, víc uživatelů a víc nástrojů, a právě tehdy začnou slabé hranice vadit. OWASP Top 10 for LLM Applications řadí na první místo prompt injection: text, který agent čte, například e-mail, tiket nebo webová stránka, může nést instrukce, které ho odkloní. Uvádí také nadměrnou autonomii (excessive agency), tedy víc funkcí, oprávnění nebo samostatnosti, než úloha potřebuje. Tyto body vyřešte dřív, než pilot poroste.
- Která data agent smí číst a zda osobní nebo důvěrná data odcházejí k poskytovateli modelu, podle jaké smlouvy a podmínek uchovávání
- Které nástroje smí volat, s co nejužšími oprávněními a samostatnými přístupovými údaji pro každého agenta
- Co smí měnit a zda lze každou změnu dohledat a vrátit
- Co se zaznamenává: každé volání nástroje s jeho vstupy a výstupy, bez úniku osobních údajů
- Jak jsou data každého zákazníka nebo týmu oddělena od dat ostatních
Prostudujte, jak selhává, a pak rozhodněte
Před rozhodnutím si přečtěte selhání, ne jen skóre. Roztřiďte je podle typu: sebejisté špatné odpovědi, správná odmítnutí, vynechané kroky, špatné použití nástroje, vypršení času. Agent, který při selhání požádá o pomoc, se nasazuje mnohem snáz než agent, který selže potichu s věrohodně vypadající odpovědí.
Pak rozhodněte. Rozšiřte ho, pokud jsou kritéria na vyhodnocovací sadě splněna a zbývající selhání váš proces unese. Zužte rozsah, pokud agent zvládá dobře jen část úlohy. Zastavte ho, pokud nepřekoná výchozí stav, a vyhodnocovací sadu si ponechte pro další pokus. Naše projekty AI agentů mají stejný postup: jedna úloha, skutečné příklady, kontrola vaším týmem a širší působnost teprve tehdy, když si agent důvěru zaslouží. Pokud máte proof of concept, který je potřeba posoudit, můžete ho popsat v našem formuláři pro zadání projektu.
Hlavní body
- Kritéria úspěchu a výchozí stav sepište dřív, než agent vznikne, aby se výsledek dal posoudit poctivě.
- Testujte na pevné sadě skutečných případů, včetně obtížných a nejednoznačných, a po každé změně ji spusťte znovu.
- Náklady na úlohu a latenci měřte při očekávaném objemu a sledujte nejhorší případy stejně jako průměr.
- Kontrolu člověkem navrhněte záměrně a měřte, jak dlouho trvá a co zachytí.
- Hranice pro data, nástroje a logování nastavte před rozšířením, protože prompt injection a nadměrná autonomie jsou známá rizika.
Časté dotazy
Kolik případů potřebuje vyhodnocovací sada pro AI agenta?
Pevný počet neexistuje. Potřebuje dost případů, aby pokryla hlavní varianty úlohy, ty obtížné a nejednoznačné a ty, které by agent měl odmítnout. Začněte tím, co dokážete pečlivě označit, a každé skutečné selhání, na které později narazíte, přidejte.
Může výstup agenta hodnotit jiný model?
Ano, u volného textu, který se těžko kontroluje automaticky, ale až poté, co jste jeho úsudky porovnali s úsudky člověka na vzorku případů. Tuto shodu ověřte znovu pokaždé, když změníte model nebo prompt.
Kdy proof of concept AI agenta zastavit?
Když podle vašich kritérií úspěchu nepřekoná současný způsob, jak se úloha dělá, nebo když kontrola, kterou potřebuje, stojí tolik času, kolik ušetří. Jasné zastavení je užitečný výsledek: vyhodnocovací sadu si ponechte, protože novější model nebo užší úloha ji později mohou splnit.