Siirry sisältöön

Oppaat

Tekoälyagentin PoC: näin arvioit sen ennen laajentamista

· Lukuaika 7 min

Arvioi tekoälyagentin konseptikokeilua (proof of concept, PoC) ennen rakentamista kirjattuja onnistumiskriteerejä vasten kiinteällä joukolla oikeita tapauksia, joihin kuuluvat myös vaikeat. Mittaa tarkkuus, tehtäväkohtainen kustannus ja viive, tarkista, mihin tietoihin ja työkaluihin agentti pääsee ja miten se epäonnistuu, ja laajenna vasta, kun tulokset pitävät myös demon ulkopuolella.

Vakuuttava demo ei ole näyttöä

Demo näyttää tekoälyagentin parhaimmillaan, koska se ajetaan esimerkeillä, jotka tekijät ovat valinneet ja harjoitelleet. Ennen laajentamista kysymys on toinen: kuinka usein agentti tekee oikean työn oikein, mitä kukin tehtävä maksaa ja mitä tapahtuu päivinä, jolloin se tekee virheitä?

Käsittele PoC:tä kokeena, joka päättyy päätökseen: laajenna, muuta tai lopeta. Päätös tarvitsee kriteerit, jotka on kirjattu ennen tulosten saapumista; muuten lähes minkä tahansa tuloksen voi tulkita lupaavaksi.

Kirjoita onnistumiskriteerit ennen agentin rakentamista

Määritä, mitä riittävän hyvä tarkoittaa liiketoiminnalle, ja muuta se mitattaviksi luvuiksi. Tukipyyntöjä lajittelevalle agentille se voisi olla oikealle tiimille ohjattujen pyyntöjen osuus, niiden pyyntöjen osuus, jotka se oikeutetusti jättää käsittelemättä, ja aika, jonka ihminen käyttää kunkin tarkistamiseen.

  • Tehtävien onnistumisprosentti realistisilla tapauksilla ja kirjallinen määritelmä oikeasta tuloksesta
  • Virheet, jotka voit sietää, ja ne, joita et voi, kuten asiakkaalle lähetetty väärä vastaus
  • Kustannus valmista tehtävää kohden, mukaan lukien mallin käyttö ja työn tarkistavan ihmisen aika
  • Vasteaika, joka sopii työnkulkuun sen mukaan, odottaako joku vastausta
  • Vertailukohta: kuinka kauan tehtävä vie ihmisiltä nykyään ja kuinka usein he tekevät sen oikein

Testaa kiinteällä, oikeista tapauksista kootulla arviointijoukolla

Kerää oikeita syötteitä omasta historiastasi, kirjaa kullekin oikea lopputulos ja pidä joukko muuttumattomana. Ota mukaan helppoja, monitulkintaisia ja harvinaisia tapauksia sekä muutama, josta agentin pitäisi kieltäytyä. Pienempi joukko hyvin valittuja tapauksia kertoo enemmän kuin suuri joukko helppoja.

Aja agentti koko joukolla aina, kun kehote, malli, työkalut tai tiedot muuttuvat, ja vertaa tuloksia edelliseen ajoon. Mallien tuotokset vaihtelevat ajosta toiseen, joten aja jokainen tapaus useammin kuin kerran ja katso johdonmukaisuutta, älä vain parasta vastausta. Pidä tapaukset poissa kehotteesta ja kaikista esimerkeistä, jotka agentti näkee, tai tulos näyttää todellista paremmalta.

Tarkista myös, miten pisteytät. Automaattiset tarkistukset toimivat jäsennellyille tuotoksille. Vapaa teksti vaatii yleensä ihmisen tai toisen mallin, jonka arvioita olet verrannut ihmisen arvioihin otoksella.

Mittaa kustannus ja viive odotetulla volyymilla

PoC, joka käsittelee muutamia kymmeniä pyyntöjä päivässä, voi kätkeä kustannuksia, joilla on merkitystä tuhansien pyyntöjen kohdalla. Kirjaa mallikutsut, tokenit ja työkalukutsut tehtävää kohden sekä kunkin tehtävän kesto. Silmukoivat, uudelleen yrittävät tai pitkiä asiakirjoja lukevat agentit voivat tulla joillakin syötteillä paljon keskimääräistä kalliimmiksi, joten tutki hitaimpia ja kalleimpia tapauksia, älä vain keskiarvoa.

Arvioi sitten kustannus odotetulla volyymilla ja vertaa sitä siihen, mitä työ maksaa nyt, mukaan lukien aika, jonka ihmiset edelleen käyttävät tarkistamiseen. Aseta tehtäväkohtaiset kovat rajat vaiheille, tokeneille ja ajalle, jotta yksi huono syöte ei voi kasvattaa suurta laskua. OWASP Top 10 for LLM Applications -luettelo kutsuu tätä riskiä rajoittamattomaksi kulutukseksi (unbounded consumption).

Suunnittele ihmisen tarkistus harkiten ja mittaa se

Ihmisen tekemä tarkistus on osa suunnittelua, ei väliaikainen turvaverkko. Päätä, mitkä toimenpiteet agentti saa tehdä itse, mitkä se saa vain ehdottaa ja mitä se ei saa koskaan tehdä. Kaiken peruuttamattoman tai asiakkaille näkyvän, kuten viestin lähettämisen, tietueen muuttamisen tai rahan käyttämisen, pitää odottaa ihmisen hyväksyntää, kunnes agentilla on pitkä näyttö.

Mittaa itse tarkistusta: kuinka kauan se kestää, kuinka usein tarkistajat muuttavat tuotosta ja kuinka usein he hyväksyvät tarkistamatta kunnolla. Jos tarkistaminen vie lähes yhtä kauan kuin tehtävän tekeminen, agentti ei vielä säästä aikaa. Jos käyttötapauksesi voi olla EU:n tekoälysäädöksen (AI Act) mukaan suuririskinen, tehokas ihmisen suorittama valvonta on 14 artiklan mukainen lakisääteinen vaatimus eikä suunnitteluvalinta, joten ota oikeudelliset neuvonantajasi mukaan ajoissa.

Aseta tietojen ja tietoturvan rajat ennen laajentamista

Laajentaminen tuo lisää tietoja, käyttäjiä ja työkaluja, ja silloin heikot rajat alkavat merkitä. OWASP Top 10 for LLM Applications -luettelossa kehoteinjektio (prompt injection) on ensimmäisenä: agentin lukema teksti, kuten sähköposti, tiketti tai verkkosivu, voi sisältää ohjeita, jotka ohjaavat sen muualle. Luettelossa on myös liiallinen toimijuus (excessive agency) eli enemmän toimintoja, oikeuksia tai itsenäisyyttä kuin tehtävä vaatii. Ratkaise nämä kohdat ennen kuin pilotti kasvaa.

  • Mitä tietoja agentti voi lukea ja meneekö henkilö- tai luottamuksellisia tietoja mallintarjoajalle, ja millä sopimus- ja säilytysehdoilla
  • Mitä työkaluja se voi kutsua, suppeimmilla oikeuksilla ja agenttikohtaisilla tunnuksilla
  • Mitä se voi muuttaa ja voidaanko jokainen muutos jäljittää ja perua
  • Mitä kirjataan lokiin: jokainen työkalukutsu syötteineen ja tuloksineen niin, ettei henkilötietoja vuoda
  • Miten kunkin asiakkaan tai tiimin tiedot pidetään erillään muiden tiedoista

Tutki, miten se epäonnistuu, ja tee sitten päätös

Lue ennen päätöstä epäonnistumiset, älä vain pistemäärää. Lajittele ne tyypin mukaan: itsevarmat väärät vastaukset, oikeat kieltäytymiset, väliin jääneet vaiheet, väärä työkalun käyttö, aikakatkaisut. Agentti, joka epäonnistuessaan pyytää apua, on paljon helpompi ottaa käyttöön kuin agentti, joka epäonnistuu hiljaa uskottavalla vastauksella.

Päätä sitten. Laajenna, jos kriteerit täyttyvät arviointijoukossa ja jäljelle jäävät epäonnistumiset ovat sellaisia, jotka prosessisi pystyy käsittelemään. Rajaa tehtäväkenttää, jos agentti onnistuu vain osassa tehtävää. Lopeta, jos se ei ylitä vertailukohtaa, ja säilytä arviointijoukko seuraavaa yritystä varten. Tekoälyagenttiprojektimme noudattavat samaa järjestystä: yksi tehtävä, oikeat esimerkit, tiimisi tekemä tarkistus ja laajempi tehtäväkenttä vasta, kun agentti on ansainnut luottamuksen. Jos sinulla on arvioitava PoC, voit kuvata sen Aloita projekti -lomakkeellamme.

Tärkeimmät havainnot

  • Kirjoita onnistumiskriteerit ja vertailukohta ennen agentin rakentamista, jotta tulosta voi arvioida rehellisesti.
  • Testaa kiinteällä joukolla oikeita tapauksia, myös vaikeita ja monitulkintaisia, ja aja se uudelleen jokaisen muutoksen jälkeen.
  • Mittaa tehtäväkohtainen kustannus ja viive odotetulla volyymilla ja katso keskiarvon lisäksi pahimpia tapauksia.
  • Suunnittele ihmisen tarkistus harkiten ja mittaa, kuinka kauan se kestää ja mitä se havaitsee.
  • Aseta tietojen, työkalujen ja lokituksen rajat ennen laajentamista, sillä kehoteinjektio ja liiallinen toimijuus ovat tunnettuja riskejä.

UKK

Kuinka monta tapausta tekoälyagentin arviointijoukkoon tarvitaan?

Kiinteää lukua ei ole. Tapauksia tarvitaan niin monta, että ne kattavat tehtävän tärkeimmät muunnelmat, vaikeat ja monitulkintaiset tapaukset sekä ne, joista agentin pitäisi kieltäytyä. Aloita siitä, minkä pystyt merkitsemään huolellisesti, ja lisää jokainen myöhemmin löytämäsi todellinen epäonnistuminen.

Voiko toinen malli pisteyttää agentin tuotoksen?

Kyllä, vapaan tekstin tuotoksissa, joita on vaikea tarkistaa automaattisesti, mutta vasta kun olet verrannut sen arvioita ihmisen arvioihin tapausotoksella. Tarkista yhtäpitävyys uudelleen aina, kun vaihdat mallia tai kehotetta.

Milloin tekoälyagentin PoC kannattaa lopettaa?

Kun se ei päihitä nykyistä tapaa tehdä tehtävä onnistumiskriteereilläsi mitattuna tai kun sen vaatima tarkistus vie yhtä paljon aikaa kuin se säästää. Selkeä lopetus on hyödyllinen tulos: säilytä arviointijoukko, koska uudempi malli tai rajatumpi tehtävä voi läpäistä sen myöhemmin.

Kerro, mitä tarvitset.

Jotain rakennettavaa, ihmisiä löydettäväksi tai kysymys, johon tarvitset vastauksen. 30 minuutin puhelussa kuuntelemme ja kerromme rehellisesti, miten voimme auttaa ja mitä se vaatisi.

Varaa puhelu

30 minuuttia ranskaksi tai englanniksi. Maksuton.

Kirjoitatko mieluummin? Lähetä sen sijaan lyhyt kuvaus.