Problém s agentmi
Autonómne systémy vytvárajú prevádzkové riziko.
Generatívny model môže vytvoriť zlú odpoveď. Agent môže podľa tejto odpovede konať: spustiť refundáciu, zmazať záznam, odhaliť dokument alebo vykonať krok vo workflow. Preto patria oprávnenia, schvaľovanie a návratové cesty do jadra návrhu.
Vývoj preto nekončí pri promptoch. Zahŕňa hranice oprávnení, vratnosť, eskaláciu, logovanie a schopnosť spätne zrekonštruovať, čo systém urobil a prečo.
- Čo smie tento agent robiť a odkiaľ to oprávnenie pochádza?
- Ktoré úkony sú vratné a ktoré si pred vykonaním vyžadujú človeka?
- Ako by ste konkrétne rozhodnutie zrekonštruovali o pol roka — pre regulátora alebo pre súd?
- Čo sa stane, keď volanie nástroja zlyhá alebo vráti niečo nepriateľské?
- Ktoré z vašich systémov s AI sú podľa aktu o AI vysokorizikové — a viete svoju úvahu doložiť?
- Kto nesie zodpovednosť, keď autonómny systém spôsobí škodu tretej osobe?
Čo staviame
Agentné systémy od začiatku do konca.
Architektúra agentov
Jednoagentné aj multiagentné návrhy: rozklad úloh, delegovanie medzi agentmi, rozhrania nástrojov a API, pamäť a stav, vyhľadávanie a orchestračná vrstva, ktorá rozhoduje, čo a v akom poradí beží.
Mantinely a oprávnenia
Úzko vymedzené oprávnenia, prístup k nástrojom podľa zásady najmenších práv, filtrovanie vstupov a výstupov, limity na výdavky a frekvenciu, obmedzenie dosahu škody a deterministické kontroly okolo nedeterministických komponentov.
Kontrola človekom
Eskalačné modely, ktoré určujú, kedy je človek potrebný; schvaľovacie rozhrania, pri ktorých je posúdenie reálne a nie formálne; a definované správanie, keď nikto nereaguje.
Auditná stopa
Štruktúrované protokolovanie promptov, volaní nástrojov, rozhodnutí a výsledkov odolné voči manipulácii — navrhnuté tak, aby vyhovelo požiadavkám aktu o AI na uchovávanie záznamov a aby bolo pri incidente skutočne užitočné.
Hodnotenie a red teaming
Testovacie sady zamerané na správanie, regresné hodnotenie naprieč verziami modelov, adversariálne testovanie vrátane prompt injection cez výstupy nástrojov a testy odolnosti v zhoršených či nepriateľských podmienkach.
Prevádzka
Monitoring, sledovanie driftu a nákladov, postupy reakcie na incidenty napísané pre autonómne systémy a cesta k rollbacku, ktorá funguje aj vtedy, keď je chybným komponentom model.
Súlad s predpismi
Akt o AI pre systémy, ktoré konajú.
Posúdime vaše systémy, zaradíme ich a pripravíme dokumentáciu k tomuto zaradeniu. Právna práca zostáva previazaná s technickým návrhom, pretože kontroly závisia od skutočného správania systému.
Posúdenie a klasifikácia
Inventarizácia vašich systémov s AI, zaradenie do rizikových kategórií podľa aktu o AI, určenie vašej role poskytovateľa alebo nasadzujúceho subjektu a gap analýza oproti povinnostiam, ktoré z toho vyplývajú. Tam, kde je odpoveď neistá, zdokumentujeme úvahu a predpoklady, z ktorých vychádza.
Dokumentácia a riadenie
Technická dokumentácia, posúdenia rizík a vplyvu, informačné povinnosti, protokolovanie a opatrenia ľudského dohľadu, záznamy o správe údajov, rámce riadenia AI a interné smernice, ako aj podpora pri posudzovaní zhody a pri otázkach orgánov.
Ako to vedieme
Päť fáz s konkrétnymi výstupmi.
Discovery
Čo má agent robiť, čoho sa smie dotknúť a aký je najhorší reálny následok. Výstup: vymedzené zadanie návrhu a prvý pohľad na riziká.
Klasifikácia
Kam systém patrí podľa aktu o AI a súvisiacich predpisov a aké povinnosti sa naň viažu. Výstup: písomné zaradenie s odôvodnením a predpokladmi.
Návrh a realizácia
Architektúra, mantinely, model oprávnení, logovanie a rozhrania sa vyvíjajú spoločne. Výstup: fungujúci systém a návrh jeho kontrol.
Hodnotenie
Behaviorálne, adversariálne a regresné testovanie oproti definovaným kritériám. Výstup: hodnotiaca správa, ktorú môžete dať bezpečnostnému audítorovi.
Prevádzka
Monitoring, postupy pri incidentoch a pravidelné prehodnotenie pri zmene modelov a rozsahu. Výstup: systém, ktorý zostane v súlade aj po spustení.
Čo dostanete
Výstupy, ktoré môžete ďalej používať.
Práva duševného vlastníctva ku všetkému, čo vznikne špeciálne pre vás, prechádzajú na vás od vzniku a nadobúdajú účinnosť zaplatením. Ak je v diele použitý náš vlastný predchádzajúci nástroj, dostanete časovo neobmedzenú, neodvolateľnú a celosvetovú licenciu na jeho používanie, úpravu a údržbu. Komponenty tretích strán a open source sú uvedené v zadaní prác ešte pred začiatkom prác.
- Dokumentácia architektúry agentov a návrhu kontrol
- Memorandum o klasifikácii podľa aktu o AI s uvedeným odôvodnením
- Posúdenie rizík a tam, kde sa vyžaduje, posúdenie vplyvu
- Balík technickej dokumentácie a informačných oznámení
- Správa z hodnotenia a red teamingu s reprodukovateľnými testami
- Špecifikácia protokolovania a auditnej stopy, implementovaná
- Rámec riadenia AI a súbor interných smerníc
- Postupy reakcie na incidenty a monitorovania autonómnych systémov
Máte agenta pripraveného na produkčné review?
Pošlite nám prototyp, zamýšľaný workflow a námietku, ktorá brzdí release. Pomôžeme určiť potrebné kontroly.
