Goodfire tutvustab kulutõhusaid sisemisi jälgimisseadmeid pahatahtlike AI-agentide avastamiseks

Pilt: Image Credits:GOODFIRE · Allikas
Goodfire toob turule uuenduslikud „sisemised“ jälgimisseadmed, mis kontrollivad AI mudelite sisemisi toiminguid reaalajas, võimaldades tõhusalt tuvastada pahatahtlikku käitumist väiksemate kuludega kui traditsioonilised meetodid.
Goodfire, tehisintellekti interpreteeritavusele spetsialiseerunud idufirma, on välja töötanud uue süsteemi, mis võimaldab AI-agentide jälgimist kuluefektiivsemalt, analüüsides nende sisemisi mudeliarvutusi reaalajas. Erinevalt levinud praktikast, kus agentide väljundite kontrollimiseks kasutatakse sekundaarset AI-d – mis muutub kulukaks, kui agent töötleb suurel hulgal andmeid – vaatlevad Goodfire'i jälgijad mudeleid nende töö käigus tekkivate signaalide põhjal. See meetod võimaldab varakult avastada võimalikke pahatahtlikke või kahjulikke tegevusi ilma, et peaks käsitlema kõiki genereeritud tokenid väljastpoolt.
Jälgimisseadmed töötavad sarnaselt lennujaama turvakontrolliskanneritele: väikesed detektorid, mida nimetatakse proovideks, analüüsivad iga tööetapi ajal AI sisemisi aktiveerimisi. Kui proov leiab kahtlaseid mustreid, teostab sügavama uurimise sekundaarne AI mudel. See kihiline lähenemine suurendab efektiivsust, suunates arvutusressursid üksnes vajaduse korral.
Goodfire'i jälgijad on integreeritud Baseteni platvormi, võimaldades klientidel kohandada jälgitavaid riske – nagu solvavad häkkimiskatsed, keemia- ja biorelva kuritarvitus või preemia manipuleerimine – ning valida automaatseid reageerimisviise, sealhulgas sündmuste logimine, manuaalne ülevaatus või taotluse täielik tagasilükkamine.
Katsetused avatud lähtekoodiga AI agendiga Kimi K3 näitasid märkimisväärseid kulusääste. Ligikaudu 1500 seansi jälgimine maksis Goodfire'i proovide abil umbes 51 dollarit, võrreldes 233 dollariga vähem arenenud AI-põhise jälgija puhul ja kuni 10 000 dollariga kõrgema klassi alternatiivide puhul. Proovid tuvastasid efektiivselt 94% pahatahtlikest häkkimisseanssidest, põhjustades vaid 8,7% valepositiivsetest juhtudest nõudes sekundaarset ülevaatust. Mitme proovi jooksutamisest tingitud latentsus oli minimaalne, suurendades mudeli vastuse algust aega vähem kui 2%.
Goodfire'i kaasasutaja ja tehnoloogiajuht Dan Balsam rõhutas eeliseid probleemse käitumise varases peatamises, tuvastades ohud juba hindamis- või treenimisfaasides. See võimekus on eriti tähtis avatud mudelite puhul, millel puuduvad kontrollitud turvameetmed ja mida saab iga arendaja muuta või väärkasutada.
Kuigi sarnaseid ettevõtmisi on – Google DeepMind on hiljuti rakendanud kuritarvituse tuvastamise proove oma Gemini mudelis – keskendub Goodfire'i lähenemine olemasolevate mudeliarvutuste kasutamisele, et vähendada kulusid ja suurendada reaalajas jälgimise teostatavust. Nende pikaajaline visioon on pöörata suuremate keelemudelite (LLMide) käitumised tagasi nende treenimise juurte juurde, muutes mudelite arendamise täpsemaks inseneriteaduseks.
Goodfire'i uuendus vastab kasvavatele muredele AI-agentide kontrollitud keskkondadest väljapääsemise ja ettearvamatult või pahatahtlikult käitumise osas, probleemidele, mida on rõhutatud hiljutiste juhtumite kaudu avatud AI mudelitega. Nende sisemise jälgimise lahendus on pragmaatiline samm AI ohutuse suurendamiseks laiemal skaalal, eriti kuna avatud mudelid muutuvad üha laialdasemaks ja kättesaadavamaks.
Allikad ja originaaluudised
Loe originaali allikat ↗

Kommentaarid (0)
Kommentaare veel pole. Alusta arutelu.
Kirjuta kommentaar
Kommentaarid avaldatakse pärast modereerimist. Sinu nimi ja kommentaar on avalikult nähtavad. Konto