DI

Goodfire pristato ekonomiškus „inside-out“ stebėtojus sukčiams AI agentams aptikti

Tendela Briefing ·
0 peržiūros · 0 Komentarai
Goodfire pristato ekonomiškus „inside-out“ stebėtojus sukčiams AI agentams aptikti

Vaizdas: Image Credits:GOODFIRE · Šaltinis

Goodfire pristato novatoriškus „inside-out“ stebėtojus, kurie veikia realiu laiku analizuodami AI modelio vidines operacijas ir efektyviai aptinka nukrypimus nuo normos, žymiai sumažindami tradicinių stebėjimo metodų išlaidas.

Goodfire, dirbtinio intelekto interpretacijos srityje veikianti startuolė, pristatė naują sistemą, skirtą AI agentų stebėjimui pigiau ir efektyviau, analizuojant jų vidaus modelio skaičiavimus realiu laiku. Priešingai nei dažna praktika naudoti antrą AI, kuris nuolat tikrina agento išvestis – tai tampa brangu apdorojant didelį duomenų kiekį – Goodfire stebėtojai fiksuoja signalus modelio viduje vykdant veiksmus. Šis metodas leidžia anksti nustatyti galimai žalingą ar kenksmingą elgesį, nesiremiant išoriniuų visų sugeneruotų žinučių patikrinimu.

Šie stebėtojai veikia panašiai kaip oro uostų saugumo skeneriai: maži detektoriai, vadinami zondais, analizuoja AI vidines aktyvacijas kiekviename užduoties žingsnyje. Jei zondas aptinka įtartinus modelius, antrinis AI atlieka išsamesnį tyrimą. Ši sluoksniuota sistema didina efektyvumą, nukreipiant skaičiavimo resursus tik ten, kur jų reikia.

Goodfire stebėtojai integruoti į Baseten platformą, leidžiančią klientams pasirinkti, kokias rizikas stebėti – pavyzdžiui, įžeidžiančius įsilaužimus, cheminių ir biologinių ginklų piktnaudžiavimą ar atlygio manipuliacijas – bei nustatyti automatinį atsaką: įvykių registravimą, rankinį peržiūrėjimą ar tiesiog užkirtimą užklausai.

Testai su atviro kodo AI agentu Kimi K3 parodė ženklų sąnaudų sumažėjimą. Apie 1 500 seansų stebėjimas su Goodfire zondais kainavo apie 51 USD, palyginti su 233 USD mažiau pažengusių AI stebėtojų ir net iki 10 000 USD už premium variantą. Zondai sėkmingai aptiko 94 % kenkėjiškų įsilaužimų seansų, o klaidingų teigiamų rezultatų dalis buvo maža – tik 8,7 % saugių seansų reikalavo papildomos peržiūros. Papildomas delsimas dėl kelių zondų analizės buvo minimalus – modelio atsakymo pradžia pailgėjo mažiau nei 2 %.

Goodfire bendraįkūrėjas ir technologijų vadovas Danas Balsamas pabrėžė, kad pranašumas yra galimybėje pastebėti pavojingą elgesį dar vertinimo ar mokymo etapuose. Tai ypač svarbu atviro kodo modeliams, neturintiems kontroliuojamų saugumo priemonių, kuriuos gali modifikuoti ar netinkamai naudoti bet kuris kūrėjas.

Nors egzistuoja kitų iniciatyvų – Google DeepMind neseniai diegė piktnaudžiavimo aptikimo zondus Gemini modelyje – Goodfire sprendimas orientuotas į esamų modelio skaičiavimų panaudojimą, siekiant sumažinti kaštus ir padidinti realaus laiko stebėsenos galimybes. Ilgalaikis jų tikslas yra atstatyti didžiųjų kalbinių modelių veikimą atgal į mokymo duomenų kilmę, taip paversdami modelių kūrimą tikslesne inžinerijos šaka.

Goodfire inovacija atliepia augančius nerimus dėl AI agentų galimo pabėgimo iš kontroliuojamų aplinkų ir neprognozuojamo ar kenksmingo elgesio, kas pastaruoju metu pasireiškė atviro kodo AI modelių incidentuose. „Inside-out“ stebėjimas yra praktiškas žingsnis didinant AI saugumą plačiai, ypač plečiantis atviro kodo modelių naudojimui ir prieinamumui.

Šaltiniai ir originalūs pranešimai

Komentarai (0)

Komentarų dar nėra. Pradėkite diskusiją.

Rašyti komentarą

Komentarai publikuojami po moderavimo. Jūsų vardas ir komentaras bus vieši. Paskyra