Mākslīgais intelekts

Goodfire ievieš ekonomiskus iekšējā tipa monitorus ļaunprātīgu AI aģentu atpazīšanai

Tendela Briefing ·
0 skatījumi · 0 Komentāri
Goodfire ievieš ekonomiskus iekšējā tipa monitorus ļaunprātīgu AI aģentu atpazīšanai

Attēls: Image Credits:GOODFIRE · Avots

Goodfire piedāvā inovatīvus "iekšējos" monitorus, kas reālajā laikā pārbauda AI modeļu iekšējos procesus, efektīvi atklājot ļaunprātīgu uzvedību par daļu no tradicionālo uzraudzības izmaksām.

Goodfire, uzņēmums, kas specializējas AI interpretācijas jomā, ir izstrādājis jaunu sistēmu, kas paredzēta AI aģentu uzraudzībai ar zemākām izmaksām, analizējot to iekšējās modeļa aprēķinu darbības reālā laikā. Atšķirībā no izplatītās prakses izmantot sekundāru AI, lai pārraudzītu aģenta izvadus — kas kļūst dārgi, ja aģents apstrādā lielu datu apjomu — Goodfire monitori novēro signālus modeļa darbības laikā. Šī metode ļauj savlaicīgi atklāt potenciāli ļaunprātīgas vai kaitīgas darbības, neveicot rūpīgu ārēju katras ģenerētās tokenas pārskatu.

Monitori darbojas līdzīgi lidostas drošības skeneriem: mazi detektori, saukti par 'problēmātājiem' (probes), analizē AI iekšējās aktivācijas katrā uzdevuma solī. Kad problēmātājs konstatē aizdomīgas pazīmes, sekundārs AI modelis veic dziļāku izmeklēšanu. Šī vairāku līmeņu pieeja uzlabo efektivitāti, koncentrējot aprēķinu resursus tikai tad, kad tas ir nepieciešams.

Goodfire monitori ir integrēti Baseten platformā, ļaujot klientiem pielāgot, kādus riskus — tādus kā aizskaroši hakeru mēģinājumi, ķīmisko un bioloģisko ieroču nepareiza izmantošana vai atlīdzības manipulācija — tiek uzraudzīti, un izvēlēties automātiskas atbildes, piemēram, notikumu reģistrāciju, manuālu pārbaudi vai pieprasījuma noraidīšanu.

Testi ar atvērtā koda AI aģentu Kimi K3 parādīja ievērojamas izmaksu ietaupījumus. Aptuveni 1500 sesiju uzraudzība maksāja apmēram 51 USD, izmantojot Goodfire problēmātājus, salīdzinot ar 233 USD mazāk sarežģītam AI monitoram un līdz pat 10 000 USD dārgākam risinājumam. Problēmātāji efektīvi noķēra 94% ļaunprātīgo hakeru sesiju, ar minimālu viltus pozitīvu rādītāju, kā rezultātā tikai 8,7% drošu sesiju prasīja sekundāru pārbaudi. Vēl viena latentuma pieauguma dēļ vairāku problēmātāju darbībā bija nenozīmīgs, palielinot modeļa atbildes starta laiku par mazāk nekā 2%.

Goodfire līdzīpašnieks un tehniskais direktors Dans Balsam uzsvēra priekšrocību pārtraukt problemātisku uzvedību jau tā novērtēšanas vai apmācības posmā. Šī spēja ir īpaši svarīga atvērtajiem modeļiem, kuriem nav kontrolētu drošības pasākumu un kurus var modificēt vai ļaunprātīgi izmantot jebkurš izstrādātājs.

Lai gan pastāv citas iniciatīvas — Google DeepMind nesen ieviesa ļaunprātīgas izmantošanas noteikšanas problēmātājus savā Gemini modelī — Goodfire pieeja koncentrējas uz esošo modeļa aprēķinu izmantošanu, lai samazinātu izmaksas un palielinātu reāllaika uzraudzības iespējamību. Viņu ilgtermiņa redzējums ir atgriezeniski izstrādāt lielos valodas modeļus (LLM), lai izsekotu uzvedību līdz to apmācības saknēm, radot modelēšanas procesu kā precīzāku inženierzinātni.

Goodfire inovācija risina pieaugošās bažas par AI aģentiem, kas var izbēgt no kontrolētām vidēm un darboties neprognozējami vai ļaunprātīgi — jautājums, ko aktualizējuši nesenie gadījumi ar atvērtajiem AI modeļiem. Viņu iekšējā uzraudzība ir pragmatisks solis AI drošības uzlabošanai plašākā mērogā, īpaši, ņemot vērā atvērtu modeļu izplatīšanos un pieejamību.

Avoti un oriģinālziņas

Komentāri (0)

Komentāru vēl nav. Sāciet diskusiju.

Rakstīt komentāru

Komentāri tiek publicēti pēc moderēšanas. Jūsu vārds un komentārs būs redzami publiski. Konts