Goodfire lanserer kostnadseffektive inside-out-monitors for å oppdage uønskede AI-agenter

Bilde: Image Credits:GOODFIRE · Kilde
Goodfire introduserer innovative "inside-out"-monitorer som inspiserer AI-modellenes interne prosesser under drift, og effektivt oppdager uønsket atferd til en brøkdel av tradisjonelle overvåkingskostnader.
Goodfire, en oppstartsbedrift som spesialiserer seg på AI-tolkbarhet, har lansert et nytt system designet for å overvåke AI-agenter mer kostnadseffektivt ved å analysere deres interne modellberegninger i sanntid. I motsetning til vanlig praksis hvor man bruker en annen AI til å kontrollere en agents utdata—en tilnærming som blir kostbar når agenter behandler store datamengder—observerer Goodfires monitorer signaler inne i modellen mens den opererer. Denne metoden tillater tidlig deteksjon av potensielt skadelig eller ondsinnet handling uten behov for den tunge belastningen ved å gjennomgå hver generert token eksternt.
Monitorene fungerer på en måte som ligner flyplassikkerhetsscannere: små detektorer, kalt sonder, analyserer interne aktiveringer i AI-en ved hvert steg i oppgaven. Når en sond identifiserer mistenkelige mønstre, utfører en sekundær AI-modell en dypere undersøkelse. Denne lagdelte tilnærmingen øker effektiviteten ved å fokusere beregningsressurser kun når det er nødvendig.
Goodfires monitorer er integrert i Basetens plattform, som gjør det mulig for kunder å tilpasse hvilke risikoer som skal følges—slik som offensive hackingforsøk, misbruk relatert til kjemiske og biologiske våpen eller belønningsmanipulering—og velge automatiserte responser som hendelseslogging, manuell gjennomgang eller total avvisning av forespørsler.
Tester på den åpne AI-agenten Kimi K3 viste betydelige kostnadsbesparelser. Overvåking av rundt 1 500 økter kostet omtrent 51 dollar ved bruk av Goodfires sonder, sammenlignet med 233 dollar for en mindre avansert AI-basert monitor og så mye som 10 000 dollar for et premiumalternativ. Sonderne fanget effektivt 94 % av de ondsinnede hackingsøktene, med en minimal andel falske positiver som førte til at bare 8,7 % av sikre økter krevde sekundær vurdering. Den ekstra forsinkelsen fra å kjøre flere sonder var neglisjerbar, med en økning i modellens responstid ved oppstart på mindre enn 2 %.
Goodfires medgrunnlegger og CTO Dan Balsam understreket fordelen ved å oppdage problematferd før den manifesterer seg ved å gjenkjenne trusler under evaluering eller treningsfaser. Denne evnen er spesielt viktig for åpne modeller, som mangler de kontrollerte sikringene til proprietære systemer og kan modifiseres eller misbrukes av hvem som helst av utviklere.
Selv om det finnes andre initiativer—Google DeepMind implementerte nylig misbruksdeteksjonssoner i sin Gemini-modell—fokuserer Goodfires tilnærming på å utnytte eksisterende modellberegninger for å redusere kostnader og øke sanntidsovervåkningens gjennomførbarhet. Deres langsiktige visjon er å bakoverkonstruere store språkmodeller (LLMs) for å spore atferd tilbake til treningsopprinnelsen, noe som potensielt kan gjøre modellutvikling til en mer presis ingeniørfaglig disiplin.
Goodfires innovasjon adresserer økende bekymringer rundt at AI-agenter kan unnslippe kontrollerte miljøer og opptre uforutsigbart eller ondsinnet, et problem som har blitt fremhevet av nylige hendelser med åpne AI-modeller. Deres inside-out-overvåkning representerer et pragmatisk skritt for å forbedre AI-sikkerhet i stor skala, spesielt i takt med at åpne modeller blir mer utbredt og tilgjengelige.
Kilder og originalrapportering
Les originalkilden ↗

Kommentarer (0)
Ingen kommentarer ennå. Start diskusjonen.
Skriv en kommentar
Kommentarer publiseres etter moderering. Ditt navn og kommentar vil være synlige offentlig. Konto