Goodfire lanseeraa kustannustehokkaat sisäänpäin suunnatut monitorit petollisten tekoälyagenttien havaitsemiseen

Kuva: Image Credits:GOODFIRE · Lähde
Goodfire esittelee innovatiiviset ”sisäänpäin suuntautuvat” monitorit, jotka tarkkailevat tekoälymallien sisäiset toiminnot reaaliajassa ja havaitsevat tehokkaasti epäilyttävän käyttäytymisen murto-osalla perinteisten monitorointimenetelmien kustannuksista.
Goodfire, tekoälyn tulkittavuuteen erikoistunut startup-yritys, on lanseerannut uuden järjestelmän, joka valvoo tekoälyagentteja kustannustehokkaammin analysoimalla niiden sisäisiä mallilaskelmia reaaliajassa. Toisin kuin yleinen käytäntö käyttää toista tekoälyä tarkkailemaan agentin tuottamia vastauksia – mikä käy kalliiksi käsiteltäessä suuria tietomääriä – Goodfiren monitorit havainnoivat signaaleja mallin sisällä toiminnan aikana. Tämä menetelmä mahdollistaa mahdollisesti haitallisen tai vaarallisen toiminnan varhaisen tunnistamisen ilman tarvetta ulkoisesti tarkastella jokaista tuotettua tokenia.
Monitorit toimivat samalla tavalla kuin lentokenttien turvatarkastimet: pienet detektorit, niin sanotut proobit, analysoivat tekoälyn sisäisiä aktivaatiota kunkin tehtävän vaiheen aikana. Kun proobi havaitsee epäilyttäviä kuvioita, sekundäärinen tekoälymalli suorittaa syvällisemmän tarkastelun. Tämä kerroksellinen lähestymistapa tehostaa resurssien käyttöä kohdentamalla laskentatehoa vain tarpeen vaatiessa.
Goodfiren monitorit on integroitu Basetenin alustalle, jonka avulla asiakkaat voivat räätälöidä seurattavat riskit – kuten loukkaavat hakkerointiyritykset, kemiallisten ja biologisten aseiden väärinkäyttö tai palkkion manipulointi – ja valita automaattiset vastetoimet, kuten tapahtumien kirjaaminen, manuaalinen tarkastus tai pyynnön hylkääminen.
Avoimen lähdekoodin tekoälyagentti Kimi K3:lla tehdyt testit osoittivat merkittäviä kustannussäästöjä. Noin 1 500 istunnon monitorointi Goodfiren proobeilla maksoi noin 51 dollaria, kun verrattuna vähemmän kehittyneen tekoälypohjaisen monitorin 233 dollariin tai jopa 10 000 dollariin premium-vaihtoehdossa. Proobit tunnistivat tehokkaasti 94 % haitallisista hakkerointisessioista, ja väärien positiivisten osuus oli vähäinen – vain 8,7 % turvallisista sessioista vaati sekundaarista tarkastelua. Lisäviive monien proobien ajamisesta oli vähäinen, kasvaten mallin reagoinnin käynnistysaikaa alle 2 %.
Goodfiren perustaja ja teknologiajohtaja Dan Balsam korosti etua ongelmallisen käyttäytymisen sieppaamisesta ennen sen ilmenemistä havaitsemalla uhkia arviointi- tai koulutusvaiheissa. Tämä kyky on erityisen tärkeä avoimille malleille, joilla ei ole suojattuja kontrollimekanismeja ja joita kuka tahansa kehittäjä voi muokata tai käyttää väärin.
Vaikka muitakin hankkeita on olemassa – Google DeepMind on äskettäin ottanut käyttöön väärinkäytön tunnistusproobeja Gemini-mallissaan – Goodfiren lähestymistapa keskittyy hyödyntämään nykyisiä mallilaskelmia kustannusten alentamiseksi ja reaaliaikaisen valvonnan mahdollistamiseksi. Heidän pitkän aikavälin tavoitteensa on kääntää suurten kielimallien toimintaa siten, että käyttäytyminen voidaan jäljittää takaisin koulutusvaiheisiin, mikä voisi muuttaa mallien kehityksen tarkemmaksi insinööritieteeksi.
Goodfiren innovaatio vastaa kasvaviin huoliin tekoälyagenttien pääsystä hallitsemattomiin ympäristöihin ja niiden arvaamattomasta tai haitallisesta toiminnasta, mikä on korostunut äskettäisissä avoimen mallin sisältävissä tapauksissa. Heidän sisäänpäin suunnattu monitorointinsa edustaa käytännöllistä askelta tekoälyn turvallisuuden parantamisessa laajassa mittakaavassa, erityisesti kun avoimet mallit yleistyvät ja tulevat entistä helpommin saataville.
Lähteet ja alkuperäiset raportit
Lue alkuperäinen lähde ↗

Kommentit (0)
Ei vielä kommentteja. Aloita keskustelu.
Kirjoita kommentti
Kommentit julkaistaan moderoinnin jälkeen. Nimesi ja kommenttisi näkyvät julkisesti. Tili