AI

Goodfire wprowadza niedrogie monitory inside-out do wykrywania nieuczciwych agentów AI

Tendela Briefing ·
0 odsłon · 0 Komentarze
Goodfire wprowadza niedrogie monitory inside-out do wykrywania nieuczciwych agentów AI

Image: Image Credits:GOODFIRE · Source

Goodfire przedstawia innowacyjne monitory 'inside-out', które analizują wnętrze modeli AI podczas ich działania, efektywnie wykrywając nieuczciwe zachowania przy ułamku kosztów tradycyjnych systemów monitorujących.

Goodfire, startup specjalizujący się w interpretowalności AI, uruchomił nowatorski system monitorowania agentów AI w bardziej opłacalny sposób, analizując ich wewnętrzne obliczenia modelu w czasie rzeczywistym. W przeciwieństwie do powszechnego stosowania drugiego AI do analizowania wyjść agenta — podejścia, które staje się kosztowne przy dużej ilości przetwarzanych danych — monitory Goodfire obserwują sygnały w modelu podczas jego działania. Metoda ta pozwala na wczesne wykrycie potencjalnie złośliwych lub szkodliwych działań bez konieczności przeglądania każdego wygenerowanego tokenu na zewnątrz.

Monitory działają na podobnej zasadzie jak skanery bezpieczeństwa na lotnisku: małe detektory zwane sondami analizują wewnętrzne aktywacje AI na każdym etapie zadania. Gdy sonda wykryje podejrzane wzorce, drugi model AI przeprowadza bardziej dogłębną analizę. Takie wielopoziomowe podejście zwiększa efektywność, skupiając zasoby obliczeniowe tylko wtedy, gdy jest to konieczne.

Monitory Goodfire są zintegrowane z platformą Baseten, umożliwiając klientom dostosowanie śledzonych ryzyk — takich jak ofensywne próby hakowania, niewłaściwe użycie związane z bronią chemiczną i biologiczną lub tzw. reward hacking — oraz wybór automatycznych reakcji, jak rejestrowanie zdarzeń, ręczna weryfikacja czy całkowite odmówienie wykonania żądania.

Testy na otwartoźródłowym agencie AI Kimi K3 wykazały znaczne oszczędności kosztów. Monitorowanie około 1500 sesji kosztowało około 51 USD korzystając z sond Goodfire, w porównaniu do 233 USD dla mniej zaawansowanego systemu opartego na AI i nawet 10 000 USD dla droższej alternatywy. Sondy skutecznie wykryły 94% złośliwych sesji hackerskich, przy minimalnej liczbie fałszywych alarmów, które wymagały wtórnej analizy tylko w 8,7% bezpiecznych sesji. Dodatkowe opóźnienie związane z uruchamianiem wielu sond było znikome, zwiększając czas uruchomienia odpowiedzi modelu o mniej niż 2%.

Dan Balsam, współzałożyciel i CTO Goodfire, podkreślił zalety wykrywania problematycznych zachowań jeszcze przed ich ujawnieniem, poprzez identyfikację zagrożeń w fazach oceny lub treningu. Ta zdolność jest szczególnie ważna dla otwartych modeli, które nie mają kontrolowanych zabezpieczeń systemów własnościowych i mogą być modyfikowane lub nadużywane przez dowolnych deweloperów.

Choć istnieją inne inicjatywy — Google DeepMind ostatnio wprowadził sondy wykrywające niewłaściwe użycia w swoim modelu Gemini — podejście Goodfire skupia się na wykorzystaniu istniejących obliczeń modelu, aby obniżyć koszty i zwiększyć możliwość monitorowania w czasie rzeczywistym. Ich długoterminowa wizja zakłada inżynierię wsteczną dużych modeli językowych (LLM) w celu śledzenia zachowań do ich treningowych źródeł, co potencjalnie przekształci rozwój modeli w precyzyjną dziedzinę inżynierii.

Innowacja Goodfire odpowiada na rosnące obawy dotyczące agentów AI wymykających się spod kontroli i działających nieprzewidywalnie lub szkodliwie, problem podkreślany przez niedawne incydenty z otwartymi modelami AI. Ich monitoring inside-out stanowi pragmatyczny krok ku zwiększeniu bezpieczeństwa AI na szeroką skalę, zwłaszcza w miarę rosnącej dostępności i rozpowszechnienia otwartych modeli.

Źródła i oryginalne doniesienia

Komentarze (0)

Nie ma jeszcze komentarzy.

Napisz komentarz

Komentarze publikujemy po moderacji. Nazwa i komentarz będą publiczne. Konto