Goodfire lanserar kostnadseffektiva inside-out-övervakare för att upptäcka avvikande AI-agenter

Bild: Image Credits:GOODFIRE · Källa
Goodfire introducerar innovativa "inside-out"-övervakare som inspekterar AI-modellens interna processer under drift och effektivt upptäcker avvikande beteenden till en bråkdel av traditionella övervakningskostnader.
Goodfire, en startup specialiserad på AI-interpretabilitet, har lanserat ett nytt system designat för att övervaka AI-agenter mer kostnadseffektivt genom att analysera deras interna modellberäkningar i realtid. Till skillnad från den vanliga metoden att använda en andra AI för att granska en agents utdata—en metod som blir kostsam när agenter bearbetar stora datamängder—observerar Goodfires övervakare signaler inom modellen medan den arbetar. Denna metod möjliggör tidig upptäckt av potentiellt skadligt eller illvilligt agerande utan den belastning som kommer av att externt granska varje genererat token.
Övervakarna fungerar på ett sätt som liknar säkerhetsskanningar på flygplatser: små detektorer, kallade sonder, analyserar interna aktiveringar i AI:n vid varje steg i dess uppgift. När en sond identifierar misstänkta mönster utförs en djupare utredning av en sekundär AI-modell. Detta flernivåsystem förbättrar effektiviteten genom att fokusera beräkningsresurser endast när det behövs.
Goodfires övervakare är integrerade i Basetens plattform, vilket ger kunder möjlighet att anpassa vilka risker som ska övervakas—såsom offensiva hackningsförsök, missbruk relaterat till kemiska och biologiska vapen eller belöningsmanipulation—och att välja automatiska svar som händelselogging, manuell granskning eller helt avvisande av förfrågningar.
Tester på den öppen källkodsbaserade AI-agenten Kimi K3 visade betydande kostnadsbesparingar. Övervakning av cirka 1 500 sessioner kostade omkring 51 dollar med Goodfires sonder, jämfört med 233 dollar för en mindre avancerad AI-baserad övervakare och upp till 10 000 dollar för ett premiumalternativ. Sonderna fångade effektivt 94 % av de illvilliga hackningssessionerna, med en minimal andel falska positiva som ledde till att endast 8,7 % av säkra sessioner behövde sekundär granskning. Den extra fördröjningen från att köra flera sonder var försumbar och ökade modellens svarstid med mindre än 2 %.
Goodfires medgrundare och CTO Dan Balsam betonade fördelen med att avlyssna problematiskt beteende innan det manifesteras genom att upptäcka hot under utvärdering eller träningsfaser. Denna kapacitet är särskilt viktig för öppna modeller som saknar de kontrollerade skydd som proprietära system har och kan modifieras eller missbrukas av vilken utvecklare som helst.
Även om andra initiativ finns—Google DeepMind implementerade nyligen missbrukssensorn i sin Gemini-modell—fokuserar Goodfires ansats på att utnyttja befintliga modellberäkningar för att minska kostnader och öka realtidsövervakningens möjligheter. Deras långsiktiga vision är att bakåtkonstruera stora språkmodeller (LLMs) för att spåra beteenden till deras träningsursprung, vilket potentiellt kan förvandla modellutveckling till en mer precis ingenjörsdisciplin.
Goodfires innovation adresserar växande oro kring att AI-agenter kan undkomma kontrollerade miljöer och agera oförutsägbart eller illvilligt, en fråga som lyfts fram av senaste incidenter med öppna AI-modeller. Deras inside-out-övervakning utgör ett pragmatiskt steg mot att förbättra AI-säkerhet i stor skala, särskilt när öppna modeller blir allt mer spridda och tillgängliga.
Källor och ursprunglig rapportering
Läs den ursprungliga källan ↗

Kommentarer (0)
Inga kommentarer ännu. Börja diskussionen.
Skriv en kommentar
Kommentarer publiceras efter granskning. Ditt namn och kommentar syns offentligt. Konto