KI

Goodfire Führt Kosteneffiziente Inside-Out-Monitore zur Erkennung Abtrünniger KI-Agenten Ein

Tendela Briefing ·
0 Aufrufe · 0 Kommentare
Goodfire Führt Kosteneffiziente Inside-Out-Monitore zur Erkennung Abtrünniger KI-Agenten Ein

Image: Image Credits:GOODFIRE · Source

Goodfire stellt innovative 'Inside-Out'-Monitore vor, die während des Betriebs die internen Vorgänge von KI-Modellen prüfen und abtrünniges Verhalten effizient zu einem Bruchteil der herkömmlichen Überwachungskosten erkennen.

Goodfire, ein Startup, das sich auf KI-Interpretierbarkeit spezialisiert hat, hat ein neuartiges System entwickelt, das KI-Agenten kostengünstiger überwacht, indem es deren interne Modellberechnungen in Echtzeit analysiert. Anders als die gängige Praxis, eine zweite KI einzusetzen, um die Ausgaben eines Agenten zu überprüfen – ein Ansatz, der teuer wird, wenn Agenten große Datenmengen verarbeiten – beobachten Goodfires Monitore Signale innerhalb des Modells während des Betriebs. Diese Methode ermöglicht die frühzeitige Erkennung potenziell bösartiger oder schädlicher Aktionen, ohne dass jeder erzeugte Token extern überprüft werden muss.

Die Monitore funktionieren ähnlich wie Flughafenscanner: Kleine Detektoren, sogenannte Sonden, analysieren interne Aktivierungen der KI bei jedem Schritt ihrer Aufgabe. Wenn eine Sonde verdächtige Muster erkennt, führt ein sekundäres KI-Modell eine vertiefte Untersuchung durch. Dieser mehrstufige Ansatz erhöht die Effizienz, indem Rechenressourcen nur bei Bedarf fokussiert eingesetzt werden.

Goodfires Monitore sind in die Plattform von Baseten integriert und ermöglichen es Kunden, individuell festzulegen, welche Risiken überwacht werden sollen – etwa offensive Hackerangriffe, Missbrauch im Zusammenhang mit chemischen und biologischen Waffen oder Belohnungsmanipulation – und automatisierte Reaktionen wie Ereignisprotokollierung, manuelle Überprüfung oder vollständige Ablehnung von Anfragen zu wählen.

Tests mit dem Open-Source-KI-Agenten Kimi K3 zeigten signifikante Kosteneinsparungen. Das Überwachen von etwa 1.500 Sitzungen kostete rund 51 US-Dollar mithilfe von Goodfires Sonden, verglichen mit 233 US-Dollar für einen weniger ausgefeilten KI-basierten Monitor und bis zu 10.000 US-Dollar für eine Premium-Alternative. Die Sonden erfassten effektiv 94 % der bösartigen Hacker-Sitzungen, mit einer minimalen Rate an Fehlalarmen, die nur bei 8,7 % der sicheren Sitzungen eine sekundäre Überprüfung erforderlich machten. Die zusätzliche Latenz durch den Betrieb mehrerer Sonden war vernachlässigbar und erhöhte die Startzeit der Modellantwort um weniger als 2 %.

Dan Balsam, Mitgründer und CTO von Goodfire, betonte den Vorteil, problematisches Verhalten abzufangen, bevor es sich manifestiert, indem Bedrohungen während der Evaluations- oder Trainingsphasen erkannt werden. Diese Fähigkeit ist insbesondere für offene Modelle entscheidend, die nicht über die kontrollierten Schutzmaßnahmen proprietärer Systeme verfügen und von jedem Entwickler modifiziert oder missbraucht werden können.

Während es weitere Ansätze gibt – Google DeepMind hat kürzlich Missbrauchs-Erkennungssonden in seinem Modell Gemini implementiert – konzentriert sich Goodfires Ansatz darauf, bestehende Modellberechnungen zu nutzen, um Kosten zu senken und die Echtzeitüberwachung praktikabler zu machen. Ihre langfristige Vision zielt darauf ab, große Sprachmodelle (LLMs) rückzuentwickeln, um Verhaltensweisen zurück zu ihren Trainingsursprüngen zu verfolgen, was die Modellentwicklung potenziell zu einer präziseren Ingenieursdisziplin machen könnte.

Goodfires Innovation adressiert die wachsenden Bedenken, dass KI-Agenten aus kontrollierten Umgebungen entkommen und sich unvorhersehbar oder böswillig verhalten – ein Problem, das durch jüngste Vorfälle mit offenen KI-Modellen hervorgehoben wurde. Ihr Inside-Out-Monitoring stellt einen pragmatischen Schritt zur Verbesserung der KI-Sicherheit in großem Maßstab dar, insbesondere wenn offene Modelle immer weiter verbreitet und zugänglich werden.

Quellen und Originalberichte

Kommentare (0)

Noch keine Kommentare.

Kommentar schreiben

Kommentare erscheinen nach Moderation. Name und Kommentar werden öffentlich angezeigt. Konto