Goodfire запускает экономичные средства внутреннего мониторинга для обнаружения rogue-агентов ИИ

Image: Image Credits:GOODFIRE · Source
Goodfire представляет инновационные 'inside-out' мониторы, которые во время работы анализируют внутренние процессы моделей ИИ, эффективно выявляя rogue-поведение при значительно меньших затратах по сравнению с традиционным мониторингом.
Goodfire, стартап, специализирующийся на интерпретируемости ИИ, запустил новую систему для более экономичного мониторинга агентов ИИ путем анализа их внутренних вычислений модели в реальном времени. В отличие от привычной практики использования второго ИИ для проверки выводов агента — подхода, который становится дорогим при обработке больших объемов данных — мониторы Goodfire наблюдают сигналы внутри модели во время её работы. Этот метод позволяет обнаруживать потенциально вредоносные действия на ранней стадии без необходимости внешней проверки каждого сгенерированного токена.
Мониторы работают аналогично сканерам безопасности в аэропортах: небольшие детекторы, называемые пробами, анализируют внутренние активации ИИ на каждом шаге его задачи. Когда проба выявляет подозрительные шаблоны, вторичная модель ИИ проводит более глубокое расследование. Такой многоуровневый подход повышает эффективность, сосредотачивая вычислительные ресурсы только при необходимости.
Мониторы Goodfire интегрированы с платформой Baseten, позволяя клиентам настраивать отслеживаемые риски — например, наступательные попытки взлома, неправильное использование, связанное с химическим и биологическим оружием, или reward hacking — и выбирать автоматические реакции: регистрацию событий, ручной обзор или прямое отклонение запроса.
Тесты на открытом агенте ИИ Kimi K3 показали значительную экономию. Мониторинг примерно 1500 сессий стоил около 51 доллара с использованием проб Goodfire, по сравнению с 233 долларами для менее продвинутого ИИ-монитора и до 10 000 долларов за премиальный вариант. Пробы эффективно ловили 94% вредоносных хакерских сессий при минимальном уровне ложных срабатываний, что приводило к необходимости вторичного анализа лишь в 8,7% безопасных сессий. Дополнительная задержка от запуска нескольких проб была незначительной, увеличивая стартовое время отклика модели менее чем на 2%.
Соучредитель и CTO Goodfire Дан Балсам подчеркнул преимущество перехвата проблемного поведения еще до его проявления, обнаруживая угрозы на этапах оценки или обучения. Эта возможность особенно важна для открытых моделей, не имеющих контролируемых защит проприетарных систем и доступных для модификации или неправильного использования любыми разработчиками.
Хотя существуют и другие инициативы — Google DeepMind недавно внедрила пробы обнаружения неправильного использования в своей модели Gemini — подход Goodfire сосредоточен на использовании существующих вычислений модели для снижения затрат и повышения возможностей мониторинга в реальном времени. Их долгосрочное видение включает реверс-инжиниринг крупных языковых моделей (LLM) для отслеживания поведения до источников обучения, потенциально превращая разработку моделей в более точную инженерную дисциплину.
Инновация Goodfire отвечает растущим опасениям по поводу агентов ИИ, выходящих из-под контроля и действующих непредсказуемо или вредоносно — проблему, подчеркнутую последними инцидентами с открытыми моделями ИИ. Их внутри-ориентированный мониторинг представляет прагматичный шаг на пути к повышению безопасности ИИ в больших масштабах, особенно по мере роста популярности и доступности открытых моделей.
Источники и первоисточники
Read the original source ↗

Комментарии (0)
Комментариев пока нет. Начните обсуждение.
Написать комментарий
Комментарии публикуются после модерации. Ваше имя и комментарий будут видны всем. Аккаунт