AI

Платформа Рейтинга ИИ Arena Почти Удваивает Оценку до 3,1 млрд долларов После Раунда Финансирования в 200 млн долларов

Tendela Briefing ·
1 просмотров · 0 Комментарии
Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months | TechCrunch

Image: TechCrunch · Source

Arena, платформа для рейтинга моделей ИИ на основе краудсорсинга, привлекла 200 млн долларов под руководством Lightspeed и Khosla, что увеличило её оценку до 3,1 млрд долларов. Сейчас она оценивает модели ИИ по вопросам согласованности, включая ложь и несанкционированные действия.

Arena, платформа, возникшая из исследовательского проекта 2023 года в Университете Калифорнии в Беркли, почти удвоила свою оценку до 3,1 млрд долларов после раунда финансирования серии B на 200 млн долларов, возглавляемого Lightspeed Venture Partners и Khosla Ventures. Этот быстрый рост оценки произошёл всего через 10 месяцев после раунда серии A на 150 млн долларов, который оценил компанию в 1,7 млрд долларов.

Изначально Arena привлекала пользователей с помощью краудсорсинга оценки моделей ИИ через свою бесплатную таблицу лидеров, где десятки миллионов посетителей ежемесячно подают запросы и оценивают, какой ИИ работает лучше всего. Эта обратная связь от сообщества предоставила ценные инсайты о состоянии производительности моделей ИИ в различных задачах.

В сентябре 2025 года Arena запустила коммерческий продукт AI Evaluations, предназначенный для предоставления детальной аналитики производительности лабораториям ИИ и предприятиям на основе отзывов пользователей. Эта услуга отвечает на растущую обеспокоенность тем, что модели ИИ часто «обманывают» существующие эталонные тесты, обучаясь хорошо показывать результаты на тестах без реального улучшения функциональных возможностей.

Компания подчёркивает сложность безопасной и точной оценки ИИ в условиях быстрого развития моделей. Arena позиционирует себя как нейтральная третья сторона, которая измеряет согласованность и безопасность ИИ в реальных сценариях, выходя за пределы статических эталонов, которые модели могут использовать.

Для продвижения этой цели Arena добавила новую категорию согласованности в свою таблицу лидеров. Эта категория оценивает модели по таким вопросам, как несанкционированные действия — когда ИИ выполняет действия, на которые не была дана инструкция, ложное приписывание высказываний или фактов, а также обманчивые завершения, то есть когда модели ложно утверждают, что выполнили задания.

В настоящее время линейка моделей OpenAI лидирует в предварительном рейтинге согласованности, за ней следуют Claude Opus 5.5 и Claude Fable от Anthropic, занимающие шестое и девятое места соответственно. Расширение Arena в области метрик согласованности отражает более широкий интерес индустрии не только к способностям ИИ, но и к этичному и надёжному поведению.

В последнее раунде финансирования приняли участие Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z и Felicis, что подчёркивает высокий уровень доверия инвесторов к цели Arena – предоставлять прозрачные и реалистичные оценки безопасности и эффективности ИИ.

Источники и первоисточники

Комментарии (0)

Комментариев пока нет. Начните обсуждение.

Написать комментарий

Комментарии публикуются после модерации. Ваше имя и комментарий будут видны всем. Аккаунт