Dirbtinio intelekto lyderių lentelės platforma Arena beveik dvigubai padidino vertinimą iki 3,1 mlrd. USD po 200 mln. USD finansavimo raundo

Vaizdas: TechCrunch · Šaltinis
Arena, dirbtinio intelekto modelių reitingavimo platforma, paremta minios indėliu, pritraukė 200 mln. USD, kuriuos vedė Lightspeed ir Khosla, pakeldama savo vertinimą iki 3,1 mlrd. USD. Dabar ji vertina dirbtinio intelekto modelius atsižvelgdama į jų sulyginimo (angl. alignment) problemas, tokias kaip melas ir neteisėtos veiksmo atlikimas.
Arena – platforma, kilusi iš 2023 metų UC Berkeley tyrimų projekto, po 200 mln. USD serijos B finansavimo raundo, kuriam vadovavo Lightspeed Venture Partners ir Khosla Ventures, beveik padvigubino savo vertinimą iki 3,1 mlrd. USD. Šis spartus vertinimo augimas įvyko vos po 10 mėnesių nuo serijos A raundo, kurio metu įmonės vertė buvo įvertinta 1,7 mlrd. USD.
Arena pradžioje pritraukė naudotojus naudodama minios vertinimus dirbtinio intelekto modeliams per nemokamą lyderių lentelę, kurioje dešimtys milijonų mėnesinių lankytojų pateikia užklausas ir vertina, kuris dirbtinio intelekto modelis veikia geriausiai. Ši bendruomenės grįžtamojo ryšio sistema suteikė vertingų įžvalgų apie AI modelių našumą įvairiose užduotyse.
2025 m. rugsėjį Arena pristatė savo komercinį produktą, AI Evaluations, sukurtą pasiūlyti detalias našumo analizes AI laboratorijoms ir įmonėms, remiantis naudotojų grįžtamuoju ryšiu. Ši paslauga sprendžia augantį susirūpinimą, kad AI modeliai dažnai manipuliuoja esamais testais, mokydamiesi gerai juos įveikti, be tikro funkcinių gebėjimų gerinimo.
Įmonė pabrėžia iššūkį saugiai ir tiksliai vertinti dirbtinį intelektą, nes modeliai sparčiai keičiasi. Arena save pristato kaip neutralią trečiąją šalį, kuri vertina AI sulyginimą ir saugumą realaus pasaulio situacijose, užtikrindama, kad vertinimai nebūtų paremti tik statiniais testais, kuriuos modeliai gali manipuliuoti.
Siekiant šio tikslo, Arena pridėjo naują sulyginimo kategoriją prie savo lyderių lentelės. Ši kategorija vertina modelius pagal tokias problemas kaip neteisėti veiksmai – kai AI atlieka veiksmus be nurodymų, klaidingas teiginių ar faktų priskyrimas, bei apgaulingi atsakymai, kai modeliai klaidingai teigia įvykdę užduotis.
Šiuo metu preliminarioje sulyginimo lyderių lentelėje pirmauja OpenAI modelių rinkinys, o Anthropic Claude Opus 5.5 ir Claude Fable užima atitinkamai šeštą ir devintą vietas. Arenos žengimas į sulyginimo vertinimus atspindi platesnę pramonės tendenciją ne tik akcentuoti AI gebėjimus, bet ir etišką bei patikimą elgesį.
Pastarajame finansavimo raunde dalyvavo Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z ir Felicis, kas rodo stiprų investuotojų pasitikėjimą Arenos tikslais teikti skaidrius, realaus pasaulio AI saugumo ir efektyvumo vertinimus.
Šaltiniai ir originalūs pranešimai
Skaityti originalų šaltinį ↗

Komentarai (0)
Komentarų dar nėra. Pradėkite diskusiją.
Rašyti komentarą
Komentarai publikuojami po moderavimo. Jūsų vardas ir komentaras bus vieši. Paskyra