AI Leaderboard-plattformen Arena nästan fördubblar värderingen till 3,1 miljarder dollar efter finansieringsrunda på 200 miljoner dollar

Bild: TechCrunch · Källa
Arena, en crowdsourcad plattform för rankning av AI-modeller, samlade in 200 miljoner dollar lett av Lightspeed och Khosla, vilket ökade dess värdering till 3,1 miljarder dollar. Den mäter nu AI-modeller på justeringsproblem som lögn och otillåtna handlingar.
Arena, en plattform som härstammar från ett forskningsprojekt 2023 vid UC Berkeley, har nästan fördubblat sin värdering till 3,1 miljarder dollar efter en Series B-finansieringsrunda på 200 miljoner dollar ledd av Lightspeed Venture Partners och Khosla Ventures. Denna snabba värderingsökning sker bara 10 månader efter en Series A-runda på 150 miljoner dollar som värderade företaget till 1,7 miljarder dollar.
Arena lockade initialt användare genom att crowdsourca utvärderingar av AI-modeller via sin gratis leaderboard, där tiotals miljoner månatliga besökare skickar in prompts och betygsätter vilken AI-modell som presterar bäst. Denna gemenskapsstyrda feedback har gett värdefulla insikter i AI-modellers prestanda över olika uppgifter.
I september 2025 lanserade Arena sin kommersiella produkt, AI Evaluations, som är utformad för att erbjuda detaljerad prestandaanalys för AI-laboratorier och företag baserat på användarfeedback. Denna tjänst adresserar växande oro över att AI-modeller ofta manipulerar befintliga benchmarks genom att lära sig prestera bra på tester utan att faktiskt förbättra funktionella förmågor.
Företaget betonar utmaningen med att utvärdera AI på ett säkert och exakt sätt i takt med att modeller snabbt utvecklas. Arena positionerar sig som en neutral tredje part som mäter AI-justering och säkerhet i verkliga scenarier, bortom statiska benchmarks som modeller kan utnyttja.
För att främja detta mål har Arena lagt till en ny justeringskategori till sin leaderboard. Denna kategori utvärderar modeller på problem som otillåtna handlingar—där en AI utför handlingar den inte blivit instruerad att göra—falsk tilldelning av uttalanden eller fakta, och bedrägliga slutföranden, vilket hänvisar till modeller som falskeligen påstår sig ha utfört uppgifter.
För närvarande leder OpenAI:s uppsättning modeller den preliminära justeringsleaderboarden, med Anthropics Claude Opus 5.5 och Claude Fable på sjätte respektive nionde plats. Arenas expansion till justeringsmätningar speglar ett bredare industrifokus på inte bara AI:s kapacitet utan också etiskt och pålitligt beteende.
Den senaste finansieringsrundan inkluderade deltagande från Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z och Felicis, vilket lyfter fram stark investerarförtroende för Arenas mål att tillhandahålla transparenta, verklighetsbaserade bedömningar av AI-säkerhet och effektivitet.
Källor och ursprunglig rapportering
Läs den ursprungliga källan ↗

Kommentarer (0)
Inga kommentarer ännu. Börja diskussionen.
Skriv en kommentar
Kommentarer publiceras efter granskning. Ditt namn och kommentar syns offentligt. Konto