KI

AI Leaderboard-plattform Arena nesten dobler verdsettelsen til 3,1 milliarder dollar etter en finansieringsrunde på 200 millioner dollar

Tendela Briefing ·
1 visninger · 0 Kommentarer
Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months | TechCrunch

Bilde: TechCrunch · Kilde

Arena, en crowdsourcet AI-modell rangeringsplattform, hentet inn 200 millioner dollar ledet av Lightspeed og Khosla, noe som økte verdsettelsen til 3,1 milliarder dollar. Den måler nå AI-modeller på justeringsproblemer som løgn og uautoriserte handlinger.

Arena, en plattform som stammer fra et forskningsprosjekt i 2023 ved UC Berkeley, har nesten doblet verdsettelsen til 3,1 milliarder dollar etter en Series B-finansieringsrunde på 200 millioner dollar ledet av Lightspeed Venture Partners og Khosla Ventures. Denne raske økningen i verdsettelse kommer bare 10 måneder etter en Series A-runde på 150 millioner dollar som verdsatte selskapet til 1,7 milliarder dollar.

Arena tiltrakk seg først brukere ved å crowdsourca evalueringer av AI-modeller gjennom sin gratis leaderboard, hvor titalls millioner månedlige besøkende sender inn prompts og vurderer hvilken AI-modell som presterer best. Denne fellesskapsdrevne tilbakemeldingen har gitt verdifull innsikt i ytelsen til AI-modeller på ulike oppgaver.

I september 2025 lanserte Arena sitt kommersielle produkt, AI Evaluations, designet for å tilby detaljert ytelsesanalyse for AI-laboratorier og bedrifter basert på brukerfeedback. Denne tjenesten tar tak i økende bekymringer om at AI-modeller ofte manipulerer eksisterende benchmarks ved å lære seg å prestere godt på tester uten reell forbedring av funksjonelle evner.

Selskapet understreker utfordringen med å evaluere AI trygt og nøyaktig ettersom modellene utvikler seg raskt. Arena posisjonerer seg som en nøytral tredjepart som måler AI-justering og sikkerhet i virkelige scenarioer, utover statiske benchmarks som modellene kan utnytte.

For å fremme dette målet har Arena lagt til en ny justeringskategori til sin leaderboard. Denne kategorien evaluerer modeller på problemer som uautoriserte handlinger—der en AI utfører handlinger den ikke ble instruert til—falsk tilskrivning av utsagn eller fakta, og villedende fullføringer, som refererer til modeller som feilaktig hevder å ha utført oppgaver.

Foreløpig leder OpenAIs modellutvalg den foreløpige justerings-leaderboarden, med Anthropics Claude Opus 5.5 og Claude Fable på henholdsvis sjette og niende plass. Arenas utvidelse til justeringsmålinger reflekterer et bredere bransjefokus på ikke bare AI-evner, men også etisk og pålitelig oppførsel.

Den nylige finansieringsrunden inkluderte deltagelse fra Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z og Felicis, noe som viser sterk investor-tillit til Arenas mål om å tilby transparente, virkelighetsbaserte vurderinger av AI-sikkerhet og effektivitet.

Kilder og originalrapportering

Kilde: TechCrunch
Les originalkilden ↗

Kommentarer (0)

Ingen kommentarer ennå. Start diskusjonen.

Skriv en kommentar

Kommentarer publiseres etter moderering. Ditt navn og kommentar vil være synlige offentlig. Konto