La Plataforma de Clasificación de IA Arena Casi Duplica su Valoración a $3,1B Tras Ronda de Financiamiento de $200M

Image: TechCrunch · Source
Arena, una plataforma de clasificación de modelos de IA basada en la colaboración masiva, recaudó $200 millones liderados por Lightspeed y Khosla, aumentando su valoración a $3.1 mil millones. Ahora evalúa modelos de IA en problemas de alineación como mentir y acciones no autorizadas.
Arena, una plataforma que se originó a partir de un proyecto de investigación en 2023 en UC Berkeley, casi ha duplicado su valoración a $3.1 mil millones tras una ronda de financiación Serie B de $200 millones liderada por Lightspeed Venture Partners y Khosla Ventures. Este rápido aumento en valoración ocurre apenas 10 meses después de una ronda Serie A de $150 millones que valoró a la empresa en $1.7 mil millones.
Arena inicialmente atrajo usuarios mediante la colaboración masiva para evaluar modelos de IA a través de su tablero gratuito, donde decenas de millones de visitantes mensuales envían indicaciones y califican qué modelo de IA funciona mejor. Este feedback impulsado por la comunidad ha proporcionado valiosas percepciones sobre el estado del desempeño de modelos de IA en diversas tareas.
En septiembre de 2025, Arena lanzó su producto comercial, AI Evaluations, diseñado para ofrecer análisis detallados de desempeño para laboratorios de IA y empresas basados en retroalimentación del usuario. Este servicio aborda preocupaciones crecientes de que los modelos de IA a menudo manipulan los puntos de referencia existentes aprendiendo a obtener buenos resultados en pruebas sin mejorar genuinamente sus capacidades funcionales.
La empresa enfatiza el desafío de evaluar la IA de manera segura y precisa a medida que los modelos evolucionan rápidamente. Arena se posiciona como un tercero neutral que mide la alineación y seguridad de la IA en escenarios del mundo real, más allá de los puntos de referencia estáticos que los modelos pueden explotar.
Para avanzar en este objetivo, Arena añadió una nueva categoría de alineación a su tablero. Esta categoría evalúa modelos en cuestiones como acciones no autorizadas, donde una IA lleva a cabo acciones para las que no fue instruida, atribución falsa de declaraciones o hechos, y completaciones engañosas, que se refieren a modelos que falsamente afirman haber cumplido tareas.
Actualmente, la suite de modelos de OpenAI lidera el tablero preliminar de alineación, con Claude Opus 5.5 y Claude Fable de Anthropic apareciendo en sexto y noveno lugar respectivamente. La expansión de Arena hacia métricas de alineación refleja un enfoque más amplio en la industria, no solo en la capacidad de la IA sino también en un comportamiento ético y confiable.
La reciente ronda de financiamiento contó con la participación de Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z y Felicis, destacando la fuerte confianza de los inversionistas en el objetivo de Arena de proporcionar evaluaciones transparentes y del mundo real sobre la seguridad y efectividad de la IA.
Fuentes e informes originales
Read the original source ↗

Comentarios (0)
Aún no hay comentarios.
Escribe un comentario
Los comentarios se publican tras moderación. Tu nombre y comentario serán públicos. Cuenta