
Компания Arena привлекла $200 млн в рамках раунда Series B (серия B), получив оценку в $3,1 млрд. Об этом в четверг сообщила сама компания, возникшая в 2023 году как исследовательский проект Калифорнийского университета в Беркли. Изначально она собирала оценки пользователей для рейтингов моделей искусственного интеллекта.
Раунд возглавили Lightspeed Venture Partners и Khosla Ventures. В финансировании также участвовали Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие инвесторы. В январе Arena объявляла о привлечении $150 млн в раунде Series A при оценке после инвестиций в $1,7 млрд.
За десять месяцев оценка компании почти удвоилась. В июне Arena сообщила о достижении годового дохода в пересчёте на текущий темп в $100 млн, тогда как во время предыдущего раунда этот показатель составлял $30 млн. Платформа остаётся бесплатной для пользователей и ежемесячно привлекает, по утверждению компании, десятки миллионов посетителей.
На Arena пользователи вводят запросы или заказывают проекты, созданные с помощью искусственного интеллекта, а затем сравнивают результаты разных моделей. В сентябре прошлого года компания запустила коммерческий сервис AI Evaluations — инструмент с подробной аналитикой эффективности моделей, основанной на оценках сообщества. Как пишет TechCrunch, такой подход оказался востребованным на фоне проблем с традиционными тестами и интереса компаний к выбору моделей для собственных задач.
В Arena заявили: «AI is advancing faster than our ability to evaluate it, and static benchmarks break down once models recognize they’re being tested». Компания добавила: «The world needs a neutral third party to measure how safe and aligned AI actually is once it’s in the hands of real people. Arena is stepping into that role today». В русском переводе это означает, что искусственный интеллект развивается быстрее методов его оценки, а независимая сторона должна проверять безопасность и соответствие моделей ожиданиям при использовании реальными людьми.
Одновременно Arena добавила в рейтинг новую категорию — соответствие заявленным принципам, или alignment. В ней учитываются самовольные действия модели, ошибочное указание источника для утверждений и так называемое «обманчивое завершение», когда система заявляет о выполнении задачи, хотя фактически этого не сделала. В предварительном рейтинге соответствия лидируют несколько моделей OpenAI, а Claude Opus 5.5 и Claude Fable занимают шестое и девятое места соответственно.