Стартап Vals разрабатывает систему оценки искусственного интеллекта, которая должна заменить устаревшие методы тестирования моделей. Компания считает, что традиционные бенчмарки (сравнительные тесты) уже не успевают за развитием технологий, а их открытые задания позволяют разработчикам заранее обучать на них свои системы. Поэтому результаты таких проверок могут не отражать реальные возможности моделей.
Vals появилась в 2024 году и менее чем за два года заметно укрепила позиции в технологической отрасли. В прошлом году стартап привлёк посевные инвестиции во главе с 8VC и Bloomberg Beta, а в прошлом месяце получил ещё 40 млн долларов в раунде серии A, который возглавила Andreessen Horowitz. О развитии компании сообщает TechCrunch.
Сооснователю Vals Раяну Кришнану 25 лет. До запуска собственного проекта он проходил стажировку в Palantir, а во время учёбы в Стэнфорде работал в Microsoft и лаборатории искусственного интеллекта университета. По словам Кришнана, идея стартапа возникла из наблюдений за тем, как академические тесты перестают соответствовать возможностям быстро развивающихся моделей.
«Мы видели, как на рынок быстро выходило множество новых, очень способных моделей, а академические бенчмарки [не] успевали за этим передовым развитием», — сказал Кришнан. Он считает, что проверки должны показывать, способны ли системы выполнять задачи, которые разработчики обещают пользователям, а не только демонстрировать общий объём усвоенных знаний.
В отличие от многих публичных систем тестирования, Vals не раскрывает конкретные задания. Стартап проверяет модели на выполнении сложной работы в отдельных сферах, включая право, финансы и программирование, а также оценивает возможные негативные последствия их применения. «Мы на самом деле смотрим на реальные последствия работы моделей. Могут ли они в каждой области выполнять работу, создавая продукт такого же качества, как человек?» — пояснил Кришнан.
Набор направлений расширяется: Vals проводит проверки рекурсивного самоулучшения, изучает применение моделей в психическом здоровье, кибербезопасности, биологической безопасности и праве вооружённых конфликтов, включая соблюдение Женевской конвенции. Компании платят стартапу за тестирование, поскольку результаты помогают находить слабые места и совершенствовать модели, а сами оценки уже учитываются при выборе искусственного интеллекта для приобретения. За последний год выручка Vals выросла в восемь раз, штат увеличился с восьми до 25 человек, а в дальнейшем компания намерена переехать в более крупный офис, нанять ещё 10–15 сотрудников и развивать программу оценки моделей для федеральных ведомств.