Компания Anthropic во вторник представила модель Opus 5.5, заявив о новом рекорде в программировании и интеллектуальной работе. По данным TechCrunch, разработчик утверждает, что новинка во многих тестах превзошла более крупную модель Fable. Кроме того, Opus 5.5 справилась с несколькими неформальными заданиями, которые Fable выполнить не смогла.
Одновременно Anthropic снизила стоимость использования модели. Миллион выходных токенов Opus 5.5 стоит 20 долларов против 25 долларов у предыдущей версии, а цены по другим показателям также уменьшились. Для работы новой модели требуется меньше вычислительных ресурсов, поэтому она запускается быстрее.
Изменения затронули и стиль ответов Opus 5.5. Модель стала реже использовать специализированный жаргон и чаще размещать ключевую информацию в начале сообщения. Предыдущая версия Opus 5 вышла 24 июля, то есть новый релиз состоялся примерно через два месяца.
Anthropic планирует в ближайшие недели выпустить Sonnet 5.5 и Haiku 5.5. В компании ожидают, что эти модели также получат улучшения производительности. По возможностям в биологии и кибербезопасности Opus 5.5 сопоставима с Mythos, поэтому для неё действуют те же меры защиты, что и для Fable.
Эти ограничения касаются, в частности, поиска уязвимостей в скомпилированных программах и разработки распознаваемого биологического оружия. Opus 5.5 стала первой моделью Anthropic после того, как генеральный директор компании Дарио Амодеи поддержал идею замедлить развитие передовых систем, чтобы темпы совершенствования технологий соответствовали прогрессу в области их согласования с требованиями безопасности.
«Я пришел к убеждению, что для полного устранения рисков требуется еще большая осторожность — не только инвестиции в предотвращение рисков, но и регулирование темпов развития возможностей, чтобы предотвращение рисков успевало за ними», — написал Амодеи ранее в этом месяце. Обучение безопасности Opus 5.5 в целом проходило по схеме, близкой к предыдущим моделям: оно включало проверку согласования и оценку до выпуска со стороны внешних организаций, включая METR и Frontier Design. Anthropic также сообщила о подготовке более совершенных систем обучения и оценки для будущих моделей, в том числе улучшенных инструментов защиты и мониторинга.