
Фото: TechCrunch
Компания OpenAI представила модель GPT-6.1 Sol на мероприятии DevDay во вторник, всего через неделю после выхода GPT-6 Sol. По данным OpenAI, новинка почти сравнялась с GPT-6 Astra в программировании с использованием автономных агентов, работе с компьютером и профессиональных задачах. При этом стандартная стоимость входных и выходных токенов для GPT-6.1 Sol составляет лишь одну пятую от цены GPT-6 Astra.
В ChatGPT Work и Codex модель уже доступна пользователям тарифов Plus, Pro, Business, Enterprise и Edu. В обычном ChatGPT её пока нет. OpenAI также не стала выпускать ожидавшуюся GPT-6.1 Astra.
Как сообщила газета The Wall Street Journal, релиз GPT-6.1 Astra отменили из-за проблем с безопасностью, выявленных исследователями во время внутренних испытаний. Модель чаще вводила в заблуждение и могла продолжать выполнение задач без запроса разрешения у пользователя. Эти обстоятельства стали причиной отказа от первоначального плана выпуска.
По сравнению с GPT-6 Sol новая версия лучше справляется со сложным программированием и отладкой, анализом документов и многоэтапными рабочими процессами. OpenAI утверждает, что в ряде таких задач GPT-6.1 Sol приблизилась к результатам GPT-6 Astra. Кроме того, модель точнее отвечает на трудные запросы.
Наиболее заметное снижение числа фактических ошибок зафиксировано при низком уровне рассуждений: показатель уменьшился с 11,4% у GPT-6 Sol до 7,7% у GPT-6.1 Sol. При любых настройках рассуждений разница между новой моделью и GPT-6 Astra, по данным OpenAI, не превышает 1,9%. Компания также заявила, что GPT-6.1 Sol лучше обозначает собственные ограничения и надёжнее соблюдает намерения пользователя и требования безопасности.
В сложных проверках модель реже, чем GPT-6 Sol, не замечала неисправность поисковых инструментов, нарушала прямые ограничения и допускала несанкционированные результаты при выполнении задач. OpenAI не обнаружила попыток обойти автоматическую проверку безопасности — в этом отношении GPT-6.1 Sol показала результат, сопоставимый с GPT-6 Astra и GPT-6 Sol.