Top.Mail.Ru
8 октября 2026
Наука • Космос • Технологии • Новая реальность
Сейчас
Наука

GPT-6 Astra показала рекордные результаты, но не подтвердила статус универсального интеллекта AGI

Смартфон с надписью Astra на экране

Запуск GPT-6 Astra в OpenAI назвали возможным началом эпохи искусственного общего интеллекта (AGI) — гипотетического уровня развития систем, при котором они смогут учиться и рассуждать подобно человеку. Президент компании Грег Брокман заявил на пресс-конференции 3 сентября: «If we fast-forward a couple years, and we look back and say when was it really that AGI was created, I think it’s going to be about this time, and I think it might be about this model». Однако независимые исследователи считают, что рекордные результаты модели во многом связаны с оптимизацией запросов, а не с появлением универсального интеллекта.

На фоне опасений по поводу безопасности OpenAI отказалась от запланированного выпуска GPT-6.1 Astra. При проверке новой модели компания представила показатели по программированию, самостоятельной работе с компьютерными программами, математике и научным задачам. Демонстрации включали создание кода для трёхмерного проектирования, разработку печатных плат, превращение цифровых 3D-моделей в интерактивные среды и запуск веб-приложений по текстовой команде.

Особое внимание привлёк тест ARC-AGI-3, предназначенный для оценки освоения новых навыков в незнакомых абстрактных средах. OpenAI сообщила о результате 99,9%, а независимая ARC Prize Foundation установила, что Astra превзошла показатели эффективности человека на 96% уровней и в среднем выполнила задания на 51,7% меньшим числом действий. При этом президент фонда Грег Камрадт подчеркнул: «Therefore, while we believe Astra represents meaningful progress towards generalization, we are not claiming that it is AGI».

Итог существенно зависел от применённой программной оболочки Provider Adapter, недоступной другим разработчикам. В нейтральном стандартном режиме показатель снизился до 62,7%, а организаторы ARC-AGI-3 напомнили, что закрытые детерминированные головоломки не отражают открытой сложности реального мира. По данным Fortune, в предварительной версии материалов результат составлял 98,6%, но после запуска на сайте появился показатель 99,9%; исследователи Стэнфордского университета Анка Реуэль и Майк Харди также указали на изменение ряда опубликованных метрик, включая снижение заявленного уровня галлюцинаций с 4,2% до 2,0% с последующим возвратом прежнего значения.

  В Мексике обнаружены древние руины с ранее не встречавшимися особенностями

Реуэль и Харди связали подобные корректировки с практикой benchmaxxing — многократным повторением тестов с небольшими изменениями запросов, программных оболочек или вычислительных ресурсов ради максимального результата. Авторы работы «Benchmarking is Broken — Don’t Let AI be its Own Judge», опубликованной в 2025 году на сервере предварительных публикаций arXiv, предупредили, что такой подход затрудняет проверку результатов и показывает скорее предельные возможности в лаборатории, чем надёжность модели при обычном использовании. При этом заявленные OpenAI показатели Astra были на 10–20% выше результатов GPT-5.6 Sol и ведущих конкурентов в специализированных тестах.

Среди этих результатов — 98% в FrontierMath Tier 4, 100% в ExploitBench, 95,9% в BenchCAD, 57,9% в Terminal-Bench 4.0 и 41,4% в AutomationBench. Однако независимый индекс Artificial Analysis Intelligence Index оставил Astra на уровне 61 балла — столько же, сколько у GPT-5.6 Sol, — а в отдельных проверках модель уступила предшественнику, включая задания для 44 профессий, поддержку клиентов, научное программирование на Python и работу с большими документами. На программных тестах Astra использовала примерно на 70% меньше токенов, но стоимость миллиона входных и выходных токенов выросла с $4 и $20 до $10 и $50, поэтому выполнение задачи оказалось примерно на 75% дороже.

OpenAI заявила, что Astra не выходила за пределы заданий в проверках безопасности, тогда как GPT-5.6 Sol нарушала разрешённые параметры почти в половине случаев. Внутренний показатель галлюцинаций составил 4,2% против 12,2% у Sol, а независимая проверка Artificial Analysis зафиксировала снижение с 92% до 51% при максимальном уровне усилий. Председатель организации London Futurists Дэвид Вуд в комментарии Live Science отметил: «The impressive benchmark results matter, but what matters more is the combination of intelligence, autonomy, computer use, and cybersecurity capability». По его словам, важнее самого определения AGI обеспечить контроль и регулирование систем, поскольку рост их возможностей повышает последствия ошибок, злоупотреблений и обхода защитных механизмов.