
Компания Anthropic представила исследование о применении систем искусственного интеллекта для улучшения настройки других ИИ-моделей. Работа посвящена снижению нежелательных моделей поведения, которые проверяются специальными тестами. Авторы сообщили, что автоматизированные системы улучшили результаты по всем 10 выбранным проверкам без ухудшения общих показателей модели.
Разработку возглавил участник программы Anthropic Fellows Чэнь Юэхань. Система изучает доступные научные материалы, предлагает способ обучения и затем обучает модель по выбранному методу в течение 30 минут. Удачные подходы сохраняются для следующих итераций, а неэффективные отсеиваются, что позволяет ускорить исследования и проводить их в большем масштабе. Об исследовании сообщила Anthropic.
В компании считают, что результаты дают предварительные основания говорить о практической применимости автоматизированного дообучения для настройки ИИ в ближайшей перспективе. Такой подход предполагает, что модели смогут участвовать в совершенствовании методов собственного обучения. В исследовании этот процесс связывают с рекурсивным самоулучшением систем искусственного интеллекта.
Авторы сопоставили работу Automated Alignment Researcher с деятельностью специалистов-людей. Согласно приведенной в статье оценке, лучший метод системы в среднем превосходит предложения опытных исследователей, полученные за 6 часов. Также указано, что направления исследований под руководством человека не дали более высоких результатов.
В Anthropic оценили стоимость работы автоматизированного исследователя примерно в $4 за час вычислений через программный интерфейс, тогда как час работы исследователя-человека обходится компании в $150. При этом авторы отметили ограничения метода. Его эффективность зависит от того, насколько используемые тесты соответствуют реальным целям настройки ИИ, а сами тесты и научная база требуют постоянного обновления и расширения.








