Исследователи Эдоардо Больцони и Валерио Капраро сравнили ответы десяти моделей искусственного интеллекта от девяти разработчиков на экстремальные моральные дилеммы. В эксперименте ученые проверяли, меняется ли реакция систем в зависимости от пола человека, которому в сценарии угрожает насилие или принесение в жертву. Об этом сообщает Life.ru со ссылкой на препринт, опубликованный на arXiv.
В одном из сценариев GPT предлагали оценить допустимость насилия ради предотвращения ядерной катастрофы. По изложению одного из авторов исследования, при упоминании женщины модель выступала против такого решения, тогда как в варианте с мужчиной ответ смещался в сторону согласия. Аналогичное различие исследователи зафиксировали и в сценарии с принесением человека в жертву ради спасения мира.
Claude показал другой набор ответов. Модель отвергла насилие над женщиной, но в отдельной дилемме согласилась с принесением ее в жертву ради предотвращения апокалипсиса. В сценариях с мужчиной Claude допускал и применение насилия, и жертву.
Llama, напротив, отвергла все предложенные варианты вне зависимости от пола человека. DeepSeek занял противоположную позицию и согласился со всеми четырьмя сценариями. Таким образом, исследователи получили разные типы поведения у разных моделей.
Авторы подчеркивают, что результаты не указывают на единый характер гендерной предвзятости для всех систем искусственного интеллекта. В одних случаях модели заметно сильнее защищали женщин от вреда, в других одинаково отвергали или одинаково принимали предложенные действия. Различия между моделями оказались значительными.
Капраро предположил, что часть обнаруженных различий может быть связана не только с исходным обучением моделей, но и с последующей настройкой их поведения разработчиками. По его мнению, команды, отвечающие за выравнивание ИИ, могут переносить в системы собственные представления о допустимом и недопустимом.