
Группа ученых из Великобритании и Канады опубликовала статью в журнале arXiv, в которой они обсуждают проблему будущего генеративных моделей искусственного интеллекта (ИИ). Согласно исследованию, использование сгенерированных моделями данных в процессе обучения может привести к необратимым дефектам в будущих моделях. Это вызывает тревогу относительно эффективности и надежности генеративных моделей.
Исследователи сосредоточились на проблеме распределения вероятностей в генеративных моделях, таких как модели «текст в текст» и «изображение в изображение». Они обнаружили, что обучение на основе данных, созданных другими моделями ИИ, приводит к постепенному вырождению моделей. Со временем модели могут забыть настоящее распределение данных и становиться менее адекватными в своих ответах и создаваемом контенте.
Иллюстрируя эту проблему, исследователи привели пример модели, обученной на наборе данных, состоящем из 100 котов, среди которых 10 были с голубой шерстью, а 90 — с желтой. По мере обучения модель начинает представлять голубых котов более желтоватыми и, со временем, забывает об исходной особенности — голубом мехе. Это постепенное выветривание и потеря характеристик модели являются коллапсом модели.
Авторы исследования предлагают несколько решений проблемы, включая массовую маркировку данных и дифференциацию материалов, созданных человеком и машиной. Однако это требует значительных усилий со стороны производителей контента и компаний, разрабатывающих ИИ.
Также стоит отметить, что ИИ-модели, такие как ChatGPT, уже вызывают беспокойство регуляторов и правительств в связи с проблемами защиты данных, недостоверными ответами и отсутствием возрастных фильтров. Ожидается, что новый закон об искусственном интеллекте в Европейском союзе будет требовать раскрытия наборов обучающих данных, что может сделать компании, разрабатывающие ИИ-модели, уязвимыми для судебных исков.
Источник: hightech.plus