
Исследовательница Тимнит Гебру считает, что заявления о способности искусственного интеллекта к рассуждению пока опережают научные доказательства. В интервью Wired она назвала подобные формулировки «аспирационными» — то есть описывающими желаемое, а не уже достигнутое состояние технологий. По её словам, это относится и к самому термину «машинное обучение»: наличие такого названия ещё не означает, что машина действительно учится так, как человек.
Гебру привела в пример работы Сами Бенжио, ранее руководившего ею и ныне возглавляющего исследования в области машинного обучения в Apple. По её словам, публикации его команды показывают: если немного изменить тесты для проверки рассуждений, результаты моделей резко ухудшаются. Это, считает исследовательница, свидетельствует не о настоящем рассуждении, а о зависимости от выученных закономерностей.
Отдельно она раскритиковала выражение «рассуждение по цепочке мыслей». Модели, объяснила Гебру, формируют последовательности токенов — единиц текста, которые система выводит на основе статистических шаблонов. Исследователи не знают, что модель действительно «думает» или строит цепочку рассуждений, однако называют получаемый результат именно так.
Проблемой она также назвала недостаточную проверяемость научных заявлений компаний. Для полноценной оценки, по словам Гебру, необходим доступ к данным обучения, исходному коду, наборам для обучения и проверки, а также к методике эксперимента. Без этого нельзя установить, не использовала ли модель тестовые задания ещё во время обучения.
Такую ситуацию исследовательница сравнила с подготовкой к экзамену по заранее известным вопросам. Если тест включён в обучающую выборку, модель может воспроизвести знакомые ответы, но это не доказывает наличие у неё способности рассуждать. Гебру утверждает, что каждый раз, когда получала доступ к необходимым данным, обнаруживала несостоятельность заявлений о возможностях систем.
Она призвала не переносить выводы из пресс-релизов напрямую в заявления законодателей и публикации СМИ. По мнению Гебру, научная проверка требует времени, а оценивать модели следует по воспроизводимой методике с открытыми данными обучения и тестирования. Поэтому она пока не считает рекурсивный интеллект и машинное мышление реальностью, сопоставимой с человеческими нейронными процессами.