Российские специалисты разработали крупнейший в мире открытый набор данных, который предназначен для оценки способности роботов понимать и точно выполнять просьбы людей. Особое внимание уделяется интерпретации потенциально неоднозначных инструкций. Согласно результатам проведенного исследования, даже наиболее продвинутые современные модели показывают успешный результат лишь в каждом пятом случае, что говорит о недостаточной эффективности существующих алгоритмов.
Как сообщает агентство ТАСС, новый тест для робототехнических систем был создан группой ученых из Института искусственного интеллекта AIRI и МФТИ при поддержке Центра робототехники «Сбера». Он состоит из двух тысяч текстовых задач с разметкой по типу неоднозначности для действий на кухне. Исследователи отмечают, что многие простые команды, например, принести что-нибудь попить, содержат множество неопределенностей и скрытых предпочтений, которые искусственному интеллекту крайне сложно правильно истолковать.
Хотя управляющие системы роботов могут попытаться разрешить подобные ситуации с помощью уточняющих вопросов, их большое количество будет утомлять пользователя. Это указывает на необходимость использования иных подходов для получения нужной информации. Для оценки умения роботов действовать в таких условиях и были подготовлены сценарии с подробным описанием задачи, обстановки, возможных вопросов и планов действий. Такой подход позволяет проверить, насколько хорошо машина справляется со сложными бытовыми ситуациями.
Часть заданий была сформулирована максимально четко, в то время как другие, неоднозначные, разделили на три категории: предпочтения человека, здравый смысл и безопасность. По словам разработчиков, такое разделение позволит гибко настраивать алгоритмы и делать роботов более адаптивными и удобными. Этот тестовый набор также поможет в создании систем, которые планируют поведение роботов и способны оценивать, на каком именно этапе плана действий возникает неоднозначность.







