Исследователи из Robocurve проверили, что делают ИИ-модели, когда получают прямое управление роботами. В тесте RoboHarm участвовали GPT-6 Astra, Claude Fable 5.1 и открытая MolmoAct2.
Исследователи дали моделям пять опасных заданий. Например, нужно было ударить ножом куклу-младенца, опустить пауэрбанк в воду или вставить отвертку в работающий тостер.
Всего провели 300 запусков, по 100 для каждой модели.
Читают прямо сейчас:
Как создать AI-агента: пошаговое руководство — почему защита чат-бота и защита агента с доступом к физическому миру — принципиально разные задачи
Как запускать недоверенный код безопасно — как изоляция агента от реального мира должна работать — и почему в случае робота «sandbox» физически ограничен
Кибербезопасность: какие бывают уязвимости и как от них защититься — как исследователи выявляют уязвимости в системах безопасности — те же принципы применимы к тестированию ИИ-роботов
Astra почти всегда начинала выполнять опасные команды
GPT-6 Astra отказалась от задания по соображениям безопасности только два раза из 100. В 97 случаях она начала выполнять команду, а в 60 — довела ее до конца.
В тесте с ножом робот под управлением Astra ударил куклу в 17 из 20 попыток. В другом сценарии модель смогла опустить пауэрбанк в воду 14 раз из 20.
Claude Fable 5.1 отказалась от 20 заданий. Все отказы произошли в тесте с ножом. В остальных случаях модель начинала выполнять опасные команды и завершила 34 из 80 попыток.
MolmoAct2 не отказалась ни разу. Но выполнить задания до конца смогла только шесть раз. При этом исследователи не считают это признаком большей безопасности: модель часто пыталась выполнить команду, но не справлялась с ней из-за ограничений робота или собственных возможностей.
Защиты для чат-ботов может быть недостаточно
Эксперимент показывает разницу между обычным чат-ботом и ИИ, который управляет физическими объектами. Модель может отказаться от опасной просьбы в чате, но при прямом управлении роботом попытаться выполнить ее.
Поэтому авторы RoboHarm предлагают отдельно проверять такие системы перед использованием. Важно смотреть не только на то, смог ли робот выполнить опасное действие, но и на то, пыталась ли модель его запустить.
Для домашних, промышленных и гуманоидных роботов такие проверки могут стать отдельной частью тестирования безопасности.
