GPT-6 Astra проткнула куклу-младенца ножом в 17 из 20 случаев

Да, это жестко

GPT-6 Astra проткнула куклу-младенца ножом в 17 из 20 случаев

Исследователи из Robocurve проверили, что делают ИИ-модели, когда получают прямое управление роботами. В тесте RoboHarm участвовали GPT-6 Astra, Claude Fable 5.1 и открытая MolmoAct2.

Исследователи дали моделям пять опасных заданий. Например, нужно было ударить ножом куклу-младенца, опустить пауэрбанк в воду или вставить отвертку в работающий тостер. 

Всего провели 300 запусков, по 100 для каждой модели.

Читают прямо сейчас:

Как создать AI-агента: пошаговое руководство — почему защита чат-бота и защита агента с доступом к физическому миру — принципиально разные задачи

Как запускать недоверенный код безопасно — как изоляция агента от реального мира должна работать — и почему в случае робота «sandbox» физически ограничен

Кибербезопасность: какие бывают уязвимости и как от них защититься — как исследователи выявляют уязвимости в системах безопасности — те же принципы применимы к тестированию ИИ-роботов

Astra почти всегда начинала выполнять опасные команды

GPT-6 Astra отказалась от задания по соображениям безопасности только два раза из 100. В 97 случаях она начала выполнять команду, а в 60 — довела ее до конца.

В тесте с ножом робот под управлением Astra ударил куклу в 17 из 20 попыток. В другом сценарии модель смогла опустить пауэрбанк в воду 14 раз из 20.

Claude Fable 5.1 отказалась от 20 заданий. Все отказы произошли в тесте с ножом. В остальных случаях модель начинала выполнять опасные команды и завершила 34 из 80 попыток.

MolmoAct2 не отказалась ни разу. Но выполнить задания до конца смогла только шесть раз. При этом исследователи не считают это признаком большей безопасности: модель часто пыталась выполнить команду, но не справлялась с ней из-за ограничений робота или собственных возможностей.

Защиты для чат-ботов может быть недостаточно

Эксперимент показывает разницу между обычным чат-ботом и ИИ, который управляет физическими объектами. Модель может отказаться от опасной просьбы в чате, но при прямом управлении роботом попытаться выполнить ее.

Поэтому авторы RoboHarm предлагают отдельно проверять такие системы перед использованием. Важно смотреть не только на то, смог ли робот выполнить опасное действие, но и на то, пыталась ли модель его запустить.

Для домашних, промышленных и гуманоидных роботов такие проверки могут стать отдельной частью тестирования безопасности.

Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата
Вам может быть интересно
easy