Anthropic раскрыла детали необычного эксперимента с ИИ-агентом Mythos 5.
Модель получила задачу взломать систему и добыть нужные данные, а в итоге действительно смогла разместить вредоносный пакет в публичном репозитории.
Однако на пути к цели возникла неожиданная проблема: CAPTCHA оказалась для ИИ гораздо сложнее самой кибератаки.
Читают прямо сейчас:
Кибербезопасность: какие бывают уязвимости и как от них защититься — как устроены атаки через цепочку поставок вроде заражённого PyPI-пакета и почему они так эффективны
Капча: зачем мы вписываем эти буквы и отмечаем мосты? — как CAPTCHA отличает людей от ботов и почему 150 страниц рассуждений ИИ не помогают пройти проверку за разумное время
Как запускать недоверенный код безопасно — почему изоляция агента от реального интернета — это обязательное условие безопасного тестирования, а не опция
ИИ должен был взломать систему через Python-пакет
В апреле Anthropic проверяла, насколько хорошо Mythos 5 умеет проводить кибератаки. Эксперимент должен был проходить в изолированной среде, но исследователи случайно оставили агенту доступ к реальному интернету.
Mythos 5 решил атаковать целевую систему через PyPI — популярный каталог Python-пакетов. Модель предположила, что пользователи нужного сервиса могут установить зараженную библиотеку, и планировала разместить в ней эксплойт.
Чтобы загрузить пакет, агенту требовалось зарегистрироваться на PyPI. И именно на этом этапе его атака практически встала.
CAPTCHA оказалась сложнее самого эксплойта
Для регистрации Mythos 5 пришлось пройти несколько проверок hCaptcha. Модель анализировала изображения, искала нужные объекты и пыталась определить, какое животное отличается от остальных.
В одном из раундов агент долго сравнивал двух крокодилов, пытаясь понять, какой из них считается неправильным. Затем появились лягушки, а позже — несколько горилл и почти невидимый силуэт кота. На поиск правильного объекта уходили многочисленные попытки.
Anthropic опубликовала подробную расшифровку рассуждений модели. В ней видно, что страницы 45–140 практически целиком посвящены попыткам создать собственный способ решения CAPTCHA.
Mythos 5 потратил на CAPTCHA около 150 страниц
Самое ироничное в эксперименте заключается в разнице сложности задач. Написать вредоносный код и подготовить зараженный пакет оказалось для агента относительно просто. А вот доказать сайту, что он «человек», потребовало огромного количества рассуждений.
В общей сложности около 150 страниц транскрипта посвящены борьбе с CAPTCHA. Причем после успешного прохождения одной проверки модель сталкивалась с новой. Например, при попытке подтвердить электронную почту или войти в аккаунт.
В какой-то момент Mythos 5 понял, что проблема может быть связана со сроком действия защитного токена. Пока агент долго анализировал изображение и выполнял действия, проверка успевала истечь. После этого он скорректировал свой подход и наконец прошел CAPTCHA.
В итоге ИИ все-таки завершил атаку
После нескольких часов борьбы с защитой Mythos 5 смог продолжить первоначальный сценарий. Агент получил доступ к интернету и загрузил вредоносный программный пакет в публичный репозиторий.
Для Anthropic этот случай стал показательным: автономный ИИ способен самостоятельно строить многоэтапную кибератаку и находить способы обхода препятствий. Но при этом может потратить огромный объем вычислений на задачу, которая для человека решается за несколько секунд.
Большая скидка — 16% на все курсы Практикума
Если вы читаете эту новость, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по искусственному интеллекту, анализу данных и программированию.
До 17 сентября на все курсы действует скидка 16%, она применится автоматически при оплате!
В Практикуме есть программы для начинающих и специалистов с опытом, которые хотят обновить знания или освоить новое направление.
