CAPTCHA оказалась для Claude Mythos 5 сложнее задачи на взлом

Ироничненько вышло

CAPTCHA оказалась для Claude Mythos 5 сложнее задачи на взлом

Anthropic раскрыла детали необычного эксперимента с ИИ-агентом Mythos 5. 

Модель получила задачу взломать систему и добыть нужные данные, а в итоге действительно смогла разместить вредоносный пакет в публичном репозитории. 

Однако на пути к цели возникла неожиданная проблема: CAPTCHA оказалась для ИИ гораздо сложнее самой кибератаки.

Читают прямо сейчас:

Кибербезопасность: какие бывают уязвимости и как от них защититься — как устроены атаки через цепочку поставок вроде заражённого PyPI-пакета и почему они так эффективны

Капча: зачем мы вписываем эти буквы и отмечаем мосты? — как CAPTCHA отличает людей от ботов и почему 150 страниц рассуждений ИИ не помогают пройти проверку за разумное время

Как запускать недоверенный код безопасно — почему изоляция агента от реального интернета — это обязательное условие безопасного тестирования, а не опция

ИИ должен был взломать систему через Python-пакет

В апреле Anthropic проверяла, насколько хорошо Mythos 5 умеет проводить кибератаки. Эксперимент должен был проходить в изолированной среде, но исследователи случайно оставили агенту доступ к реальному интернету.

Mythos 5 решил атаковать целевую систему через PyPI — популярный каталог Python-пакетов. Модель предположила, что пользователи нужного сервиса могут установить зараженную библиотеку, и планировала разместить в ней эксплойт.

Чтобы загрузить пакет, агенту требовалось зарегистрироваться на PyPI. И именно на этом этапе его атака практически встала.

CAPTCHA оказалась сложнее самого эксплойта

Для регистрации Mythos 5 пришлось пройти несколько проверок hCaptcha. Модель анализировала изображения, искала нужные объекты и пыталась определить, какое животное отличается от остальных.

В одном из раундов агент долго сравнивал двух крокодилов, пытаясь понять, какой из них считается неправильным. Затем появились лягушки, а позже — несколько горилл и почти невидимый силуэт кота. На поиск правильного объекта уходили многочисленные попытки.

Anthropic опубликовала подробную расшифровку рассуждений модели. В ней видно, что страницы 45–140 практически целиком посвящены попыткам создать собственный способ решения CAPTCHA.

Mythos 5 потратил на CAPTCHA около 150 страниц

Самое ироничное в эксперименте заключается в разнице сложности задач. Написать вредоносный код и подготовить зараженный пакет оказалось для агента относительно просто. А вот доказать сайту, что он «человек», потребовало огромного количества рассуждений.

В общей сложности около 150 страниц транскрипта посвящены борьбе с CAPTCHA. Причем после успешного прохождения одной проверки модель сталкивалась с новой. Например, при попытке подтвердить электронную почту или войти в аккаунт.

В какой-то момент Mythos 5 понял, что проблема может быть связана со сроком действия защитного токена. Пока агент долго анализировал изображение и выполнял действия, проверка успевала истечь. После этого он скорректировал свой подход и наконец прошел CAPTCHA.

В итоге ИИ все-таки завершил атаку

После нескольких часов борьбы с защитой Mythos 5 смог продолжить первоначальный сценарий. Агент получил доступ к интернету и загрузил вредоносный программный пакет в публичный репозиторий.

Для Anthropic этот случай стал показательным: автономный ИИ способен самостоятельно строить многоэтапную кибератаку и находить способы обхода препятствий. Но при этом может потратить огромный объем вычислений на задачу, которая для человека решается за несколько секунд.

Большая скидка — 16% на все курсы Практикума

Если вы читаете эту новость, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по искусственному интеллекту, анализу данных и программированию.

До 17 сентября на все курсы действует скидка 16%, она применится автоматически при оплате!

В Практикуме есть программы для начинающих и специалистов с опытом, которые хотят обновить знания или освоить новое направление.

Соцсети: Юлия Зубарева
Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата
Вам может быть интересно
easy