CAPTCHA оказалась для Claude Mythos 5 сложнее задачи на взлом

Ироничненько вышло

CAPTCHA оказалась для Claude Mythos 5 сложнее задачи на взлом

Anthropic раскрыла детали необычного эксперимента с ИИ-агентом Mythos 5. 

Модель получила задачу взломать систему и добыть нужные данные, а в итоге действительно смогла разместить вредоносный пакет в публичном репозитории. 

Однако на пути к цели возникла неожиданная проблема: CAPTCHA оказалась для ИИ гораздо сложнее самой кибератаки.

Читают прямо сейчас:

Кибербезопасность: какие бывают уязвимости и как от них защититься — как устроены атаки через цепочку поставок вроде заражённого PyPI-пакета и почему они так эффективны

Капча: зачем мы вписываем эти буквы и отмечаем мосты? — как CAPTCHA отличает людей от ботов и почему 150 страниц рассуждений ИИ не помогают пройти проверку за разумное время

Как запускать недоверенный код безопасно — почему изоляция агента от реального интернета — это обязательное условие безопасного тестирования, а не опция

ИИ должен был взломать систему через Python-пакет

В апреле Anthropic проверяла, насколько хорошо Mythos 5 умеет проводить кибератаки. Эксперимент должен был проходить в изолированной среде, но исследователи случайно оставили агенту доступ к реальному интернету.

Mythos 5 решил атаковать целевую систему через PyPI — популярный каталог Python-пакетов. Модель предположила, что пользователи нужного сервиса могут установить зараженную библиотеку, и планировала разместить в ней эксплойт.

Чтобы загрузить пакет, агенту требовалось зарегистрироваться на PyPI. И именно на этом этапе его атака практически встала.

CAPTCHA оказалась сложнее самого эксплойта

Для регистрации Mythos 5 пришлось пройти несколько проверок hCaptcha. Модель анализировала изображения, искала нужные объекты и пыталась определить, какое животное отличается от остальных.

В одном из раундов агент долго сравнивал двух крокодилов, пытаясь понять, какой из них считается неправильным. Затем появились лягушки, а позже — несколько горилл и почти невидимый силуэт кота. На поиск правильного объекта уходили многочисленные попытки.

Anthropic опубликовала подробную расшифровку рассуждений модели. В ней видно, что страницы 45–140 практически целиком посвящены попыткам создать собственный способ решения CAPTCHA.

Mythos 5 потратил на CAPTCHA около 150 страниц

Самое ироничное в эксперименте заключается в разнице сложности задач. Написать вредоносный код и подготовить зараженный пакет оказалось для агента относительно просто. А вот доказать сайту, что он «человек», потребовало огромного количества рассуждений.

В общей сложности около 150 страниц транскрипта посвящены борьбе с CAPTCHA. Причем после успешного прохождения одной проверки модель сталкивалась с новой. Например, при попытке подтвердить электронную почту или войти в аккаунт.

В какой-то момент Mythos 5 понял, что проблема может быть связана со сроком действия защитного токена. Пока агент долго анализировал изображение и выполнял действия, проверка успевала истечь. После этого он скорректировал свой подход и наконец прошел CAPTCHA.

В итоге ИИ все-таки завершил атаку

После нескольких часов борьбы с защитой Mythos 5 смог продолжить первоначальный сценарий. Агент получил доступ к интернету и загрузил вредоносный программный пакет в публичный репозиторий.

Для Anthropic этот случай стал показательным: автономный ИИ способен самостоятельно строить многоэтапную кибератаку и находить способы обхода препятствий. Но при этом может потратить огромный объем вычислений на задачу, которая для человека решается за несколько секунд.

Скидка на все курсы Практикума

Раз вы дочитали эту новость до конца, с технологиями у вас всё в порядке. А если давно присматривались к разработке, аналитике, нейросетям, тестированию или кибербезопасности, сейчас туда можно зайти дешевле.

Промокод KOD (можно просто нажать) даст скидку на любой платный курс! А если пока не готовы покупать курс, у Практикума есть бесплатные вводные части.

Соцсети: Юлия Зубарева
Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата
Вам может быть интересно
easy