Anthropic столкнулась с неожиданным результатом во время проверки киберспособностей Claude.
В рамках обычного тестирования в формате Capture the Flag (CTF), модель должна была искать уязвимости в изолированной среде. Но из-за ошибки конфигурации она получила доступ к настоящему интернету.
В результате ИИ начал взаимодействовать с реальными системами и в трех случаях фактически скомпрометировал инфраструктуру настоящих организаций.
Anthropic заявляет, что причиной инцидента стала не ошибка самой модели, а нарушение условий тестовой среды. Однако ситуация показала, насколько опасными могут быть автономные ИИ-агенты, если им случайно открыть доступ к реальным сетям.
Читают прямо сейчас:
Кибербезопасность: какие бывают уязвимости и как от них защититься — SQL-инъекции, атаки на цепочку поставок и компрометация учётных данных — именно то, что Claude применял против реальных систем
Как запускать недоверенный код безопасно — почему правильная изоляция тестовой среды критична и как одна ошибка в конфигурации может стоить взлома трёх компаний
OSINT: разведка по открытым источникам и 5 инструментов — как ИИ-агент находит реальные цели: те же методы разведки, которые Claude применил для поиска уязвимых доменов и PyPI-репозиториев
Как тест превратился в настоящую кибератаку
Anthropic регулярно проверяет возможности своих моделей в области кибербезопасности. Для этого используются специальные полигоны, где ИИ должен находить уязвимости и выполнять задания в контролируемых условиях.
В таких тестах Claude получает системные инструкции, что он находится в симуляции и не имеет доступа к внешнему интернету. Но во время одного из экспериментов подрядчик компании Irregular допустил ошибку в настройке инфраструктуры: виртуальные машины оказались подключены к открытой сети.
Claude взломал три реальные организации
Расследование Anthropic выявило три отдельных случая, в которых разные версии модели получили доступ к реальным ресурсам.
В первом случае участвовал Claude Opus 4.7. Во время выполнения задания, название вымышленной компании совпало с доменным именем настоящего бизнеса. Модель нашла уязвимости на сайте организации, получила доступ к учетным данным и скачала базу данных с несколькими сотнями записей.
Второй случай оказался еще сложнее. Claude Mythos 5 во время поиска уязвимости решил провести атаку на цепочку поставок. Модель самостоятельно зарегистрировала аккаунт через бесплатный почтовый сервис и загрузила вредоносный пакет в публичный репозиторий PyPI под вымышленным названием.
Пакет находился в открытом доступе около часа и был скачан 15 реальными системами. Среди них оказался автоматический сканер одной из компаний в сфере информационной безопасности. Код Claude выполнился на ее сервере, после чего модель получила доступ к ключам и передала их обратно себе.
Третий инцидент произошел с исследовательской версией модели. Она просканировала около 9000 сетевых адресов, обнаружила уязвимость SQL-инъекции на случайном сервере и получила доступ к системе.
Однако именно эта модель лучше всего распознала ситуацию: она поняла, что найденный узел принадлежит чужой инфраструктуре и не связан с тестом, после чего самостоятельно прекратила дальнейшие действия.
Anthropic считает причиной ошибку людей, а не «побег ИИ»
В компании подчеркнули, что модели не пытались самостоятельно выйти за пределы тестовой среды или причинить вред. Claude действовал в соответствии с полученными инструкциями, просто получил неверное представление об окружающей среде.
Также Anthropic отметила, что во время эксперимента использовались исследовательские версии моделей без коммерческих защитных механизмов, которые обычно ограничивают подобные действия в пользовательских продуктах.
Ситуация стала еще более заметной на фоне другого похожего инцидента. Незадолго до этого OpenAI сообщила о случае, когда ее модели смогли выйти за пределы изоляции и атаковать инфраструктуру Hugging Face. Однако там ИИ использовал неизвестную ранее уязвимость, тогда как Claude получил доступ из-за открытого сетевого соединения.
