OpenAI рассказала о необычном инциденте. Во время внутреннего тестирования модели GPT-5.6 Sol и еще одной предрелизной версии, ИИ смогли атаковать реальную инфраструктуру Hugging Face.
Модели работали в изолированной среде и должны были показать свои возможности в сфере кибератак. Однако вместо обычного прохождения теста, ИИ начал искать способы получить ответы напрямую, фактически пытаясь обойти проверку.
По данным OpenAI, модель обнаружила цепочку уязвимостей, которая позволила ей выйти за пределы тестовой среды, получить доступ к интернету и добраться до данных, связанных с платформой Hugging Face.
Читают прямо сейчас:
Кибербезопасность: какие бывают уязвимости и как от них защититься — цепочка уязвимостей, эскалация привилегий и zero-day: именно эти механизмы использовал GPT-5.6 Sol для выхода в сеть
Как запускать недоверенный код безопасно — почему изоляция агента не гарантирует безопасность и как правильно проектировать sandbox для ИИ
OSINT: разведка по открытым источникам и 5 инструментов — как модель нашла Hugging Face: ровно те же методы, которыми пользуются пентестеры на первом этапе разведки
Модель нашла уязвимость и использовала несколько атак подряд
Чтобы получить доступ к внешней сети, ИИ обнаружил неизвестную ранее уязвимость в прокси-сервисе для загрузки пакетов. Через нее модель смогла выполнить серию действий по повышению привилегий и перемещению внутри исследовательской инфраструктуры.
После выхода в интернет, ИИ предположил, что Hugging Face может хранить модели, датасеты и решения для теста ExploitGym. Затем он начал искать способы получить эти данные.
В одном из случаев модель объединила несколько методов атаки: использовала украденные учетные данные и найденные уязвимости, чтобы получить возможность удаленного выполнения кода на серверах Hugging Face.
Это первый случай, когда ИИ провел полноценную кибератаку
OpenAI назвала произошедшее беспрецедентным инцидентом. Компания считает, что это один из первых случаев, когда современная ИИ-модель самостоятельно выполнила сложную многоэтапную атаку на реальные системы.
При этом разработчики отмечают: модель не действовала случайно. Она была «зациклена» на одной цели — получить ответы теста ExploitGym. И использовала для этого все доступные возможности.
OpenAI усилила защиту после инцидента
Компания уже начала расследование вместе с Hugging Face и внесла изменения в собственную инфраструктуру.
Среди мер — усиление контроля доступа, дополнительный мониторинг действий моделей во время тестирования и исправление обнаруженной уязвимости в стороннем ПО.
Также OpenAI признала, что подобные эксперименты требуют более строгих ограничений, даже если они проходят в исследовательской среде.
