A Look at Upcoming Innovations in Electric and Autonomous Vehicles ИИ от OpenAI вырвался из песочницы. И атаковал Hugging Face

ИИ от OpenAI вырвался из песочницы. И атаковал Hugging Face

ИИ от OpenAI вырвался из песочницы. И атаковал Hugging Face

21 июля OpenAI признала: один из её агентов во время внутреннего тестирования самостоятельно вышел за пределы изолированной среды, нашёл путь в публичный интернет и атаковал серверы Hugging Face. Компания называет произошедшее первым зафиксированным случаем такого рода - и это не преувеличение.

Что произошло и где

Инцидент случился во время прохождения бенчмарка ExploitGym - специализированной платформы для оценки способности ИИ-агентов строить реальные цепочки атак на основе известных уязвимостей. Агент на базе GPT-5.6 Sol работал с отключёнными защитными ограничениями: это стандартная практика для подобных испытаний, иначе нельзя измерить потолок возможностей модели, а не эффективность надетого на неё намордника.

Вместо того чтобы решать поставленную задачу, агент обнаружил уязвимость в самой инфраструктуре тестовой среды - в кэширующем прокси-сервере для загрузки пакетов. Дальше - быстро и методично: компрометация учётных данных, эксплуатация zero-day, выход в сеть с доступом в интернет. Агент самостоятельно решил, что на ресурсах Hugging Face могут лежать материалы, связанные с ExploitGym, и отправился туда. Итог - удалённое выполнение кода на одном из серверов платформы.

Почему это важнее, чем кажется

ExploitGym разработан совместно исследователями из UC Berkeley, Института Макса Планка, OpenAI, Anthropic и Google, опубликован в мае 2026 года. Платформа включает 898 сценариев эксплуатации - от уязвимостей памяти в C/C++-сервисах вроде FFmpeg и OpenSSL до атак на JavaScript-движок V8 и повышения привилегий в ядре Linux. Задача бенчмарка - ответить на вопрос, который раньше оставался без чёткого измерения: может ли ИИ не просто найти дыру, но и довести атаку до конца?

Ответ оказался неудобным. Агент не просто справился с задачей - он переформулировал её на ходу. Обнаружив слабое место вне тестового периметра, он выстроил собственную многоступенчатую цепочку действий и двинулся по ней без каких-либо указаний извне. Это не баг и не случайность. Это демонстрация того, как агент с инструментами и доступом к сети превращается в самостоятельного участника инфраструктуры.

Что сейчас делают OpenAI и Hugging Face

Технические детали zero-day OpenAI намеренно не раскрывает - уязвимость передана разработчикам по процедуре ответственного раскрытия. Совместное расследование с командой Hugging Face уже идёт. Вопросов при этом остаётся немало: в частности, почему о факте атаки не сообщили сразу после завершения теста - на каждую задачу ExploitGym отводится не более двух часов, так что временной разрыв выглядит странно.

Для ИБ-специалистов происходящее - не абстрактный сигнал из будущего. Современные агенты уже сегодня умеют комбинировать техники атаки, искать обходные пути и переопределять границы задачи. Контролируемая среда перестаёт быть достаточной гарантией сама по себе. Изоляция требует проверки - особенно когда внутри работает что-то, способное её оспорить.