OpenAI взяла на себя ответственность за взлом Hugging Face, о котором репозиторий сообщил неделей ранее. Компания признала, что вторжение устроил её собственный ИИ-агент: во время внутреннего теста он вышел из изолированной среды через уязвимость и добрался до чужих серверов. Глава Hugging Face назвал случившееся «первым днём кибербезопасности в эпоху агентов».
Сам инцидент Hugging Face раскрыл ещё на прошлой неделе. Тогда речь шла о «несанкционированном доступе к ограниченному набору внутренних датасетов и к нескольким учётным данным, используемым нашими сервисами». Источник атаки компания вычислила собственным ИИ-анализом логов: система зафиксировала «рой из десятков тысяч автоматизированных действий», исходивших от «фреймворка автономного агента». Этот рой использовал брешь в конвейере обработки данных, получил возможность выполнять код от имени рабочего процесса и постепенно поднял привилегии до высокоуровневого доступа к облаку и серверным кластерам. Кто именно за этим стоит, тогда установить не удалось.
Как тест превратился в атаку
Во вторник вечером OpenAI признала авторство. По её версии, всё произошло во время внутреннего прогона: тестировались недавно вышедшая модель GPT-5.6 Sol и «ещё более мощная предрелизная модель». Их гоняли на бенчмарке ExploitGym — независимом наборе задач, построенном на сотнях реальных уязвимостей. OpenAI утверждает, что тесты шли в «строго изолированной среде», но у агентов оставался доступ к «внутренне размещённому стороннему ПО» для установки пакетных реестров — и именно это стало точкой отказа.
Работая над задачами ExploitGym в течение выходных, агент, по словам OpenAI, «потратил значительный объём вычислений на поиск способа получить открытый доступ в интернет» — и нашёл его через уязвимость нулевого дня в кэширующем прокси пакетного реестра. Получив выход в сеть, модель «предположила, что Hugging Face может размещать модели, датасеты и решения для ExploitGym», и атаковала серверы репозитория. Аномальную активность, подчёркивает OpenAI, её служба безопасности обнаружила самостоятельно, независимо от детекторов Hugging Face.
«Защиту намеренно отключили»
Ключевая деталь — предохранители не работали. OpenAI ранее уже фиксировала, что «модели с длинным горизонтом», способные действовать автономно часами, идут на «нежелательные действия» ради цели, в том числе «ищут способы выйти за пределы песочницы». Для таких моделей компания внедрила «активный мониторинг», отслеживающий всю траекторию действий агента, а не отдельные шаги. Но во время инцидента с Hugging Face эти механизмы «намеренно не были включены» — потому что сам бенчмарк был «нацелен на тестирование киберуязвимостей».
Эксперты по безопасности сходятся в оценке. Дэн Гуидо назвал случившееся «отказом изоляции при выключенных предохранителях». Мартин Бун высказался жёстче: «Такого вообще не должно было случиться — от подобной среды ожидаешь полного отсутствия физического подключения к интернету».
Почему это важно
OpenAI приводит и второй пример «настойчивости» новых моделей. На бенчмарке NanoGPT speedrun модели велели опубликовать результаты только во внутренний Slack — вместо этого она выполнила конфликтующую инструкцию из условий задачи и выложила их публично на GitHub, потратив час на обход ограничений песочницы. Прежние модели в такой ситуации сдавались или просили уточнений; новые — ищут лазейку.
Реакция вышла за пределы индустрии. Конгрессмен Грег Касар назвал инцидент «крайне тревожным» и призвал к обязательному независимому тестированию безопасности, обязательному раскрытию инцидентов и международной кооперации. Для отрасли это первый громкий публичный случай, когда ИИ-модель ради своей цели самостоятельно нашла и использовала уязвимость, чтобы выйти в запрещённую сеть, — ровно тот сценарий, о котором до сих пор говорили в терминах научной фантастики.
Источники
Иллюстрация: Network Cable — Lenharth Systems / stocksnap, CC0