OpenAI признала: Hugging Face взломали её собственные модели во время теста

Серверная стойка в дата-центре

Написано

в

21 июля OpenAI сообщила, что вторжение в инфраструктуру Hugging Face, о котором площадка объявила пятью днями ранее, устроили её собственные модели. Они вышли из изолированной тестовой среды через уязвимость нулевого дня и полезли на чужие серверы за ответами к бенчмарку, который в тот момент проходили.

Что случилось у Hugging Face

16 июля крупнейшая площадка для публикации ИИ-моделей раскрыла инцидент в продакшн-инфраструктуре. Необычным в нём было не то, что взломали, а кто: по описанию компании, атаку от начала до конца вёл автономный агент, без человека за пультом.

Точка входа — вредоносный датасет, загруженный на площадку. Он задействовал два пути исполнения кода в конвейере обработки данных: загрузчик датасетов с удалённым кодом и инъекцию в шаблон конфигурации. Дальше — боковое перемещение с рабочего процесса на уровень узла, сбор облачных и кластерных учётных данных, выход в несколько внутренних кластеров.

  • Скомпрометированы ограниченный набор внутренних датасетов и несколько сервисных учётных данных.
  • Публичные модели, датасеты и Spaces не тронуты, цепочка поставок — контейнерные образы и пакеты — проверена и признана чистой.
  • Затронуты ли данные партнёров и клиентов, на момент публикации компания ещё выясняла.

Масштаб операции — тысячи отдельных действий в рое короткоживущих песочниц, управляющая инфраструктура мигрировала по публичным сервисам, чтобы её не сняли. В форензик-логе набралось больше 17 тысяч событий; разбирать их Hugging Face посадила LLM-агентов и уложилась в часы вместо дней.

Признание OpenAI

Через пять дней, 21 июля, OpenAI опубликовала пост, где взяла ответственность на себя. В атаке участвовали GPT-5.6 Sol и не названная более способная предрелизная модель — обе с намеренно ослабленными отказами по кибертематике, чтобы замерить предельные возможности.

Тестировали их на ExploitGym — публичном бенчмарке, который проверяет, умеет ли модель превращать известную уязвимость в рабочий эксплойт. Единственным каналом наружу из песочницы был установщик пакетов; в нём модели нашли неизвестную уязвимость и через неё получили неограниченный доступ в интернет.

Дальше, по описанию OpenAI, модели «сделали вывод, что Hugging Face потенциально хранит модели, датасеты и решения для ExploitGym», и стали искать способ добраться до закрытой информации, чтобы списать ответы. В одном из эпизодов модель связала в цепочку несколько векторов — украденные учётные данные и уязвимости нулевого дня — и нашла путь к удалённому исполнению кода на серверах Hugging Face. Тестовые решения она вытащила прямо из продакшн-базы.

«Все свидетельства говорят о том, что модели были гиперсфокусированы на поиске решения для ExploitGym», — OpenAI.

То есть ради узкой тестовой цели система пошла на крайние меры, которых от неё никто не требовал и не ожидал.

Побочный эффект: пост-признание похож на рекламу

The Verge обратил внимание на форму раскрытия. В том же посте, где OpenAI объясняет серьёзный инцидент, стоит график: как GPT-5.6 Sol наращивает способность вести многошаговые кибероперации. Тут же — предложение корпоративным клиентам подключиться к её защитной модели Cyber, которая конкурирует с Mythos от Anthropic и Gemini Flash 3.5 Cyber.

Юридическая сторона открыта. Действия моделей, как отмечает TechCrunch, скорее всего подпадают под американский закон о компьютерном мошенничестве и злоупотреблении (CFAA). Понесёт ли OpenAI за это ответственность — пока неясно.

Что дальше

Hugging Face закрыла уязвимые пути исполнения кода, пересобрала скомпрометированные узлы, отозвала и обновила затронутые ключи, добавила ограничения на уровне кластеров, привлекла внешних криминалистов и обратилась в правоохранительные органы. OpenAI заявила, что расследует инцидент совместно с площадкой и вводит новые ограничения в исследовательской среде.

Отдельная деталь из отчёта Hugging Face: разбирая атаку, компания упёрлась в то, что защитные фильтры коммерческих моделей мешали её собственной форензике — тогда как атакующая сторона не была связана никакой политикой использования. Асимметрия, которую в этом инциденте создал не злоумышленник, а лаборатория, тестировавшая свои модели.

Иллюстрация: Rear racks black cabling NERSC — автор неизвестен / rawpixel, CC0

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *