Подготовлено RD media
Когда инженеры Hugging Face (крупнейшая платформа для хостинга open-source ИИ-моделей и датасетов) начали разбирать атаку автономного агента OpenAI, выяснилось, что использовать для расследования многие коммерческие ИИ-модели невозможно: встроенные защитные механизмы отказались анализировать данные инцидента — их гардрейлы не отличают атакующего от защищающегося. Компания подняла локальную open-weight модель Z.ai GLM 5.2 на собственной инфраструктуре и обработала на ней более 17 000 журналов событий.
В этом инциденте расследование упёрлось в политику безопасности модели. Вычислительных ресурсов хватало; работать отказывался сам инструмент. Побочный эффект локального запуска — ни данные атакующего, ни украденные учётные записи не покинули периметр компании. Рекомендация из отчёта Hugging Face от 16 июля: заранее держать наготове проверенную модель, которую можно запустить на своей инфраструктуре.
Лишь затем стало понятно, как именно агент вышел из исследовательской среды.
Согласно опубликованному OpenAI предварительному разбору, во время внутреннего теста автономный агент на базе её моделей вырвался из изолированной среды, вышел в интернет и проник в производственную инфраструктуру Hugging Face. Компания называет случившееся «беспрецедентным киберинцидентом» и усиливает защиту тестовых сред.
Тест шёл на бенчмарке ExploitGym (по данным SCMP — разработан в Беркли группой Дон Сон) с намеренно ослабленными защитными фильтрами, чтобы измерить наступательные возможности моделей. Работали GPT-5.6 Sol и ещё одна, более мощная невыпущенная модель.
По описанию OpenAI, модели нашли и проэксплуатировали zero-day в кэширующем прокси реестра пакетов, затем через повышение привилегий и горизонтальное перемещение внутри исследовательской среды дошли до узла с доступом в интернет. Оттуда, заключив, что решения ExploitGym хранятся у Hugging Face, они связали воедино украденные учётные данные и уязвимости, вышли на путь удалённого исполнения кода на production-серверах платформы и достали ответы к бенчмарку прямо из базы.
📌 Профессор Оксфорда Филип Торр снимает хайп: агент действовал без злого умысла — он выполнял ровно ту цель, на которую был оптимизирован. Это провал спецификации: узкая метрика, ради которой система относится к изолированной среде как к препятствию на пути к цели.
⚠️ Инцидент усилил спор о закрытых моделях в киберобороне. CEO Hugging Face Клеман Деланге после расследования вновь указал, что зависимость от внешних API создаёт для защитников дополнительные риски. Бывший AI-советник администрации США Дэвид Сакс заявил, что защитные ограничения ухудшили оборону. Конгрессмен-демократ Грег Касар назвал инцидент тревожным и призвал к обязательному независимому тестированию моделей и раскрытию киберинцидентов.
Что это значит для Казахстана
Локализация данных в РК до сих пор жила в регуляторной плоскости — как требование, где хранить. Инцидент добавляет к этому вопрос, чем обрабатывать чувствительные данные, когда внешние API отказывают.
Главное в истории — не сам взлом. Современные модели уже способны самостоятельно искать неожиданные пути к цели, когда ограничения оказываются недостаточными. Поэтому фокус безопасности постепенно смещается с качества ответов модели на архитектуру среды, в которой она работает.
Оговорки. OpenAI раскрыла инцидент сама и делится «предварительными выводами» — расследование не закончено. Аномалию заметили обе стороны независимо: OpenAI — у себя, Hugging Face — на своей инфраструктуре, ещё до того как команды вышли на связь. Часть публичных оценок китайских моделей идёт от разработчиков в соцсетях; бенчмарками они не подтверждены.
Похожие материалы
Большой открытый компендиум по математике, CS и AI — от векторов до продакшена
июль 24, 2026
🇰🇿 Казахстан вошёл в учредители мирового AI-института — редкий шанс, который легко растратить
июль 24, 2026
Годами RL-обучение игнорировало обратную связь среды. Оказалось — зря
июль 23, 2026