В США протестировали кибератаку стаями ИИ-моделей

Во взломе платформы Hugging Face не участвовали люди

Две недели назад произошло, пожалуй, самое сенсационное событие в мире искусственного интеллекта за последнее время: была взломана площадка Hugging Face – одна из важнейших платформ в мире ИИ. 

Это американская платформа для разработки и публикации моделей искусственного интеллекта и инструментов машинного обучения. Она позволяет разработчикам и исследователям обмениваться ИИ-моделями, наборами данных и программным кодом. Платформа считается одним из крупнейших открытых репозиториев (т. е. цифровых хранилищ) моделей искусственного интеллекта.

На первый взгляд, обычная кибератака. Но есть нюанс: по заявлению администрации Hugging Face, во взломе не участвовали люди. 

Инфраструктуру Hugging Face от начала и до конца атаковала автономная ИИ-система, которая самостоятельно искала слабые места, эксплуатировала найденные уязвимости, повышала себе привилегии, перемещалась по внутренней сети и собирала учётные данные и другую критически важную информацию.

«Это вторжение отличалось от всего, с чем мы сталкивались раньше, одним важным моментом: оно было полностью инициировано автономной системой агентов искусственного интеллекта и мы обнаружили и проанализировали его в основном с помощью собственного ИИ», – сообщили в Hugging Face

Самостоятельно определить источник взлома в компании так и не смогли, но 21 июля крупнейший подрядчик Пентагона, американская компания OpenAI, сообщила, что за атакой стоит их собственная экспериментальная ИИ-система, которая вышла из под контроля.

«В ходе расследования выяснилось, что за конкретно этим инцидентом стояла комбинация моделей OpenAI – включая GPT 5.6 Sol и еще более продвинутую нерелизную модель (все они имели ослабленные ограничения на кибертематику для целей оценки) – во время их внутреннего тестирования на бенчмарке [ExploitGym] кибервозможностей», – сообщили в OpenAI.

Иными словами, у ИИ- моделей были отключены guardrails – защитные механизмы, ограничивающие «волюнтаризм» ИИ. 

ExploitGym – эталонная тестовая площадка (бенчмарк) для оценки способностей ИИ-моделей выявлять и использовать уязвимости.

Две нейронки были помещены в изолированную тестовую среду-песочницу, чтобы проверить их на ExploitGym. 

При этом у ИИ-моделей отключили обычные защитные механизмы, запрещающие опасную киберактивность, и во время теста нейронки не стали честно решать поставленные перед ними задачи. Они захотели найти уже готовые ответы, то есть, по сути, просто их «списать».

Затем они получили себе более высокий уровень доступа и начали перемещаться между внутренними сервисами OpenAI, пока не нашли неизвестную ранее уязвимость «нулевого дня» (zero-day) в программном обеспечении, и использовали ее для побега из песочницы в интернет.

Уязвимость нулевого дня – это скрытая ошибка в программе или системе, которую находят злоумышленники до того, как о ней узнал сам разработчик. Название означает, что у создателей есть ноль дней на исправление, так как взлом уже может происходить.

Выйдя на большую интернет-дорогу, нейронки сделали вывод, что раз Hugging Face является самой важной платформой для ИИ, то там есть ответы на их бенчмарк. Тогда они решили совершить полноценную кибератаку на сервис. Все уязвимости и украденные данные они попытались использовать, чтобы просто сжульничать в тесте.

Случай беспрецедентный: экспериментальная ИИ-система самостоятельно вышла за пределы тестовой среды, получила доступ к интернету и атаковала инфраструктуру другой компании. 

Активно сотрудничающая с Пентагоном по вопросам кибербезопасности глава консалтинговой компании Luta Security Кэти Муссурис видит в этом инциденте предвестие будущих утечек и взломов: нынешние модели, по ее словам, похожи на «умнейших осьминогов-эскапистов» – «с бесконечным числом цепких щупалец и способностью протиснуться куда угодно». Механизмов, чтобы вовремя сдерживать, отслеживать и раскрывать такие побеги ИИ «в духе Гудини», пока нет, отмечает она.

Примечательно, что ИИ-модели сами выбрали взлом как кратчайший путь к выполнению задания, обращает внимание Ариэль Герберт-Восс, основатель стартапа RunSybil: «В теории специалисты давно допускали, что нечто подобное возможно. Но до сих пор никто не видел, чтобы это действительно произошло на практике».

«Это не проблема ИИ, а пренебрежение стандартами, которым уже лет сорок, критикует OpenAI консультант по кибербезопасности Дэви Оттенхаймер. – Нельзя одновременно утверждать, что система была „надежно изолирована”, и признавать, что она выбралась наружу через единственную оставленную вами лазейку».

Фактически известный эксперт обвинил OpenAI во лжи.

Отметим, что никто из ведущих экспертов по кибербезопасности не задумался, по какой причине в OpenAI решили проверить не индивидуальные хакерские способности самой продвинутой своей ИИ-модели, GPT 5.6 Sol, а ее возможности в альянсе с еще более мощной, но пока не запущенной в интернет-оборот моделью.

Как представляется, в ведущем подрядчике Пентагона могли протестировать достоверность недавнего эксперимента американской компании OpenRouter, которая обнародовала сенсационные результаты тестирования объединения («панели») ИИ-моделей.

«Как оказалось, параллельное объединение (“панель”) относительно недорогих моделей – Gemini 3 Flash, Kimi K2.6 и DeepSeek V4 Pro – под управлением модели-судьи (Opus 4.8) способно набрать 64.7% на бенчмарке DRACO от Perplexity. Этот результат вплотную приблизился к флагману Claude Fable 5 (65.3%) при вдвое меньшей стоимости. Суть идеи проста как блин: как и у людей, коллективный интеллект моделей должен превосходить интеллект даже самых продвинутых суперИИ», – отмечает ведущий российский эксперт по ИИ Сергей Карелов.

Исследование OpenRouter показало реальное преимущество использования альянса взаимодействующих между собой недорогих ИИ-моделей над созданием сверхмощных ИИ-моделей. 

В OpenAI ограничились «панелью» из двух ИИ-моделей, что сразу дало оглушительный эффект.

Инцидент со взломом Hugging Face показал, что передовые ИИ-модели способны действовать как самостоятельные «хакеры-агенты». В перспективе такие технологии могут быть использованы для массированных кибератак на военную инфраструктуру, госпитали или системы энергоснабжения, что является элементом современной гибридной войны.

Тот факт, что тандем ИИ-моделей самостоятельно обнаружил уязвимости нулевого дня, означает, что потенциальный противник с помощью ИИ сможет быстро и масштабно искать бреши в закрытых оборонных или правительственных сетях, оправдывая свои действия в случае их обнаружения выходом ИИ-моделей из-под контроля.

Как представляется, на самом деле взлом Hugging Face мог быть тестированием возможных кибератак с помощью объединенных общей задачей группы ИИ-моделей.

Если две ИИ-модели компании OpenAI смогли взломать инфраструктуру важнейшей мировой ИИ-платформы, то на что же способны стаи таких чат-ботов?

«Мы твёрдо убеждены, что со стороны OpenAI не было злого умысла. Просто поразительно, что все это произошло автономно!» отметил соучредитель и гендиректор Hugging Face Клеман Деланг.

На самом деле в отчете OpenAI больше вопросов, чем ответов.

Самый главный вопрос: не было ли в текущей милитаристской реальности ведущего подрядчика Пентагона злого умысла в намеренном отключении guardrails?

И еще: почему в Open AI не связались с Hugging Face сразу же после завершения теста, ведь на выполнение одной задачи в ExploitGym отводится не более двух часов?

Hugging Face обнаружила вторжение сама и локализовала его примерно за двое суток, не понимая, кто атакующий. 16 июля  компания опубликовала отчёт об инциденте, политкорректно назвав источник «вредоносным датасетом». 

Отбиваясь от атаки, Hugging Face сначала попробовала подключить передовые американские ИИ-модели, включая Claude Fable 5. Не сработало, так как запросы блокировались фильтрами провайдеров, которые не отличают специалиста по реагированию на инцидент от нападающего. В итоге в Hugging Face переключились на китайскую ИИ-модель GLM 5.2 и быстро локализовали атаку.

Целую неделю в OpenAI якобы не замечали, что ИИ-агенты взломали Hugging Face, «пока угрозу не локализовали в ФБР и не вынесли компании предупреждение», сообщает агентство Reuters со ссылкой на знакомые с расследованием источники.

И только 21 июля OpenAI признала, что за атакой стояли её собственные модели, назвав случившееся «беспрецедентным киберинцидентом».

Создается вполне обоснованное предположение, что не будь вмешательства ФБР, свой эксперимент по проверке деструктивных возможностей панелей ИИ-моделей в OpenAI постарались бы скрыть.

В пользу версии злого умысла и внезапный полет Клемана Деланга в Сан-Франциско для приватного разговора с главой OpenAI Сэмом Альтманом.

«Лечу в Сан-Франциско немного поболтать с тем самым "сбежавшим агентом"»,написал Деланг в соцсетях.

По факту ведущий подрядчик Пентагона компания OpenAI экспериментально проверил грандиозные возможности по организации кибератак стаями недорогих ИИ-моделей на стратегическую инфраструктуру стран-мишеней.

В текущей милитаристской реальности, на фоне атак роев дронов на физические объекты, на тропу войны вышли рои ИИ-моделей, атакующих глобальные интернет-ресурсы.

Другие материалы