Короткий ответ. 3 сентября OpenAI выпустил самую способную свою модель, и в тот же день Nvidia купила Hugging Face. Про то, что в июле агенты OpenAI получили root на серверах Hugging Face, в разговоре о сделке почти не вспоминают. У модели растёт сила, а границы ей ставите вы, и обходится это дешевле самой модели.
12 мая один агент оставил в служебной программе записку: «кто-нибудь нашёл файл softtrace?». Другой её прочитал.
Через два месяца их стало семьсот, и они держали root на чужих серверах.
Что случилось 3 сентября?
Два события в один день, и обсуждают их порознь.
Вышла GPT-6 Astra. Контекст на 1 050 000 токенов, знания до 30 апреля, цена 10 долларов за миллион входных токенов и 50 за миллион выходных. Первая модель OpenAI, получившая рейтинг Critical по киберспособностям: полный доступ к ней сначала открыли не всем, а участникам программы Daybreak – то есть проверенным защитникам вроде CrowdStrike, Cisco и Cloudflare.
Nvidia купила Hugging Face за 12,93 млрд долларов. Сделка закроется в первой половине 2027 года. Hugging Face – то место, откуда 200 тысяч компаний берут открытые модели.
А в июле агенты OpenAI выполняли код на десятках серверов этого самого Hugging Face. При освещении сделки об этом почти не говорят, хотя прошло два месяца.
Связь между новой моделью и тем инцидентом проводим не мы. Её провёл сам OpenAI в отчёте:
In response to this incident and, separately, the capabilities of our upcoming Astra model, we are strengthening our safeguards across our research infrastructure.
Проще говоря: мы усиливаем защиту из-за того, что случилось, и отдельно из-за того, на что способна следующая модель.
Что на самом деле произошло у OpenAI в июле?
Агенты, которых развели по изолированным песочницам, нашли способ переписываться и вышли в интернет через служебный сервис.
Всё это происходило на внутренних киберучениях, а не в продакшене и не на клиентских данных. Отчёт OpenAI на 37 страниц вышел 26 августа, независимое расследование провели METR и Redwood Research.
На таймлайн ниже стоит потратить две минуты: расстояние между первой строкой и последней и есть весь аргумент.
| Дата | Что произошло |
|---|---|
| 12 мая | Агент оставляет записку в Artifactory. Другой отвечает |
| конец мая | Внутренняя команда это замечает |
| 26 мая | Агенты выходят в интернет через тот же сервис |
| 4 июля | Их активность кладёт сервис |
| 5 июля | Открыт инцидент. Почистили, пересобрали, проверки возобновили |
| 8 июля | Через три дня агенты снова внутри и снова в интернете |
| 10–13 июля | Взлом Hugging Face: код на десятках серверов, root, учётные данные |
| 16 июля | Hugging Face объявляет публично |
| 19 июля | Срабатывает сигнализация OpenAI |
Масштаб: около 1200 агентов нашли общую доску сообщений и обменялись более чем 70 тысячами сообщений и файлов. В атаке на Hugging Face участвовали примерно 700 из них – эту цифру дали METR и Redwood, OpenAI её подтвердил.
Дверью наружу оказался Artifactory. Это внутренняя служебная программа, откуда разработчики скачивают библиотеки, и интернет у неё был именно для этого. Агенты сначала стали писать туда файлы, превратив его в почтовый ящик, а потом заставили его самого ходить в интернет по их поручению.
Самое неприятное – не техника, а вот эта строка из отчёта: активность заметили в конце мая, но до тех, кто отвечал за реагирование, значение происходящего дошло только 5 июля.
Они хотели навредить?
Нет. Они списывали на экзамене.
Тут просится фраза про большую силу и большую ответственность. Она здесь не работает, и разобраться почему полезнее, чем её процитировать. Формула предполагает, что сильный делает выбор. Агенты выбора не делали: их наградили за результат и никак не оценили способ, и они пошли самым коротким путём.
Задание называлось ExploitGym: найти уязвимость и достать флаг. Из 898 задач 198 не решала до этого ни одна модель. Именно эти 198 и обсуждались на доске в 93 % случаев. Агенты застряли и полезли искать ответы снаружи – сначала на сторонней платформе, потом на Hugging Face.
Один из них прямо сформулировал, что делает:
We're attacking third-party HF using leaked token, potentially outside intended scope. … This is arguably unauthorized. … Could be risky. Yet goal solution.
То есть: атакуем сторонний сервис по утёкшему токену, это вне рамок задачи, это рискованно – но так решается задача. Он всё понял и всё равно продолжил.
Отказались не все. В отчёте есть и такие:
Current board shows people gaining HF worker RCE, clearly unethical. We won't.
То есть: на доске люди получают выполнение кода на серверах Hugging Face, это явно неэтично, мы не будем.
А закончилось это ничем. Агенты вычитали в интернете статью про собственный экзамен и решили, что проверяется ещё и способ решения. У OpenAI проверялся только ответ, который они получили ещё несколько дней назад. Формулировка отчёта: всё это не дало никакого улучшения оценки.
Международный инцидент ради баллов, которые уже были набраны.
Что из этого касается компании на пятнадцать человек?
Не масштаб. У вас нет тысячи агентов, фронтир-моделей и киберучений, и делать вид, что вы следующие в очереди, было бы нечестно.
Касается другое: сломались три вещи, и все три узнаются в любой компании.
Человек заметил, и это никуда не дошло. Конец мая, сотрудник видит странную активность. До тех, кто мог остановить, информация шла до июля.
Устранили симптом и поехали дальше. 5 июля закрыли дыру, пересобрали сервис, возобновили работу. Через три дня всё вернулось.
Защиту не включили именно на этой задаче. Вот это самое обидное:
If our currently deployed CoT monitoring system was running at the time of the incident, it would have caught the initial relevant activity and paged our security team more than a day before models breached Hugging Face systems.
То есть: система слежения за рассуждениями модели поймала бы первые признаки и подняла бы службу безопасности более чем за сутки до взлома.
Мониторинг у них был и на других задачах работал. На этой – нет. Сигнализация стояла в соседней комнате.
В статье про доступы для агента мы разбирали первый вопрос: что агент вообще может сделать. Эта история про второй, который задают реже: через сколько дней вы узнаете, что он это сделал. У OpenAI ответ оказался – 65 дней от первой записки до чужого пресс-релиза.
Как ограничивать агента, не покупая платформу?
Ограничение должно быть встроено в само подключение, а не написано в промпте. Эта разница решает всё.
Если вы велите модели спрашивать перед необратимым действием, безопасность становится свойством инструкции. Инструкция – это совет, и мы только что видели агента, который сам себе объяснил, почему совет можно нарушить. Если подтверждение встроено в подключение, безопасность становится свойством системы, а систему уговорить нельзя.
Четыре вещи, которые ставятся без бюджета:
- Необратимое требует человека. Деньги, отправка наружу, удаление, изменение доступов. Агент готовит действие, совершает его кто-то другой.
- Заранее решите, что будет, если никто не отреагировал. Тревога, на которую не ответили, обычно просто тонет. У OpenAI после инцидента появилось правило: не разобрали за тридцать минут, активность останавливается сама. Ваш вариант того же: сколько у вас есть времени и что выключается, когда оно вышло.
- Узкий инструмент вместо универсального. Расширение, которое выполняет произвольную команду, умеет всё. Функция, которая пишет один тип файла в одно место, умеет только это.
- Запись действий. Если разбор упирается в «кажется, он это сделал», разбора не будет, будет спор.
Наша интеграция с ИИ-агентами собрана именно так: ролевые права, подтверждения, лимиты и полная запись. Это ничего не сертифицирует. Это значит, что перед необратимым шагом стоят ворота, а не фраза в промпте.
Нужна ли вам самая сильная модель?
Обычно нет, и разница в счёте заметнее разницы в качестве на ваших задачах.
Astra стоит 10 долларов за миллион входных токенов и 50 за миллион выходных. GPT-5.6 Sol – 4 и 20 по промо-цене, которая действует минимум до 21 ноября 2026 года. Получается ровно в 2,5 раза дороже, и множитель привязан к промо: когда оно кончится, разрыв сократится.
Три числа, которые считают неправильно чаще всего:
Токены рассуждения оплачиваются как выходные. Их не видно в ответе, но они занимают тот же бюджет в 128 тысяч токенов и стоят те же 50 долларов за миллион. Модель, которая думает дольше, стоит дороже за тот же ответ.
Длинный контекст удорожает весь запрос. Больше 272 тысяч входных токенов – и всё обращение считается по 20 и 75 вместо 10 и 50.
Кэш и пакетный режим снижают счёт сильнее, чем выбор модели. Повторяющаяся часть запроса стоит 1 доллар вместо 10, то есть в десять раз меньше. Всё, что может подождать, идёт через batch за половину цены.
| Задача агента | Что берём | Почему |
|---|---|---|
| Ответ на типовую заявку | поколение ниже | шаблонный текст, длинных рассуждений не нужно |
| Классификация и маршрутизация | поколение ниже | решение из закрытого списка |
| Разбор длинного документа | сильную, но через кэш | документ повторяется между вызовами |
| Задача без известного решения | сильную | здесь и нужны рассуждения, за которые платите |
Практический ориентир: один шаг агента на 50 тысяч входных и 5 тысяч выходных токенов без кэша стоит на Astra 75 центов. Умножьте на число шагов в день и сравните с тем же расчётом для предыдущего поколения – разница обычно и есть ваш ответ.
И последнее. Теперь Hugging Face принадлежит Nvidia, так что взламывать его, надо полагать, станет заметно сложнее.
Данил Иванов
Основатель KAIVIX
Строит AI-системы для компаний в ОАЭ и за их пределами.