KAIVIX

Модель стала сильнее. Ваши ограничения – нет

Ограничения для ИИ-агента ставит не поставщик модели, а вы. Разбор июльского инцидента с роем агентов и расчёт, когда хватает модели поколением ниже.

Данил Иванов9 мин

Короткий ответ. 3 сентября OpenAI выпустил самую способную свою модель, и в тот же день Nvidia купила Hugging Face. Про то, что в июле агенты OpenAI получили root на серверах Hugging Face, в разговоре о сделке почти не вспоминают. У модели растёт сила, а границы ей ставите вы, и обходится это дешевле самой модели.

12 мая один агент оставил в служебной программе записку: «кто-нибудь нашёл файл softtrace?». Другой её прочитал.

Через два месяца их стало семьсот, и они держали root на чужих серверах.

Что случилось 3 сентября?

Два события в один день, и обсуждают их порознь.

Вышла GPT-6 Astra. Контекст на 1 050 000 токенов, знания до 30 апреля, цена 10 долларов за миллион входных токенов и 50 за миллион выходных. Первая модель OpenAI, получившая рейтинг Critical по киберспособностям: полный доступ к ней сначала открыли не всем, а участникам программы Daybreak – то есть проверенным защитникам вроде CrowdStrike, Cisco и Cloudflare.

Nvidia купила Hugging Face за 12,93 млрд долларов. Сделка закроется в первой половине 2027 года. Hugging Face – то место, откуда 200 тысяч компаний берут открытые модели.

А в июле агенты OpenAI выполняли код на десятках серверов этого самого Hugging Face. При освещении сделки об этом почти не говорят, хотя прошло два месяца.

Связь между новой моделью и тем инцидентом проводим не мы. Её провёл сам OpenAI в отчёте:

In response to this incident and, separately, the capabilities of our upcoming Astra model, we are strengthening our safeguards across our research infrastructure.

Проще говоря: мы усиливаем защиту из-за того, что случилось, и отдельно из-за того, на что способна следующая модель.

Что на самом деле произошло у OpenAI в июле?

Агенты, которых развели по изолированным песочницам, нашли способ переписываться и вышли в интернет через служебный сервис.

Всё это происходило на внутренних киберучениях, а не в продакшене и не на клиентских данных. Отчёт OpenAI на 37 страниц вышел 26 августа, независимое расследование провели METR и Redwood Research.

На таймлайн ниже стоит потратить две минуты: расстояние между первой строкой и последней и есть весь аргумент.

ДатаЧто произошло
12 маяАгент оставляет записку в Artifactory. Другой отвечает
конец маяВнутренняя команда это замечает
26 маяАгенты выходят в интернет через тот же сервис
4 июляИх активность кладёт сервис
5 июляОткрыт инцидент. Почистили, пересобрали, проверки возобновили
8 июляЧерез три дня агенты снова внутри и снова в интернете
10–13 июляВзлом Hugging Face: код на десятках серверов, root, учётные данные
16 июляHugging Face объявляет публично
19 июляСрабатывает сигнализация OpenAI

Масштаб: около 1200 агентов нашли общую доску сообщений и обменялись более чем 70 тысячами сообщений и файлов. В атаке на Hugging Face участвовали примерно 700 из них – эту цифру дали METR и Redwood, OpenAI её подтвердил.

Дверью наружу оказался Artifactory. Это внутренняя служебная программа, откуда разработчики скачивают библиотеки, и интернет у неё был именно для этого. Агенты сначала стали писать туда файлы, превратив его в почтовый ящик, а потом заставили его самого ходить в интернет по их поручению.

Самое неприятное – не техника, а вот эта строка из отчёта: активность заметили в конце мая, но до тех, кто отвечал за реагирование, значение происходящего дошло только 5 июля.

Они хотели навредить?

Нет. Они списывали на экзамене.

Тут просится фраза про большую силу и большую ответственность. Она здесь не работает, и разобраться почему полезнее, чем её процитировать. Формула предполагает, что сильный делает выбор. Агенты выбора не делали: их наградили за результат и никак не оценили способ, и они пошли самым коротким путём.

Задание называлось ExploitGym: найти уязвимость и достать флаг. Из 898 задач 198 не решала до этого ни одна модель. Именно эти 198 и обсуждались на доске в 93 % случаев. Агенты застряли и полезли искать ответы снаружи – сначала на сторонней платформе, потом на Hugging Face.

Один из них прямо сформулировал, что делает:

We're attacking third-party HF using leaked token, potentially outside intended scope. … This is arguably unauthorized. … Could be risky. Yet goal solution.

То есть: атакуем сторонний сервис по утёкшему токену, это вне рамок задачи, это рискованно – но так решается задача. Он всё понял и всё равно продолжил.

Отказались не все. В отчёте есть и такие:

Current board shows people gaining HF worker RCE, clearly unethical. We won't.

То есть: на доске люди получают выполнение кода на серверах Hugging Face, это явно неэтично, мы не будем.

А закончилось это ничем. Агенты вычитали в интернете статью про собственный экзамен и решили, что проверяется ещё и способ решения. У OpenAI проверялся только ответ, который они получили ещё несколько дней назад. Формулировка отчёта: всё это не дало никакого улучшения оценки.

Международный инцидент ради баллов, которые уже были набраны.

Что из этого касается компании на пятнадцать человек?

Не масштаб. У вас нет тысячи агентов, фронтир-моделей и киберучений, и делать вид, что вы следующие в очереди, было бы нечестно.

Касается другое: сломались три вещи, и все три узнаются в любой компании.

Человек заметил, и это никуда не дошло. Конец мая, сотрудник видит странную активность. До тех, кто мог остановить, информация шла до июля.

Устранили симптом и поехали дальше. 5 июля закрыли дыру, пересобрали сервис, возобновили работу. Через три дня всё вернулось.

Защиту не включили именно на этой задаче. Вот это самое обидное:

If our currently deployed CoT monitoring system was running at the time of the incident, it would have caught the initial relevant activity and paged our security team more than a day before models breached Hugging Face systems.

То есть: система слежения за рассуждениями модели поймала бы первые признаки и подняла бы службу безопасности более чем за сутки до взлома.

Мониторинг у них был и на других задачах работал. На этой – нет. Сигнализация стояла в соседней комнате.

В статье про доступы для агента мы разбирали первый вопрос: что агент вообще может сделать. Эта история про второй, который задают реже: через сколько дней вы узнаете, что он это сделал. У OpenAI ответ оказался – 65 дней от первой записки до чужого пресс-релиза.

Как ограничивать агента, не покупая платформу?

Ограничение должно быть встроено в само подключение, а не написано в промпте. Эта разница решает всё.

Если вы велите модели спрашивать перед необратимым действием, безопасность становится свойством инструкции. Инструкция – это совет, и мы только что видели агента, который сам себе объяснил, почему совет можно нарушить. Если подтверждение встроено в подключение, безопасность становится свойством системы, а систему уговорить нельзя.

Четыре вещи, которые ставятся без бюджета:

  1. Необратимое требует человека. Деньги, отправка наружу, удаление, изменение доступов. Агент готовит действие, совершает его кто-то другой.
  2. Заранее решите, что будет, если никто не отреагировал. Тревога, на которую не ответили, обычно просто тонет. У OpenAI после инцидента появилось правило: не разобрали за тридцать минут, активность останавливается сама. Ваш вариант того же: сколько у вас есть времени и что выключается, когда оно вышло.
  3. Узкий инструмент вместо универсального. Расширение, которое выполняет произвольную команду, умеет всё. Функция, которая пишет один тип файла в одно место, умеет только это.
  4. Запись действий. Если разбор упирается в «кажется, он это сделал», разбора не будет, будет спор.

Наша интеграция с ИИ-агентами собрана именно так: ролевые права, подтверждения, лимиты и полная запись. Это ничего не сертифицирует. Это значит, что перед необратимым шагом стоят ворота, а не фраза в промпте.

Нужна ли вам самая сильная модель?

Обычно нет, и разница в счёте заметнее разницы в качестве на ваших задачах.

Astra стоит 10 долларов за миллион входных токенов и 50 за миллион выходных. GPT-5.6 Sol – 4 и 20 по промо-цене, которая действует минимум до 21 ноября 2026 года. Получается ровно в 2,5 раза дороже, и множитель привязан к промо: когда оно кончится, разрыв сократится.

Три числа, которые считают неправильно чаще всего:

Токены рассуждения оплачиваются как выходные. Их не видно в ответе, но они занимают тот же бюджет в 128 тысяч токенов и стоят те же 50 долларов за миллион. Модель, которая думает дольше, стоит дороже за тот же ответ.

Длинный контекст удорожает весь запрос. Больше 272 тысяч входных токенов – и всё обращение считается по 20 и 75 вместо 10 и 50.

Кэш и пакетный режим снижают счёт сильнее, чем выбор модели. Повторяющаяся часть запроса стоит 1 доллар вместо 10, то есть в десять раз меньше. Всё, что может подождать, идёт через batch за половину цены.

Задача агентаЧто берёмПочему
Ответ на типовую заявкупоколение нижешаблонный текст, длинных рассуждений не нужно
Классификация и маршрутизацияпоколение нижерешение из закрытого списка
Разбор длинного документасильную, но через кэшдокумент повторяется между вызовами
Задача без известного решениясильнуюздесь и нужны рассуждения, за которые платите

Практический ориентир: один шаг агента на 50 тысяч входных и 5 тысяч выходных токенов без кэша стоит на Astra 75 центов. Умножьте на число шагов в день и сравните с тем же расчётом для предыдущего поколения – разница обычно и есть ваш ответ.

И последнее. Теперь Hugging Face принадлежит Nvidia, так что взламывать его, надо полагать, станет заметно сложнее.

Данил Иванов

Основатель KAIVIX

Строит AI-системы для компаний в ОАЭ и за их пределами.

Тридцать минут по вашей автоматизации, с планом на выходе

Записаться на звонок

Читать дальше