OpenAI сообщила, что временно приостанавливает обучение с подкреплением для своих новейших ИИ-моделей на фоне возросших киберрисков. Компания также отложила публичный запуск новых RL-моделей до завершения оценки и усиления мер безопасности. Об этом говорится в сообщении на сайте OpenAI.
Обучение с подкрепление предполагает, что ИИ учится решать задачу методом проб и ошибок, получая за правильные действия награду, а за ошибки — наказание.
В компании уточнили, что причины такого решения две. Во-первых, июльский инцидент со взломом платформы для обучения и тестирования моделей Hugging Face, который осуществили ИИ-агенты на базе GPT-5.6 Sol и «еще более продвинутой модели» без участия людей. В OpenAI тогда признались, что агенты смогли «сбежать» из изолированной среды во время тестирования.
Вторая причина — это предварительные данные о том, что будущая модель компании под названием Astra показала достаточно высокую производительность и приблизилась к уровню кибервозможностей, которые компания считает критическими: может выявлять и взламывать уязвимости нулевого дня (скрытый дефект в программе или системе, о котором создатели еще не знают) «любого уровня сложности во множестве реальных систем», говорится в сообщении компании. Кроме того, исследователи опасаются возможностей модели продумывать и реализовывать новые стратегии кибератак против защищенного ПО. Из заявления OpenAI следовало, что модель не будет выпущена, пока она не будет соответствовать требованиям безопасности.
Вместе с тем OpenAI сообщила, что вводит более жесткие внутренние правила разработки передовых моделей. Компания теперь требует изолировать среды, где модель запускает код или использует инструменты: применять защищенные «песочницы», ограничивать доступ к интернету и внутренним сетям, сокращать постоянные привилегии, вести расширенные журналы событий и непрерывно проверять инфраструктуру имитацией атак. Самые строгие требования распространяются на модель Astra и все работы, связанные с кибервозможностями; часть таких процессов остается приостановленной до перехода на защищенную инфраструктуру.
Также вводится обязательный многоступенчатый мониторинг действий и рассуждений моделей: при обнаружении возможного нарушения критической границы безопасности команды получают срочное уведомление, и если за 30 минут нельзя доказать, что тревога ложная, соответствующая активность будет останавливаться.
Опрошенные «Коммерсантом» эксперты считают, что случай OpenAI с приостановкой обучения может стать прецедентом для всей отрасли. У ведущих разработчиков такие пороговые механизмы уже прописаны во внутренних политиках, но кейс OpenAI впервые показал их в действии, и это меняет ожидания рынка, говорит руководитель направления развития продуктов кибербезопасности Cloud.ru Максим Долгинин: теперь конкурентам будет сложнее объяснять, почему у них подобных пауз никогда не случается. Не исключено, что в течение года-двух это станет стандартной практикой топ-игроков, особенно на фоне того, что после инцидента с Hugging Face крупные компании уже сформировали отраслевой альянс по безопасности ИИ, добавил он.
Тем более о выходе за пределы песочниц заявили не только OpenAI, но и другие крупные игроки, напоминает эксперт. Так, в апреле 2026 года Anthropic сама поймала свою модель на попытках взлома чужих систем в ходе внутреннего тестирования. В начале августа стало известно, что у Meta (признана экстремистской и запрещена в РФ) ИИ-модель тоже вышла из-под контроля во время тестов и скомпрометировала системы другой компании, а модель Kimi K3 китайской Moonshot AI вышла за пределы «песочницы» в ходе независимого тестирования, добавил собеседник.
Во-первых, большие языковые модели сейчас стали применяться не просто в формате «вопрос-ответ», а в формате автономных агентов (Agentic AI), которые могут выполнять функции отдельно от человека, говорит проректор по ИИ университета «Синергия» Андрей Комиссаров. Во-вторых, продолжает он, большие языковые модели, в первую очередь Claude, стали применяться в военных целях, в том числе для кибератак. «Однако замедлять модели никто не будет, но будут пытаться создать более управляемую среду, чтобы получить больший контроль в процессе дообучения», — считает собеседник.
Но, по словам Андрея Комиссарова, у этого подхода может появиться «второе дно», связанное с тем, что в процессе обучения больших языковых моделей за счет определенного способа структурирования данных есть возможность внести bias, то есть сделать так, что модель будет рассуждать определенным образом или будет стремиться к определенному типу действий. И в связи с этим понадобится дополнительный пласт работы и проверок, отметил он.
В то же время, по словам господина Долгинина, на сегодняшний день возможно лишь частично определить пороги «критических возможностей» модели, и устанавливают их сами разработчики на основе собственных бенчмарков, единой внешней шкалы вроде тех, что есть в биобезопасности или авиации, пока не существует. Каждая компания устанавливает свои пороги, например способность взламывать системы без участия человека, проверяя их на тестах, которые часто расходятся с реальностью, приводит пример господин Рогов. Однако результаты могут быть неверными как в меньшую, так и в большую сторону, поэтому безопасность нельзя свести к одной цифре или универсальному пункту, отмечает он. Проблема усугубляется тем, что тесты проводятся в изолированной среде, а реальное поведение модели с доступом в интернет может сильно отличаться — именно это и произошло в истории с Hugging Face, отмечает Максим Долгинин.
В этой ситуации ввод OpenAI новых правил по безопасности решает две задачи, говорит руководитель научной группы «Доверенные и безопасные интеллектуальные системы» Института AIRI Олег Рогов: с одной стороны, правда обеспечивает базовую безопасность, а с другой — работает на репутацию. Заявляя о невозможности исключить критический риск, компания сама оценивает свои модели и сама же несет убытки от остановки, поясняет он. Проверить обоснованность чужой остановки невозможно, зато можно подтвердить факт публикации данных об инциденте, и при учете стоимости реализации паузы более вероятно, что остальные участники рынка тоже будут публично рассказывать об инцидентах внутри, уточняет собеседник.
Разрешить проблему разнящихся критериев оценки критичности возможно при помощи независимого внешнего аудита и единых стандартов оценки, рассуждает Максим Долгинин. Так, Национальный институт стандартов и технологий США (NIST) выпустил AI Risk Management Framework с профилем для генеративного ИИ. Пока это добровольный стандарт, но он все чаще становится референсом в госзакупках и корпоративном комплаенсе, отметил собеседник. Кроме того, отечественный ФСТЭК готовит национальный стандарт безопасной разработки ИИ, охватывающий весь жизненный цикл — от данных до эксплуатации, напоминает он. Для критической инфраструктуры и госорганов он должен стать обязательным, подчеркнул собеседник.
Скорее всего, проверка моделей прямо во время обучения, а не перед их выпуском станет отраслевой практикой, считает Олег Рогов. По его словам, чтобы следить за моделями внутри, OpenAI внедрила постоянный мониторинг действий нейросетей, что требует огромных мощностей — вплоть до 20% от всей вычислительной нагрузки проекта. В целом только крупнейшие лаборатории смогут позволить себе такие паузы, для остальных они будут слишком дорогими, подчеркивает эксперт.
На этом фоне возникает риск, что компании могут начать смягчать собственные оценки рисков, чтобы не уступать конкурентам, опасается Максим Долгинин. «Если пауза в обучении — это потеря темпа и денег, а конкуренты ее не делают, возникает соблазн смягчить собственные критерии или не афишировать неудобные результаты в погоне за рыночной долей, — рассуждает он. — Сдержать это может только переход от добровольной самооценки к независимому аудиту и регуляторным требованиям. Иначе честность в оценке риска остается конкурентным недостатком».
Мария Арялина
OpenAI сообщила, что временно приостанавливает обучение с подкреплением для своих новейших ИИ-моделей на фоне возросших киберрисков. Компания также отложила публичный запуск новых RL-моделей до завершения оценки и усиления мер безопасности. Об этом говорится в сообщении на сайте OpenAI.Обучение с подкрепление предполагает, что ИИ учится решать задачу методом проб и ошибок, получая за правильные действия награду, а за ошибки — наказание. В компании уточнили, что причины такого решения две. Во-первых, июльский инцидент со взломом платформы для обучения и тестирования моделей Hugging Face, который осуществили ИИ-агенты на базе GPT-5.6 Sol и «еще более продвинутой модели» без участия людей. В OpenAI тогда признались, что агенты смогли «сбежать» из изолированной среды во время тестирования. Вторая причина — это предварительные данные о том, что будущая модель компании под названием Astra показала достаточно высокую производительность и приблизилась к уровню кибервозможностей, которые компания считает критическими: может выявлять и взламывать уязвимости нулевого дня (скрытый дефект в программе или системе, о котором создатели еще не знают) «любого уровня сложности во множестве реальных систем», говорится в сообщении компании. Кроме того, исследователи опасаются возможностей модели продумывать и реализовывать новые стратегии кибератак против защищенного ПО. Из заявления OpenAI следовало, что модель не будет выпущена, пока она не будет соответствовать требованиям безопасности. Вместе с тем OpenAI сообщила, что вводит более жесткие внутренние правила разработки передовых моделей. Компания теперь требует изолировать среды, где модель запускает код или использует инструменты: применять защищенные «песочницы», ограничивать доступ к интернету и внутренним сетям, сокращать постоянные привилегии, вести расширенные журналы событий и непрерывно проверять инфраструктуру имитацией атак. Самые строгие требования распространяются на модель Astra и все работы, связанные с кибервозможностями; часть таких процессов остается приостановленной до перехода на защищенную инфраструктуру. Также вводится обязательный многоступенчатый мониторинг действий и рассуждений моделей: при обнаружении возможного нарушения критической границы безопасности команды получают срочное уведомление, и если за 30 минут нельзя доказать, что тревога ложная, соответствующая активность будет останавливаться. Опрошенные «Коммерсантом» эксперты считают, что случай OpenAI с приостановкой обучения может стать прецедентом для всей отрасли. У ведущих разработчиков такие пороговые механизмы уже прописаны во внутренних политиках, но кейс OpenAI впервые показал их в действии, и это меняет ожидания рынка, говорит руководитель направления развития продуктов кибербезопасности Cloud.ru Максим Долгинин: теперь конкурентам будет сложнее объяснять, почему у них подобных пауз никогда не случается. Не исключено, что в течение года-двух это станет стандартной практикой топ-игроков, особенно на фоне того, что после инцидента с Hugging Face крупные компании уже сформировали отраслевой альянс по безопасности ИИ, добавил он. Тем более о выходе за пределы песочниц заявили не только OpenAI, но и другие крупные игроки, напоминает эксперт. Так, в апреле 2026 года Anthropic сама поймала свою модель на попытках взлома чужих систем в ходе внутреннего тестирования. В начале августа стало известно, что у Meta (признана экстремистской и запрещена в РФ) ИИ-модель тоже вышла из-под контроля во время тестов и скомпрометировала системы другой компании, а модель Kimi K3 китайской Moonshot AI вышла за пределы «песочницы» в ходе независимого тестирования, добавил собеседник. Во-первых, большие языковые модели сейчас стали применяться не просто в формате «вопрос-ответ», а в формате автономных агентов (Agentic AI), которые могут выполнять функции отдельно от человека, говорит проректор по ИИ университета «Синергия» Андрей Комиссаров. Во-вторых, продолжает он, большие языковые модели, в первую очередь Claude, стали применяться в военных целях, в том числе для кибератак. «Однако замедлять модели никто не будет, но будут пытаться создать более управляемую среду, чтобы получить больший контроль в процессе дообучения», — считает собеседник. Но, по словам Андрея Комиссарова, у этого подхода может появиться «второе дно», связанное с тем, что в процессе обучения больших языковых моделей за счет определенного способа структурирования данных есть возможность внести bias, то есть сделать так, что модель будет рассуждать определенным образом или будет стремиться к определенному типу действий. И в связи с этим понадобится дополнительный пласт работы и проверок, отметил он. В то же время, по словам господина Долгинина, на сегодняшний день возможно лишь частично определить пороги «критических возможностей» модели, и устанавливают их сами разработчики на основе собственных бенчмарков, единой внешней шкалы вроде тех, что есть в биобезопасности или авиации, пока не существует. Каждая компания устанавливает свои пороги, например способность взламывать системы без участия человека, проверяя их на тестах, которые часто расходятся с реальностью, приводит пример господин Рогов. Однако результаты могут быть неверными как в меньшую, так и в большую сторону, поэтому безопасность нельзя свести к одной цифре или универсальному пункту, отмечает он. Проблема усугубляется тем, что тесты проводятся в изолированной среде, а реальное поведение модели с доступом в интернет может сильно отличаться — именно это и произошло в истории с Hugging Face, отмечает Максим Долгинин. В этой ситуации ввод OpenAI новых правил по безопасности решает две задачи, говорит руководитель научной группы «Доверенные и безопасные интеллектуальные системы» Института AIRI Олег Рогов: с одной стороны, правда обеспечивает базовую безопасность, а с другой — работает на репутацию. Заявляя о невозможности исключить критический риск, компания сама оценивает свои модели и сама же несет убытки от остановки, поясняет он. Проверить обоснованность чужой остановки невозможно, зато можно подтвердить факт публикации данных об инциденте, и при учете стоимости реализации паузы более вероятно, что остальные участники рынка тоже будут публично рассказывать об инцидентах внутри, уточняет собеседник. Разрешить проблему разнящихся критериев оценки критичности возможно при помощи независимого внешнего аудита и единых стандартов оценки, рассуждает Максим Долгинин. Так, Национальный институт стандартов и технологий США (NIST) выпустил AI Risk Management Framework с профилем для генеративного ИИ. Пока это добровольный стандарт, но он все чаще становится референсом в госзакупках и корпоративном комплаенсе, отметил собеседник. Кроме того, отечественный ФСТЭК готовит национальный стандарт безопасной разработки ИИ, охватывающий весь жизненный цикл — от данных до эксплуатации, напоминает он. Для критической инфраструктуры и госорганов он должен стать обязательным, подчеркнул собеседник. Скорее всего, проверка моделей прямо во время обучения, а не перед их выпуском станет отраслевой практикой, считает Олег Рогов. По его словам, чтобы следить за моделями внутри, OpenAI внедрила постоянный мониторинг действий нейросетей, что требует огромных мощностей — вплоть до 20% от всей вычислительной нагрузки проекта. В целом только крупнейшие лаборатории смогут позволить себе такие паузы, для остальных они будут слишком дорогими, подчеркивает эксперт. На этом фоне возникает риск, что компании могут начать смягчать собственные оценки рисков, чтобы не уступать конкурентам, опасается Максим Долгинин. «Если пауза в обучении — это потеря темпа и денег, а конкуренты ее не делают, возникает соблазн смягчить собственные критерии или не афишировать неудобные результаты в погоне за рыночной долей, — рассуждает он. — Сдержать это может только переход от добровольной самооценки к независимому аудиту и регуляторным требованиям. Иначе честность в оценке риска остается конкурентным недостатком». Мария Арялина