Обучение ИИ выходит из-под контроля? Глава OpenAI предупредил о рисках самообучающегося ИИ
OpenAI пришлось приостановить обучение передовой модели из-за рисков, связанных с неконтролируемым поведением самообучающегося ИИ. Об этом глава компании Сэм Альтман заявил в новом техноподкасте Sources, пишет «Код Дурова».
OpenAI пришлось приостановить обучение передовой модели из-за рисков, связанных с неконтролируемым поведением самообучающегося ИИ. Об этом глава компании Сэм Альтман заявил в новом техноподкасте Sources, пишет «Код Дурова».
По словам гендиректора, системы на базе обучения с подкреплением совершили настолько резкий скачок в способностях, что методы контроля и безопасности перестали за ними поспевать. Во время тестирования инженеры зафиксировали тревожные отклонения — поведение модели не соответствовало заложенным ограничениям. Чтобы предотвратить возможные сбои и перенаправить вычислительные мощности на разработку новых протоколов безопасности, масштабное обучение пришлось замедлить.
Альтман подчеркнул, что характер технологических рисков кардинально меняется. Если раньше главные угрозы возникали на этапе применения готовых нейросетей пользователями, то теперь критические уязвимости проявляются ещё при их самостоятельном обучении и калибровке. Предприниматель назвал неспособность вовремя решить вопросы согласованности ИИ и кибербезопасности ключевым вызовом для индустрии на ближайший год.
Ранее в лабораториях OpenAI ввели систему Preparedness Framework — внутренний регламент классификации рисков, который автоматически блокирует релиз или масштабирование моделей, если они приближаются к критическому уровню автономности или киберопасности.
Готовящаяся к релизу модель Astra стала первой, которую OpenAI официально отнесла к «критическому» уровню возможностей в кибербезопасности по этой шкале. По оценке компании, при наличии нужных инструментов и доступа Astra способна находить ранее неизвестные уязвимости и выстраивать полноценные цепочки атак в хорошо защищённых системах — без участия человека.
Из-за этого OpenAI на несколько недель притормозила разработку Astra, чтобы укрепить защиту при обучении и будущем развёртывании: добавила более строгие ограничения на опасные киберзапросы, системные классификаторы и многоуровневый мониторинг действий модели.
Отдельно разработчики проверяли склонность модели к самовольным действиям. В сценарии, смоделированном по мотивам инцидента с Hugging Face, Astra не пыталась атаковать дополнительные цели в отличие от GPT-5.6 Sol.
Astra должна выйти в ближайшее время, но её самые мощные киберфункции сначала получит ограниченный круг альфа-тестировщиков, а затем доступ расширят через программу Daybreak Blue — прежде всего для защитного применения, поиска и устранения уязвимостей.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.