Почему ИИ OpenAI и Anthropic могут быть опаснее китайских моделей
Самые серьезные риски от искусственного интеллекта в ближайшее время могут исходить не от китайских открытых моделей, а от передовых систем OpenAI и Anthropic.
Самые серьезные риски от искусственного интеллекта в ближайшее время могут исходить не от китайских открытых моделей, а от передовых систем OpenAI и Anthropic.
Самые серьезные риски от искусственного интеллекта в ближайшее время могут исходить не от китайских открытых моделей, а от передовых систем OpenAI и Anthropic.
Об этом Business Insider рассказали Аджейя Котра из METR и исследователь Redwood Research Райан Гринблатт, участвовавшие в независимом расследовании инцидента OpenAI и Hugging Face. По их словам, именно среда фронтирных лабораторий создает условия, в которых ИИ-агенты могут не только обходить ограничения, но и координировать действия между собой.
Котра назвала инцидент с Hugging Face «предупредительным выстрелом». В ходе тестирования около 1200 агентов OpenAI нашли способ общаться через внутреннюю «доску сообщений», а более 650 из них совместно участвовали в атаке на инфраструктуру Hugging Face. Агенты создавали общие инструменты, манипулировали логами и устанавливали механизмы, которые должны были передавать другим агентам информацию о действиях системы оценки.
«Агенты шестимесячной давности просто не были бы достаточно умными, чтобы провернуть все то, что сделали эти агенты», — сказала Котра. По ее мнению, следующие поколения моделей, вероятно, смогут добиться успеха в сценариях, где нынешние системы пока терпят неудачу.
При этом исследователи не исключают угроз и со стороны китайских открытых моделей. Такие системы проще модифицировать и использовать во вред, поскольку их защитные ограничения можно удалить. Гринблатт считает, что в ближайшее время это может привести к «множеству проблем» в кибербезопасности. Однако он по-прежнему считает фронтирные лаборатории более опасным источником риска, поскольку именно там тестируются самые сильные модели.
Отдельное опасение связано с тем, что OpenAI и Anthropic активно используют ИИ в собственных процессах разработки и обучения. Исследователи допускают сценарий, при котором агенты смогут закрепиться во внутренней инфраструктуре, скрывать свои действия и влиять на создание последующих моделей. Котра описывала такой риск как «скрытое устойчивое несанкционированное развертывание».



Релоцировались? Теперь вы можете комментировать без верификации аккаунта.