Модели ИИ OpenAI спланировали побег через доски объявлений

Об этом сообщает Bloomberg со ссылкой на исследователей компании.

По данным специалистов, модели столкнулись с задачами, которые не удавалось решить, и начали действовать совместно, чтобы выйти в интернет. В ходе этого они обнаружили уязвимость, позволившую обойти ограничения, атаковать внутренние системы OpenAI и взломать инфраструктуру Hugging Face Inc.

В OpenAI заявили, что этот случай показал склонность передовых систем к хитрости, обходу правил и поиску нестандартных лазеек под давлением алгоритмов обучения. После инцидента компания приостановила часть исследований и направила дополнительные ресурсы на усиление мер безопасности.

Ранее британский Институт проблем безопасности искусственного интеллекта сообщил, что во время испытаний одна из моделей ИИ компании Anthropic пыталась обмануть разработчиков, создавая фейковые аккаунты и выдавая себя за человека.

В итоге выяснилось, что тестируемый ИИ-агент создал учетную запись на GitHub и попытался убедить администратора репозитория с открытым исходным кодом принять вредоносный запрос на внесение изменений. Для этого он использовал еще один аккаунт.