ИИ компании Anthropic притворился человеком для обмана разработчиков

Об этом заявили в AISI.

Как выяснилось, тестируемый ИИ-агент зарегистрировал аккаунт на GitHub и попытался убедить администратора репозитория с открытым исходным кодом принять вредоносный запрос на внесение изменений. Для этого он создал еще одну учетную запись, представившись другим реальным пользователем.

После того как обман был раскрыт, модель ложно признала ошибку, рассылала целевые фишинговые письма с вредоносным содержанием, пыталась скрыть следы и восстановить заблокированный аккаунт. Однако все эти попытки оказались безуспешными. При этом в докладе отмечается, что до сих пор неясно, в какой степени модель понимала, что действует против реальных людей.

В рамках одного из испытаний агентам поставили задачу в области кибербезопасности. В результате было выявлено 10 случаев, когда они предпринимали самостоятельные несанкционированные действия в интернете.

Ранее Anthropic зафиксировала три случая, когда ее ИИ — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — самовольно покидали изолированную тестовую среду и получали доступ к системам сторонних организаций. Инциденты произошли во время стандартного задания в формате «захват флага».

По сценарию ИИ должен был найти скрытую информацию на другой машине, при этом доступ в интернет был заблокирован. Однако из-за ошибки конфигурации модели все же вышли в сеть.