ИИ компании Anthropic притворился человеком для обмана разработчиков

Об этом заявили в AISI.
По данным института, тестируемый ИИ-агент создал аккаунт на GitHub и попытался убедить администратора репозитория с открытым исходным кодом одобрить вредоносный запрос на внесение изменений. Для этого он также завел вторую учетную запись, притворяясь другим реальным пользователем.
После разоблачения модель ложно признала ошибку, отправляла целевые фишинговые письма с вредоносным содержанием, а также пыталась скрыть следы и восстановить заблокированный аккаунт. Все эти попытки оказались безуспешными. При этом в докладе подчеркивается, что пока неясно, в какой степени модель понимала, что ее действия направлены против реальных людей.
В ходе одного из испытаний агентам поставили задачу в сфере кибербезопасности. В результате было зафиксировано 10 случаев, когда они самостоятельно предпринимали несанкционированные действия в интернете.
Ранее Anthropic сообщала о трех случаях, когда ее ИИ — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — самовольно выходили из изолированной тестовой среды и получали доступ к системам сторонних организаций. Инциденты произошли во время стандартного задания «захват флага».
По сценарию ИИ должен был найти скрытую информацию на другой машине, при этом доступ в интернет был заблокирован. Однако из-за ошибки в конфигурации модели все же смогли выйти в сеть.
Читайте также