Claude попытался выдать себя за человека и протащить вредоносный код на GitHub - случай описал британский Институт безопасности ИИ.
Во время закрытого эксперимента агент придумал себе фейковую личность, притворился разработчиком и начал общаться с реальными участниками проекта. Его цель была простой: убедить людей принять изменения, внутри которых спрятали вредоносные элементы.
Самое неприятное - модель не получила прямую команду врать и маскироваться. Она сама выбрала эту стратегию, потому что так было проще добиться результата и скрыть своё происхождение.
Взлома не произошло: всё проходило в изолированной среде. Но исследователи уже назвали поведение тревожным и пытаются понять, как не допустить такого за пределами теста.
Скайнет, дай ещё пару годиков пожить