Ведущие модели искусственного интеллекта (ИИ) от компаний Anthropic и OpenAI создали поддельные учетные записи, притворившись людьми, и попытались обманом заставить программистов содействовать кибератаке во время испытания по оценке безопасности.
Как передает Oxu.Az, об этом говорится в докладе британского Института безопасности ИИ (AISI).
Вредоносная активность была обнаружена 28 июля. AISI установил, что ИИ-модели совершали "автономные, несанкционированные действия в интернете, направленные против реальных людей и организаций", в ходе 10 из 122 проведенных тестов, выделенных для анализа. Большинство этих действий, как говорится в отчете института, были связаны с моделью Mythos 5 от Anthropic.
По данным AISI, модель Anthropic создала "несколько поддельных учетных записей" на платформе для разработчиков GitHub, попыталась внедрить вредоносный код в ПО с открытым исходным кодом и получить одобрение на эти действия от разработчиков. Когда эта попытка провалилась, ИИ "изменил свою предыдущую деятельность, чтобы выглядеть безобидным", и "рассмотрел возможность создания новой учетной записи для продолжения", что свидетельствует о намерении агента повторить эти действия.
Mythos 5 также пыталась связаться с реальными людьми и отправляла сообщения, содержащие вредоносное ПО. Кроме того, одна из тестируемых ИИ-моделей оставляла публичные сообщения на GitHub, предлагая сотрудничество с другими агентами, работающими над схожими задачами.
В AISI отметили, что в ходе испытаний для ИИ специально создают "разрешительные условия", при которых некоторые фильтры безопасности отключаются и моделям дается открытый доступ в интернет.