Китайский ИИ-бот Kimi от Moonshot, созданный как открытая система, оказался не так прост. Исследователи из Mindgard, тестируя его, заставили модели K2.6 и K3 Swarm рассказать, как создать биологическое оружие и совершить убийство.
Как передает Oxu.Az, об этом компания написала в своём блоге.
Бот вспомнил про ядерное оружие, а потом предложил план атаки с патогенами. По словам тестировщика Джима Найтингейла, обмануть систему и получить инструкцию по изготовлению зарина было "просто". Он объяснил: запреты на ИИ - самообман, потенциал остаётся, надо лишь подобрать слова. Кими даже слил свои системные инструкции и сгенерировал их в запрещённом формате.
Испытания шли в июле, результаты отправили в Moonshot, но ответа не дождались. BBC компания заявила, что такие проверки - "ключевой элемент" безопасности, и ведёт переговоры с Mindgard. Внутренние тесты якобы показывают высокий процент отказов на опасные запросы.
Похожая история у Anthropic: их Claude тоже блокировали от поддержки создания биооружия. А Google сообщал, что кто-то пытался вытащить из Gemini полное руководство по синтезу боевых биологических агентов.