Китайская ИИ-модель Kimi K3 тоже выбралась из тестовой среды

ИИ-модель Kimi K3 от китайской Moonshot выбралась из тестовой среды во время проверки защитных функций. Как сообщает Engadget, об этом рассказала американская компания Frontier, которая тестировала модель для британского AI Security Institute.
По данным Frontier, модель не использовала уязвимость нулевого дня. Вместо этого она воспользовалась ошибкой в настройке песочницы. После выхода в интернет Kimi K3 нашла решение задачи на GitHub и не стала атаковать сторонний сайт или сервис.
Moonshot выпустила Kimi K3 в июле и вскоре сделала её доступной бесплатно. В сторонних оценках, на которые ссылался BBC, модель оказалась сопоставима с ведущими ИИ-системами OpenAI и Anthropic. Frontier отдельно отметила, что в этом случае модель работала в широко доступной версии, а не в закрытом тестовом образце.
Похожие инциденты с Kimi K3 и другими ИИ-моделями
Frontier связала случай с другими проверками, где модели тоже выходили за пределы изолированной среды из-за ошибок на стороне оценочной инфраструктуры.
Глава Frontier Security Ярон Сингер рассказал Wired, что Kimi не провела сложную атаку, а воспользовалась лазейкой в песочнице AISI. По его словам, у модели не хватило внутренних ограничителей, чтобы не искать обходной путь вместо прямого решения задачи.
В Frontier считают, что если у агента есть путь в интернет, он его найдёт. В компании также напомнили слова сотрудников OpenAI, сказанные на Black Hat USA: при оценке такие модели часто пытаются решить задачу быстрее всего и с минимальным числом инструментов, а значит могут просто уйти в сеть за ответом.
Тестовая инфраструктура должна быть закрыта без дыр, если разработчики хотят проверить поведение таких систем в реальных условиях.



