ИИ-код почти всегда проходит тесты, но безопасным оказывается лишь в 56% случаев

Veracode проверила более 100 моделей ИИ для генерации кода и увидела разницу между синтаксисом и безопасностью. Успешными по безопасности оказались 56% результатов, то есть примерно в 44% случаев сгенерированный код не прошёл проверку. Синтаксических ошибок в тестах не встретилось.
Отчёт GenAI Code Security Report 2026 охватывает четыре тестовых среза. Veracode использовала стандартизированные задания по генерации кода на разных языках и для разных категорий уязвимостей, а запросы не содержали специальных указаний по безопасности.
Компания отдельно подчёркивает, что этот результат нельзя считать оценкой доли уязвимого кода в реальных проектах. В тесте не учитывались дополнительные меры защиты, включая статический анализ, политики, защитные ограничения и проверку человеком.
Разница между моделями оказалась небольшой. Специализированные системы для программирования показали в среднем 51% против 52% у универсальных моделей, а более крупные модели набрали 53% против 51% у средних и малых. Лучше остальных выглядели модели с режимом рассуждений: 56% против 51% у остальных.
Внутри рейтинга Veracode лидером стала GPT-5.5 с результатом 68%. У 6 из 11 представленных моделей показатель оказался в диапазоне от 50% до 53%. По языкам программирования разброс тоже был заметным: Python показал 63%, а Java замкнул список с 30%.



