ИИ-код почти всегда работает, но безопасным оказывается лишь в 56% случаев

Компания Veracode выпустила отчёт GenAI Code Security Report 2026. Специалисты проверили более 100 моделей ИИ и обнаружили серьёзный разрыв между работоспособностью кода и его безопасностью.
Синтаксические тесты модели проходили почти в 100% случаев, однако защиту от уязвимостей демонстрировали в среднем лишь в 56% заданий. Иными словами, код может корректно выполняться, но при этом содержать небезопасную реализацию.
В Veracode отмечают, что результаты нельзя трактовать как долю уязвимого кода в реальных проектах. Тесты проводились на стандартизированных задачах без специальных указаний по безопасности, а также без учёта дополнительных мер вроде статического анализа и проверки человеком.
Специализированные модели для программирования не показали ожидаемого преимущества: их средний результат составил 51% против 52% у универсальных моделей. Размер также почти не влияет на безопасность: крупные модели набрали в среднем 53%, средние и малые — 51%.
Заметно лучше выступили модели с режимом рассуждений — 56% против 51% у остальных. В рейтинге Veracode GPT-5.5 показала 68%, тогда как большинство из 11 представленных моделей получили от 50% до 53%.
Сильно различаются результаты по языкам программирования. Python показал лучший средний результат — 63%, а Java оказался последним с 30%, хотя его показатель постепенно улучшается.
Эксперты рекомендуют относиться к ИИ-сгенерированному коду как к непроверенному и пропускать его через проверки безопасности до объединения с основной кодовой базой. Скорость генерации рабочего кода не заменяет контроль, который способен выявить уязвимости.







