ИИ-код почти всегда работает, но безопасным оказывается лишь в 56% случаев

ИИ-код почти всегда работает, но безопасным оказывается лишь в 56% случаев

Компания Veracode выпустила отчёт GenAI Code Security Report 2026. Специалисты проверили более 100 моделей ИИ и обнаружили серьёзный разрыв между работоспособностью кода и его безопасностью.

Синтаксические тесты модели проходили почти в 100% случаев, однако защиту от уязвимостей демонстрировали в среднем лишь в 56% заданий. Иными словами, код может корректно выполняться, но при этом содержать небезопасную реализацию.

В Veracode отмечают, что результаты нельзя трактовать как долю уязвимого кода в реальных проектах. Тесты проводились на стандартизированных задачах без специальных указаний по безопасности, а также без учёта дополнительных мер вроде статического анализа и проверки человеком.

Специализированные модели для программирования не показали ожидаемого преимущества: их средний результат составил 51% против 52% у универсальных моделей. Размер также почти не влияет на безопасность: крупные модели набрали в среднем 53%, средние и малые — 51%.

Заметно лучше выступили модели с режимом рассуждений — 56% против 51% у остальных. В рейтинге Veracode GPT-5.5 показала 68%, тогда как большинство из 11 представленных моделей получили от 50% до 53%.

Сильно различаются результаты по языкам программирования. Python показал лучший средний результат — 63%, а Java оказался последним с 30%, хотя его показатель постепенно улучшается.

Эксперты рекомендуют относиться к ИИ-сгенерированному коду как к непроверенному и пропускать его через проверки безопасности до объединения с основной кодовой базой. Скорость генерации рабочего кода не заменяет контроль, который способен выявить уязвимости.