Системы генерации кода на основе ИИ преобразили разработку ПО, но привносят критические уязвимости безопасности на этапе вывода (inference-time). Это исследование представляет систематический анализ контекстных состязательных атак, при которых специально сконструированный контекстный ввод - комментарии, документация, имена переменных - смещает большие языковые модели в сторону генерации эксплуатируемого кода.
В 2 800 контролируемых экспериментах на CodeT5+, CodeLlama, GPT-3.5-Turbo и GPT-4 авторы количественно оценивают эффективность атак и механизмы защиты. Результаты показывают, что состязательные условия повышают генерацию уязвимого кода в 10,7 раза (с 3,5% до 37,4%), причём атаки с прямыми инструкциями достигают 100% успеха на GPT-3.5-Turbo. Переносимость между моделями достигает 60-100%, что указывает на системные архитектурные уязвимости, а не на дефекты конкретных моделей.
Предложенный двухуровневый защитный фреймворк достигает 89,1% детекции при 0,3% ложных срабатываний и задержке 520 мс, демонстрируя практическую применимость для развёртывания в реальном времени в средах разработки.
Вывод для Veai - не доверять генерации без проверки: агент должен проверять результат через сборку, тесты, статический анализ и реальные зависимости проекта в JetBrains IDE.
Перевод подготовлен технической командой Veai на основе arXiv:2606.10945. Первоисточник (англ.): arxiv.org/abs/2606.10945.