RAG улучшил точность LLM в задачах оптимизации: с 40% до 72% на тестах
Моделирование оптимизационных задач — сложная область, требующая глубоких знаний формальных языков и методов. Крупные языковые модели (LLM) часто дают структурно некорректные или неполные формулировки, особенно в комбинаторных постановках. Однако новое исследование, опубликованное на arXiv, показывает, что retrieval-augmented generation (RAG) способна существенно повысить качество таких моделей.
Авторы создали пайплайн на основе RAG, используя синтетический набор из 500 задач оптимизации, сгенерированных из описаний Text2Zinc и профессиональных ролей. Каждая задача была описана в JSON и связана с проверенным Python-скриптом для решения. Эти данные загрузили в векторную базу Chroma, а для каждого нового запроса система находила семантически близкие примеры и подавала их как контекст в LangChain-агент.
В экспериментах использовалась модель Qwen 3 30B Instruct. Результаты впечатляют: точность на бенчмарке NL4OPT поднялась с 40% до 72%, на MAMO Easy — с 40% до 56%, на MAMO Complex — с 32% до 56%. Улучшения коснулись не только общей точности, но и структурной корректности решений.
Ключевой вывод работы — синтетический корпус, созданный с валидацией, в сочетании с retrieval augmentation даёт практичный способ разворачивания LLM-инструментов для поддержки принятия решений. Это особенно важно в логистике, здравоохранении и управлении цепочками поставок, где точное моделирование критично.
По мнению авторов, такой подход может стать эффективной альтернативой тонкой настройке. Он не требует дорогих вычислительных ресурсов и позволяет быстро адаптировать модель под новые домены, просто пополняя базу проверенных примеров. Работа открывает путь к более широкому применению ИИ в прикладных задачах оптимизации.
Исследование подчёркивает значимость интеграции внешних знаний в LLM, что снижает галлюцинации и повышает надёжность выходных данных. Возможно, в будущем такие гибридные системы станут стандартом для инженерного моделирования.


