SAPO: новый метод сегментной оптимизации промптов превзошел сильные бейзлайны

SAPO: новый метод сегментной оптимизации промптов превзошел сильные бейзлайны

Авторы нового исследования, опубликованного на arXiv, предложили метод SAPO для автоматической оптимизации промптов. В отличие от классического подхода, который переписывает промпт целиком, SAPO разбивает его на отдельные сегменты: роль, контекст, задачи и формат вывода. Это позволяет улучшать нужные компоненты, не затрагивая остальные.

Метод анализирует примеры из верхней и нижней части выборки по качеству ответа. На основе top-5 и bottom-5 примеров система определяет слабые и сильные стороны текущего промпта. Далее один LLM с фиксированными мета-промптами выполняет структурированный разбор и генерирует рекомендации.

Процесс оптимизации состоит из двух этапов. На первом этапе выполняется сегментная диагностика и извлечение рекомендаций по каждому компоненту промпта. На втором этапе синтезируются новые кандидаты с учетом сигналов о слабых и сильных сегментах, что ограничивает пространство поиска.

Для проверки использовались пять датасетов: SQuADv2, TweetEval, XSUM, CommonGen и GSM8K. В качестве базовых моделей выступили GPT-3.5-Turbo и GPT-4o-mini. Сравнение проводилось с нулевым промптингом и с известными методами автоматической оптимизации: APE, OPRO, EvoPrompt, GEPA и StraGO.

По результатам экспериментов SAPO достиг наилучшего среднего балла среди всех конкурирующих подходов на обеих моделях. Авторы отмечают, что сегментный подход позволяет избежать ситуации, когда улучшение одного поведения модели ухудшает другое.

Разработка может быть полезна для практиков, работающих с большими языковыми моделями: она упрощает настройку промптов под конкретные задачи и снижает необходимость в ручном вмешательстве. В работе подробно описан протокол обучения и валидации, что облегчает воспроизведение результатов.

Исследование продолжает линию развития автоматизированных методов работы с промптами и открывает возможности для создания более гибких инструментов тонкой настройки LLM.