Новый бенчмарк RENDER: как оформление истории влияет на память LLM сильнее, чем объём контекста
Группа исследователей опубликовала на arXiv описание нового бенчмарка RENDER, предназначенного для контроля того, как именно модель получает историю общения или извлечённые данные в системах памяти и RAG. Авторы обратили внимание, что в большинстве оценок формат входных данных считается неважным, хотя на практике одна и та же история может быть представлена как запись памяти, резюме, типизированная структура или сырой отрывок из диалога.
RENDER предлагает пять уровней «упаковки» информации: от формальных бухгалтерских записей до естественно-языковых шаблонов в стиле ChatGPT, сводок LangChain, типизированных записей MemGPT и исходного диалога. Такой подход позволяет отделить эффект от того, когда именно в вход попадает ответ на вопрос, от эффекта его визуального или структурного оформления.
Эксперименты проводились на 500 вопросах из набора LongMemEval с участием девяти моделей. При одинаковом бюджете токенов «упакованные» варианты показали результат на 42,4–72,6 пункта выше, чем усечённый сырой диалог. В шаблонах, приближенных к реальному использованию, разрыв между лучшим и худшим форматом составил от 24,6 до 48,8 пункта для каждой модели.
Особенно показательным оказался результат трёх моделей, которые на формальных записях показали 0 процентов правильных ответов, но на естественно-языковых записях ответили верно в 45,4–53,4 процента случаев. Это говорит о том, что выбор формата может быть критичнее, чем объём контекста или качество самой модели.
При использовании основной метрики записи в стиле ChatGPT оказались лучше сырого диалога у семи из девяти моделей. Повторная проверка с помощью судейской модели подтвердила общий положительный эффект, хотя значимость для отдельных моделей оказалась неоднородной.
Эффект сохранялся при добавлении шума в поисковую выдачу и переносился на другой набор данных HotpotQA. Исследователи подчёркивают, что оценки памяти и RAG должны либо контролировать формат читаемого моделью артефакта, либо явно указывать его в отчётах, иначе результаты могут вводить в заблуждение.




