Шардинг в LLM-судьях снижает ошибки и защищает от манипуляций
Исследователи представили на arXiv препринт, посвященный надежности моделей искусственного интеллекта, используемых в роли судей. Согласно работе, увеличение вычислительных ресурсов не гарантирует, что LLM-судья проверит больше требований. Если в одном запросе модели необходимо вынести сразу множество решений, часть из них оказывается слабо обоснованной, даже при том же бюджете токенов или инструментов, который получила бы группа отдельных запросов.
Авторы проанализировали несколько сценариев: экспертную оценку научных репликаций, юридическую работу и оценку клинических испытаний. Во всех случаях согласованность с экспертами падала по мере роста числа решений на один вызов.
В качестве решения предлагается шардинг — разбиение требований на небольшие группы. Каждая группа отправляется в отдельный вызов модели, после чего вердикты собираются вместе. При фиксированных модели, материалах и общем бюджете шардинг повышает согласованность с экспертами.
Кроме того, слабая разделенная модель может превзойти более мощную целостную модель, даже если последняя получает полный бюджет, предназначенный для всей группы судей. Это важное наблюдение для практики делегирования проверок ИИ.
Отдельно рассматривается устойчивость к атакам. Злоумышленник по схеме best-of-N может, сохраняя содержание работы, менять только её оформление и добиваться многократного увеличения числа принятых невыполненных требований. Шардинг снижает базовую ошибку и убирает это преимущество атакующего.
Однако шардинг не помогает, если атакующий убеждает модель по каждому критерию отдельно, а не перегружает её. В таком случае, по данным исследования, помогает оппозиция в стиле дебатов поверх шардинга: она выдерживает адаптивную перенастройку атаки.
Практическая ценность работы — в возможности инженерно повысить качество ИИ-контроля без роста вычислительных затрат. Применение шардинга может быть полезно при аудите юридических документов, оценке научных результатов и клинических данных.







