ИИ-пайплайн слияния неопределенности не улучшил прогнозы ЕСПЧ, но повысил доверие

В сфере юридического ИИ периодически предлагают объединять разные инструменты работы с неопределенностью — графы доказательств, байесовское обновление, комбинирование Демпстера–Шейфера и конформное прогнозирование — в единый пайплайн для улучшения предсказаний по судебным делам. Новое эмпирическое исследование проверило эту идею на реальных кейсах Европейского суда по правам человека.

Авторы взяли 1000 настоящих дел из наборов LexGLUE и FairLex и предсказывали, установил ли суд нарушение Конвенции по тексту фактических обстоятельств. Сравнивались три подхода: использование большой языковой модели напрямую, та же модель, пропущенная через пайплайн слияния неопределенности, и простой частотный базовый метод, также включенный в пайплайн. Тесты проводились на двух фронтовых LLM — Claude Opus 4.8 и GPT-5.5 — всего около 4750 проверок.

Результаты показали, что при прогнозировании дискриминационных нарушений (AUROC около 0,83) пайплайн не дал улучшения ни по сравнению с прямой моделью, ни по сравнению с базовым методом. Наиболее сильным дискриминатором оказалась обычная языковая модель, использованная без дополнительных надстроек.

Наивное сочетание LLM с байесовским обновлением шансов и комбинированием Демпстера–Шейфера более чем удвоило ошибку калибровки: ECE выросла примерно с 0,16 до 0,46. Исследователи связывают это с механизмом несоответствия априорных допущений, который воспроизводился на обеих моделях. Кроме того, комбинирование по Демпстеру–Шейферу оказалось небезопасным на длинных цепочках: система уверенно выдавала неверные метки с точностью ниже случайной, поэтому авторы рекомендуют исключить этот компонент.

Практическая ценность пайплайна проявилась не в росте точности, а в операционном плане. С конформным слоем выборочного прогнозирования система решает, какие дела автоматизировать, а какие передать человеку. После удаления Демпстера–Шейфера, перекалибровки и применения контроля рисков с учетом классов на полном наборе из 1000 дел настроенный движок автоматически обрабатывал дела с точностью 96,8 процента, доля ошибок составила 0,5 процента, а 96,3 процента сомнительных случаев направлялось на проверку. Для ненастроенной базовой версии эти показатели равнялись 85,9, 3,8 и 72,1 процента соответственно.

По мнению авторов, вклад таких пайплайнов в юридическую сферу — это калиброванное доверие, а не более точное предсказание. Система полезна для определения того, какие дела можно автоматизировать безопасно, а какие требуют участия человека.