Новый бенчмарк GPS-Bench проверяет ИИ-симуляции политических решений
Группа исследователей опубликовала на arXiv препринт, в котором представила GPS-Bench (Governance Policy Simulation Benchmark) — новый инструмент для автоматизации анализа государственной политики с помощью больших языковых моделей. В центре внимания — проверка того, насколько ИИ-симуляции соответствуют тому, что реально происходит в политике после принятия решений.
Проблема, которую решает GPS-Bench, — это недостаток валидации. Существующие LLM-симуляции часто строят гипотетические сценарии, но не сравнивают их с фактическими наблюдениями. Авторы предлагают связать политические меры с конкретными затронутыми сторонами, их действиями и последствиями, используя открытые данные: законодательные акты, лоббистские декларации, нормативные документы, корпоративную отчётность и экономическую статистику.
Ключевое отличие GPS-Bench в том, как формируются акторы. Они не задаются как усреднённые стереотипы, а реконструируются из датированных записей — каждая сущность становится «объектом с происхождением», то есть её характеристики опираются на конкретные документы. Это, по мнению авторов, повышает достоверность симуляций.
Для оценки качества в бенчмарке предусмотрено два уровня разметки: человек размечает небольшой «золотой» набор примеров, а отдельная языковая модель обрабатывает более крупный массив на основе найденных доказательств, но такие автоматические метки никогда не используются как тестовые — только как вспомогательный контроль.
Авторы провели серию экспериментов, сравнив разные режимы вывода: совместное рассуждение, независимых агентов, агентов с возможностью коммуникации, графовые методы и тонкую настройку весов на одном и том же состоянии политики. Выяснилось, что тонкая настройка на основе документальных свидетельств даёт наиболее точные прогнозы влияния на уровне отдельных акторов. При этом декомпозиция задачи на части не превосходит этот результат, но зато добавляет объяснимость: видно, почему модель пришла к такому выводу.
Отдельно авторы подчёркивают, что в их сценарии агенты получают частные, неодинаковые наборы документов и могут общаться друг с другом, обсуждая совместные предложения: что они предлагают, что хотят взамен и почему кооперация выгоднее одиночных действий. Это позволяет сверять сформировавшиеся коалиции с реально зафиксированными договорённостями.
GPS-Bench предлагает общую эмпирическую основу для исследований в области ИИ и политики, позволяя выяснить, когда данные, моделирование акторов и многоагентное взаимодействие действительно улучшают прогнозы политических исходов. Работа может быть полезна как для разработчиков алгоритмов, так и для аналитиков, изучающих процессы принятия государственных решений.



