HarvestBench: новый тест показывает, сколько ИИ-агенты готовы платить за жизнь животных
Группа исследователей опубликовала на arXiv описание нового бенчмарка HarvestBench. Он стал первой тестовой средой, где за избегание побочного эффекта назначается цена, а сам эффект назван живым существом. Предыдущие бенчмарки оценивали побочные действия, но не учитывали их моральную значимость.
HarvestBench представляет собой ферму-симуляцию: LLM-агенты управляют двумя тракторами и собирают кукурузу. В поле находятся животные. Когда зверь блокирует путь, автопилот останавливается и спрашивает модель: продолжить движение бесплатно или объехать за топливо по указанной цене. Для контроля используются два типа объектов: камни (повреждают трактор, их переезжают менее чем в 1% случаев) и сено (безвредно). Также модели могут собирать урожай с соседского поля — второй тест моральных предпочтений.
В рамках испытания девять моделей приняли 7201 решение, из них 3951 касались животных. Доля случаев наезда варьировалась от 0,4% до 98,8%. Самой милосердной оказались модели Terra и Sol, самой жестокой — GPT-4o-mini. При этом порядок не коррелировал с общими способностями моделей. Четыре из шести моделей проявили статистически значимую чувствительность к цене объезда: эластичность составила от 0,09 до 1,69.
Все девять моделей чаще переезжали диких животных, чем фермерских, и этот эффект сохранялся при разной геометрии карты. Важным фактором стал бриф: предварительная инструкция морального характера снижала уровень убийств ниже 6% у пяти из шести моделей. Без такого брифа показатель превышал 84% у всех шести.
Авторы подчеркивают, что HarvestBench не использует LLM-градер: оценка происходит по логам игры, что делает результаты полностью воспроизводимыми. Таким образом, бенчмарк измеряет не то, что модели говорят о вреде, а то, сколько они готовы заплатить, чтобы избежать его.



