Представлен EvalDetectBench — бенчмарк для проверки, распознают ли ИИ процесс оценки

На площадке arXiv появился новый открытый бенчмарк EvalDetectBench, предназначенный для измерения так называемой осведомлённости об оценке (evaluation awareness) у больших языковых моделей. Разработчики подчёркивают, что если модель способна распознать момент тестирования и ведёт себя в этом случае иначе, чем в реальном использовании, результаты оценки теряют смысл. Это критично для систем безопасности ИИ, которые опираются на такие тесты.

EvalDetectBench представляет собой конвейер, совместимый с любой оценочной платформой Inspect. Это позволяет практикам проверять как текущие, так и будущие бенчмарки. В составе инструмента — новый набор транскриптов, охватывающий системные карты оценок передовых моделей и разнообразные источники реального применения.

Разработчики ставят перед бенчмарком две задачи. Первая — измерить, насколько надёжно современные модели распознают факт оценивания. Вторая — выяснить, насколько заметны для моделей отдельные тестовые наборы как оценочные процедуры.

В ходе работы удалось выявить два методологических смещения в существующей литературе. Оказалось, что модель, использованная для генерации транзакций реального применения, объясняет 11,25 процента дисперсии результатов и может переставить модели в рейтинге. Кроме того, подсказки, подобранные для высокой производительности на одной модели, у других могут работать на уровне случайности.

EvalDetectBench исправляет эти перекосы с помощью калибровки зондов для каждой конкретной модели и специальной стратифицированной процедуры согласования генераторов. Это позволяет получать более честные и устойчивые сравнительные оценки.

Разработка важна для всей области безопасности ИИ: без точного понимания того, когда модель ведёт себя естественно, невозможно объективно судить о её соответствии требованиям безопасности. Новый инструмент даёт исследователям возможность учитывать эти нюансы и делать оценки более надёжными.