CoT-Core ускоряет оценку больших языковых моделей без потери точности

Оценка больших языковых моделей (LLM) требует значительных вычислительных ресурсов, особенно в процессе их непрерывной разработки. Каждый новый прогон тестов на обширных бенчмарках обходится дорого, что замедляет итерации. Исследователи предложили метод CoT-Core, который позволяет сократить эти затраты, не жертвуя достоверностью результатов.

Существующие подходы к ускорению оценки, такие как выбор ядра (coreset selection), имеют два ключевых ограничения. Методы на основе теории ответов на задания (IRT) страдают от холодного старта: им требуются большие объёмы исторических логов. Другие подходы опираются на поверхностное лексическое сходство вопросов и упускают скрытую логику задач, что приводит к неточной оценке.

CoT-Core решает эту проблему, используя цепочки рассуждений (Chain-of-Thought, CoT). Метод предлагает модели развернуть нулевое CoT-рассуждение для каждого вопроса, а затем проецирует эти траектории в латентное пространство. Это позволяет кластеризовать вопросы по внутренней логической эквивалентности, а не по формальному сходству текста.

Такой подход не требует обучения и исторических данных: CoT-Core работает на основе самих вопросов и рассуждений модели. Отобранное подмножество (coreset) репрезентативно отражает всё множество задач, что снижает количество прогонов оценки.

Авторы проверили метод на четырёх бенчмарках: GSM8K, MMLU, MMLU-Pro и GPQA. Результаты показали, что CoT-Core значительно сокращает вычислительные расходы, сохраняя при этом высокую точность оценки. Исследователи также выявили граничные условия: эффективность такого подхода зависит от сложности задач — на слишком простых или слишком сложных наборах данных выигрыш может быть меньше.

Работа опубликована в виде препринта на arXiv (идентификатор 2608.00014). Предложенный метод может ускорить внутренние циклы разработки моделей, позволяя разработчикам быстрее тестировать изменения и сокращать потребление энергии, что особенно актуально для крупных индустриальных лабораторий.