LLM тестируют на рассуждениях о производительности железа: новый бенчмарк PerfReasoning

Исследователи представили бенчмарк PerfReasoning для оценки LLM в области моделирования производительности аппаратного обеспечения. Такие задачи требуют структурированных рассуждений о вычислениях, повторном использовании данных, хранении и перемещении информации, поясняется в статье на arXiv.

PerfReasoning проверяет модели в двух режимах: как непосредственных аналитиков и как генераторов кода аналитических моделей. Моделям дают описание рабочей нагрузки, архитектуры и маппинга; нужно сравнить варианты отображения и предсказать объём трафика off-chip и требования к буферу.

По данным авторов, лучшие закрытые модели показали более 90% точности на вопросах, требующих рассуждений. Среди открытых сильнейшая модель достигла 82,4%. Создание аналитических моделей оказалось заметно сложнее: GPT-5.6 Sol превысил 80% прохождения, тогда как остальные конфигурации в среднем ниже 15% и сильно различаются между запусками.

Отдельно авторы проверили методы улучшения. Специализированное RL-дообучение увеличило точность 4B-модели на 15,7 процентного пункта в задачах на сравнение маппинга. При этом многократная саморедакция без обратной связи не дала устойчивого положительного эффекта.

Авторы отмечают, что PerfReasoning показывает разрыв между правдоподобными рассуждениями об архитектуре и надёжным построением моделей производительности. Бенчмарк обещают открыть для воспроизводимых оценок и отслеживания прогресса.