Новый бенчмарк FindStatBench оценил способности ИИ к синтезу кода: открытые модели почти догнали закрытые

Группа исследователей опубликовала статью о новом бенчмарке FindStatBench, предназначенном для оценки больших языковых моделей (LLM) на задачах синтеза комбинаторного кода. Бенчмарк построен на основе базы FindStat и включает 2 329 задач, разделённых на 24 коллекции, с 5,52 миллионами скрытых тестовых примеров.

Задачи делятся на два типа: синтез статистик (отображение объектов в целые числа) и синтез отображений (объекты в объекты). Каждая задача содержит математическое описание и не более пяти общедоступных примеров входных-выходных данных. Модель должна написать одну функцию на Python без возможности поиска, использования инструментов, обратной связи от выполнения или повторного ранжирования. Решения оцениваются строгим выполнением в изолированной среде на тестовых объектах.

В эксперименте сравнили 11 систем: четыре закрытые коммерческие модели и семь открытых с открытым весом, работающие через одного провайдера инференса. Результаты показали несколько ключевых закономерностей. Во-первых, сильнейшие открытые и закрытые системы сошлись в точности с разницей менее одного процентного пункта. Применение «оракула» по всем системам или пятикратная выборка из одной модели среднего уровня дали лишь ограниченный прирост точности.

Во-вторых, наличие примеров не всегда полезно: несколько классических биекций были решены идеально без примеров, но с пятью примерами модель давала сбой. В-третьих, часть неудач связана с ограничениями выходного буфера — модель может исчерпать лимит токенов до того, как сгенерирует код.

Синтез статистик оказался значительно проще синтеза отображений. Некоторые коллекции остались почти нерешаемыми (точность близка к нулю). Длинные подсказки вызывают резкое падение точности, а точное индуцирование символических правил остаётся хрупким.

Таким образом, FindStatBench выявляет как прогресс LLM в синтезе кода, так и сохраняющиеся ограничения, особенно при работе с длинными описаниями и сложными отображениями. Это важный шаг для дальнейшего развития моделей и понимания их возможностей.