BrainBench: новый бенчмарк для оценки ИИ в анализе ЭЭГ
Группа исследователей представила на arXiv новый бенчмарк BrainBench, который позволяет всесторонне оценивать большие языковые модели (LLM) в работе с электроэнцефалограммами (ЭЭГ). Как подчеркивают авторы, анализ ЭЭГ не сводится к простому присвоению меток — он требует выполнения целых цепочек действий: от интерпретации инструкций на естественном языке до обработки сигналов, количественных оценок и научной интерпретации.
BrainBench объединяет четыре подмножества: базовый анализ (Foundational Analysis), оценку сна (Sleep Assessment), нейрокогнитивную оценку (Neurocognitive Assessment) и физиологическую интеграцию (Physiological Integration). В общей сложности в бенчмарке используются 17 различных датасетов, а общее число реальных примеров превышает несколько десятков тысяч (точные цифры авторы обещают раскрыть в финальной версии).
Особенность BrainBench — в условиях задач, которые требуют от системы не просто определить класс сигнала, а сформировать научно обоснованный отчет, следуя заданной инструкции. При необходимости допускается добавление физиологических сигналов. Оценка результатов ведется по шести направлениям: числовая, категориальная, множественная, последовательная, семантическая и артефактная валидация.
Авторы протестировали несколько репрезентативных LLM, выполнив более 100 тысяч запусков. Сравнение проводилось в двух парадигмах: автономное выполнение кода с помощью CodeAct и структурированный агентный анализ с помощью BrainAgent. Результаты показали значительный разброс в зависимости от модели, подмножества, сложности задачи и способа организации работы.
По словам исследователей, это подтверждает, что успешность LLM в анализе ЭЭГ зависит как от самой модели, так и от ее операциональной настройки. BrainBench задуман как воспроизводимый тестовый стенд для развития ИИ-подходов в нейронауке. Код и сам бенчмарк будут опубликованы позже, а результаты оценок авторы обещают постоянно обновлять.





