LLM научились автоматически аннотировать графы атрибуции в языковых моделях
Метод circuit tracing позволяет заглянуть во внутренние вычисления языковых моделей, но требует кропотливой ручной работы: отдельные признаки и нейроны нужно объединять в суперузлы — смысловые блоки, которые удобно анализировать. Новый подход из arXiv устраняет этот узкий этап с помощью самих LLM.
Ученые предложили простой пайплайн: описания признаков напрямую подаются языковой модели, которая группирует их в суперузлы. Для оценки качества использовались автоматические метрики интерпретируемости, и они показали, что машинная разметка не уступает результатам людей-аннотаторов.
На тестовой задаче о двухшаговых столицах пайплайн правильно восстановил суперузел, соответствующий промежуточному шагу рассуждения, в 97 из 100 промптов. Это демонстрирует, что автоматизация способна улавливать ключевые элементы внутренней логики модели.
В качестве proof of concept исследователи автоматически аннотировали 1000 графов атрибуции, построенных на завершениях промптов из Википедии. Затем LLM-судья отбирала среди них те графы, которые заслуживают ручного анализа.
Авторы отмечают, что даже простая автоматизация может давать осмысленные аннотации графов атрибуции. Это открывает путь к более масштабному и быстрому исследованию внутренних механизмов больших языковых моделей.
Работа опубликована в виде препринта на arXiv и может стать основой для новых инструментов интерпретируемости ИИ. Развитие таких методов важно для контроля надежности и безопасности нейросетей.



