J-Miner: как извлечь исполнимые правила решений из языковых моделей-классификаторов
Современные большие языковые модели после тонкой настройки превращаются в специализированные классификаторы, которые успешно решают множество задач и выносят сложные суждения. Однако такие модели обычно сообщают только итоговую метку, а скрытые знания, полученные в процессе обучения, остаются внутри модели в неявном виде. Исследователи поставили задачу извлечь эти внутренние знания и представить их в исполнимой форме, которую можно проверять, валидировать и использовать повторно.
Группа авторов представила систему J-Miner, которая выявляет текстовые именованные концепции, агрегируя внутренние сигналы, выровненные по словарю, на разных слоях и позициях токенов. Затем на основе предсказаний самого классификатора система обучает исполнимые правила решений, опирающиеся на эти концепции. Такой подход позволяет дистиллировать локальные внутренние считывания в явное знание на уровне классификатора.
Эксперименты показали, что правила J-Miner воспроизводят до 98,3% решений исходных моделей, а поведенческая точность оказывается на 6,0–29,5 процентных пункта выше, чем у столь же компактных правил, извлечённых из входных слов. Это означает, что правила, основанные на внутренних представлениях, значительно точнее отражают логику работы модели, чем простые поверхностные закономерности.
Дополнительный анализ продемонстрировал, что именованные концепции отражают внутренние семантические свидетельства, связанные с решениями задач, а изученные правила объединяют распределённые сигналы в наглядные структуры решений. Благодаря этому пользователи могут понять, какие признаки модель считает важными при классификации текстов.
Практическая ценность J-Miner подтверждается успешным переносом полученных знаний на лёгкие автономные модели-ученики. Используя примерно в 24 раза меньше параметров, чем исходные классификаторы, ученики восстанавливают и исполняют представление на основе сырого текста, сохраняя при этом 99,8% средней точности исходной модели. Это открывает возможности для развёртывания интерпретируемых и эффективных классификаторов в системах с ограниченными вычислительными ресурсами.
Результаты работы показывают, что знания о принятии решений, специфичные для конкретной задачи, могут быть достоверно представлены в явной исполнимой форме и использованы за пределами исходной модели. Это важный шаг к повышению прозрачности и контролируемости систем искусственного интеллекта, особенно в областях, где требуется объяснимость.


