Учёные выяснили, что общие механизмы мышления LLM на разных языках зависят от архитектуры

Учёные выяснили, что общие механизмы мышления LLM на разных языках зависят от архитектуры

Международная группа исследователей представила на arXiv научную работу, посвящённую вопросу: используют ли многоязычные языковые модели одни и те же внутренние механизмы при решении одинаковых математических задач на разных языках, или же вычисления различаются, просто приводя к одинаковым ответам.

В исследовании использовался набор данных MGSM (Multilingual Grade School Math) с задачами на английском, немецком, французском, испанском, русском и китайском языках. Авторы отобрали задачи, для которых модель формировала корректные цепочки рассуждений во всех шести языках, и записали внутренние представления модели на разных слоях при повторном прогоне этих цепочек.

Для анализа применялись два типа разреженных автоэнкодеров: стандартная реконструкционная модель и предложенный авторами Geometry-Invariant Sparse Autoencoder (GI-SAE). Отличие GI-SAE заключается в дополнительном обучении с InfoNCE-функцией потерь, которая побуждает кодировщик создавать схожие активации для одной и той же задачи независимо от языка и позиции токена.

Учёные проверили, можно ли взаимозаменять найденные общие признаки между языками во время прямого прохода модели, измеряя изменение выходного распределения через KL-дивергенцию. Хотя GI-SAE показал более высокую геометрическую схожесть (CKA и Jaccard) почти на всех слоях, более высокая геометрическая схожесть не всегда означала большую функциональную взаимозаменяемость.

Результаты показали, что степень совместного использования кросс-языковых признаков зависит от конкретной модели и архитектуры. Усиление таких признаков наблюдалось в моделях Qwen, тогда как в Gemma функциональной выгоды не нашлось, а у Llama и Phi эффект был смешанным и зависел от слоя.

Авторы отмечают, что GI-SAE в основном усиливает уже существующую кросс-языковую структуру, а не создаёт её с нуля. Глубина, на которой появляются общие признаки, также различается между моделями. Это исследование важно для понимания интерпретируемости больших языковых моделей и объяснения их способности переносить рассуждения между языками.