Учёные выяснили, что общие механизмы мышления LLM на разных языках зависят от архитектуры
Международная группа исследователей представила на arXiv научную работу, посвящённую вопросу: используют ли многоязычные языковые модели одни и те же внутренние механизмы при решении одинаковых математических задач на разных языках, или же вычисления различаются, просто приводя к одинаковым ответам.
В исследовании использовался набор данных MGSM (Multilingual Grade School Math) с задачами на английском, немецком, французском, испанском, русском и китайском языках. Авторы отобрали задачи, для которых модель формировала корректные цепочки рассуждений во всех шести языках, и записали внутренние представления модели на разных слоях при повторном прогоне этих цепочек.
Для анализа применялись два типа разреженных автоэнкодеров: стандартная реконструкционная модель и предложенный авторами Geometry-Invariant Sparse Autoencoder (GI-SAE). Отличие GI-SAE заключается в дополнительном обучении с InfoNCE-функцией потерь, которая побуждает кодировщик создавать схожие активации для одной и той же задачи независимо от языка и позиции токена.
Учёные проверили, можно ли взаимозаменять найденные общие признаки между языками во время прямого прохода модели, измеряя изменение выходного распределения через KL-дивергенцию. Хотя GI-SAE показал более высокую геометрическую схожесть (CKA и Jaccard) почти на всех слоях, более высокая геометрическая схожесть не всегда означала большую функциональную взаимозаменяемость.
Результаты показали, что степень совместного использования кросс-языковых признаков зависит от конкретной модели и архитектуры. Усиление таких признаков наблюдалось в моделях Qwen, тогда как в Gemma функциональной выгоды не нашлось, а у Llama и Phi эффект был смешанным и зависел от слоя.
Авторы отмечают, что GI-SAE в основном усиливает уже существующую кросс-языковую структуру, а не создаёт её с нуля. Глубина, на которой появляются общие признаки, также различается между моделями. Это исследование важно для понимания интерпретируемости больших языковых моделей и объяснения их способности переносить рассуждения между языками.



