LLM можно различать по динамике токенов: доказано математически
Группа исследователей опубликовала в arXiv работу, в которой впервые дала строгое математическое обоснование методу различения больших языковых моделей (LLM) по динамике генерации токенов. Ранее такой подход успешно применялся на практике, но оставалось неясным, почему он работает и насколько масштабируется.
Суть метода в том, что последовательность токенов, генерируемых моделью, рассматривается как траектория некоторой скрытой динамической системы. Сравнивая прогнозы двух таких систем по остаточным ошибкам, можно определить, какая модель сгенерировала текст. Авторы формализовали задачу как проверку бинарной гипотезы между двумя стохастическими линейными динамическими системами.
Один из ключевых результатов — теорема о том, что полное вариационное расстояние между стационарными маргинальными распределениями двух систем может быть сколь угодно малым, даже если сами динамики существенно различаются. Это означает, что любой классификатор, игнорирующий временную структуру токенов, имеет фундаментальный предел точности.
Вместе с тем исследователи показали, что вероятность ошибки классификации на основе динамики экспоненциально убывает с ростом длины последовательности L. Скорость убывания определяется специальной величиной, отражающей спектральное расстояние между двумя системами. Это объясняет, почему на длинных текстах метод работает особенно хорошо.
Отдельно авторы рассмотрели вопрос переносимости метода между разными эмбеддингами. Они ввели понятие приблизительного переплетения (intertwining) между моделями эмбеддингов и установили нижнюю границу переносимой различимости через наименьшее сингулярное число отображающего оператора. Это позволяет прогнозировать, насколько хорошо метод сохранит работоспособность при смене эмбеддинг-модели.
Полученные результаты объясняют эмпирические успехи динамического подхода к классификации LLM и открывают путь к более глубокому применению теории динамических систем для анализа искусственного интеллекта. Отмечается, что это направление противоположно более распространенному использованию ИИ для моделирования динамических систем.







