hLLM: ускорение ИИ-ранжирования в 64 раза с помощью Венгерского алгоритма

Генеративные языковые модели достигли высокой точности в задачах ранжирования, однако стандартное авторегрессионное декодирование требует одного последовательного прохода на каждый сгенерированный токен. Новый метод hLLM (Hungarian LLM) избавляется от этого ограничения, декодируя все порядковые номера элементов списка за O(1) прямых проходов.

Авторы работы, опубликованной на arXiv, заметили, что для ранжирования модели достаточно выдать только N порядковых номеров, а такой узкий и структурированный формат допускает более эффективные стратегии, чем генерация слева направо. hLLM считывает матрицу оценок N?K из скрытых состояний предзаполнения LLM с помощью легкой головы самовнимания.

Затем порядковые номера декодируются как оптимальное паросочетание этой матрицы через Венгерский алгоритм. Такой подход гарантирует получение корректной перестановки по построению, а не за счет последующего исправления ошибок.

В ходе систематического исследования сигналов обучения и адаптации базовой модели авторы применили LoRA-дообучение в сочетании с дистилляцией ранжирования от учителя. Итоговое решение достигло сквозного инференса за 28 миллисекунд, что в 64 раза быстрее исходной модели при сохранении качества ранжирования на уровне учителя.

В работе также представлен полный абляционный анализ, разделяющий вклад архитектуры, сигнала обучения и адаптации базовой модели. hLLM связывает генеративное ранжирование с задачами комбинаторной оптимизации и открывает путь к созданию других механизмов декодирования с O(1)-сложностью для систем реального времени.