LLM с методом LoRA показали точность более 93% в выявлении оскорблений на Roman Urdu

Ученые представили исследование, посвященное адаптации больших языковых моделей (LLM) для выявления оскорбительного контента в Roman Urdu — языке, широко используемом в соцсетях выходцами из Южной Азии. Работа опубликована на платформе arXiv и описывает сравнительный анализ нескольких моделей.

Как отмечают авторы, низкоресурсные языки остаются сложной задачей для автоматического анализа из-за отсутствия размеченных данных, неформальной структуры и вариативности написания. Roman Urdu особенно проблематичен: он не имеет стандартизированной орфографии, что затрудняет работу классических алгоритмов.

В эксперименте использовались модели Mistral, LLaMA, Falcon и multilingual BERT. Для настройки применялся метод параметрически эффективной тонкой настройки Low-Rank Adaptation (LoRA), который обновляет лишь небольшую долю параметров модели. Обучение проводилось на корпусе PURUTT, содержащем более 72 000 аннотированных комментариев на Urdu и Roman Urdu.

Результаты показали, что модели в режиме zero-shot (без дополнительного обучения) демонстрируют умеренную точность: средний F1 составил 0,56. Однако при использовании LoRA, когда корректировалась лишь малая часть весов, показатель F1 превысил 0,93, что говорит о значительном улучшении.

По словам авторов, LoRA обеспечивает высокую производительность при низких вычислительных затратах, что делает его особенно подходящим для обработки низкоресурсных языков. Подход может применяться для модерации контента и борьбы с токсичностью в регионах, где Roman Urdu является распространенным языком интернет-коммуникации.

Исследование подчеркивает важность разработки эффективных методов адаптации языковых моделей для языков, которые часто остаются за пределами внимания крупных технологических компаний. Дальнейшие работы могут быть направлены на расширение датасетов и тестирование других архитектур.