LLM-Detector: новый подход к обнаружению аномалий в табличных данных без дообучения

В работе на arXiv (2608.19463) описан LLM-Detector — фреймворк, который применяет способность больших языковых моделей к обучению в контексте для поиска аномалий в табличных данных. Авторы отмечают, что стандартные методы часто плохо справляются с нарушениями взаимосвязей между признаками, тогда как предлагаемый подход синтезирует критерии оценки на основе структурированных знаний о нормальном состоянии.

Суть метода в том, что нормальные обучающие данные преобразуются в статистические сводки, причинно-следственные зависимости и прототипы. Эти данные подаются в промпт для генерации кода, который создает скоринговый движок. Он анализирует статистические отклонения, структурные противоречия и плотностные аномалии, присваивая каждому тестовому образцу оценку.

LLM-Detector проверен на 24 табличных датасетах, где сравнивался с 15 современными базовыми алгоритмами. По заявлению авторов, достигнуты устойчивые улучшения как для смешанных типов данных, так и для наборов только с непрерывными признаками.

Важная особенность метода — отсутствие необходимости тонкой настройки LLM или обучения нейронной сети. Это снижает вычислительные затраты и делает возможным практическое применение в реальных системах, работающих с табличными данными.

Результаты опубликованы в препринте и еще не прошли полноценное рецензирование, однако сама идея использования in-context learning для детекции аномалий привлекает внимание исследовательского сообщества.

Подход может быть полезен для финансового мониторинга, диагностики оборудования, выявления мошеннических операций и других задач, где важно быстро находить нестандартные записи в структурированных наборах данных.