CC-GMNet-TS: новый метод оценки классов в несбалансированных временных рядах

CC-GMNet-TS: новый метод оценки классов в несбалансированных временных рядах

В задачах мониторинга биосигналов, распознавания активности и обнаружения падений часто важнее не классифицировать каждый момент времени, а оценить, какая доля данных относится к каждому классу. Это направление называется quantification, и оно особенно сложно, когда данные несбалансированы — редкие события, например падения или жесты, составляют малую часть выборки.

Группа исследователей разработала модель CC-GMNet-TS (Class-Conditioned Gaussian Mixture Network for Time Series). Новый подход использует Transformer-архитектуру для извлечения признаков из временных рядов, а затем для каждого класса строит отдельную компактную гауссову смесь в ограниченном латентном пространстве. Это отличается от предыдущих методов, где одна смесь была общей для всех классов.

Ключевая идея — сопоставлять эмбеддинги сегментов с класс-специфичными компонентами, что позволяет создавать представления на уровне пакетов (bag-level), акцентируя внимание на редких, но информативных паттернах. Такое построение помогает модели лучше улавливать дисбаланс и точнее оценивать пропорции классов.

Для обучения авторы использовали два протокола создания пакетов: Artificial Prevalence Protocol (APP) и prior shift bag sampling (PShift). Это позволило покрыть широкий спектр сценариев изменения классовых пропорций. Модель обучается сквозно (end-to-end) с использованием функции потерь, ориентированной на задачу quantification.

Эксперименты проводились на трех открытых наборах данных: EMG Data for Gestures (электромиография для жестов), SmartFallMM (данные о падениях) и UCI-HAR (распознавание активности). На всех трех бенчмарках CC-GMNet-TS показала более низкую ошибку по сравнению с традиционными агрегаторами, такими как простые классификаторы с последующим усреднением, и современными глубокими моделями quantification.

Абляционные исследования подтвердили вклад обеих ключевых компонент: и Transformer-основы, и класс-условных смесей. Удаление любой из них приводило к росту ошибки, особенно при использовании протокола PShift, который имитирует реальные сдвиги в распределении классов.

Разработка может найти применение в системах мониторинга здоровья, умных домах и носимых устройствах, где требуется надежная оценка редких событий по непрерывным потокам данных. Исследование представлено в виде препринта на arXiv.