Ансамбли глубокой кластеризации обходят классификацию при дисбалансе табличных данных
Авторы нового препринта на arXiv предложили два ансамблевых подхода к глубокой кластеризации для табличных данных. Они нацелены на ситуацию, когда один из классов сильно преобладает, и классическое обучение с учителем начинает ошибаться в пользу большинства.
В классификации с учителем дисбаланс классов ведет к ложным негативным ответам и завышенной оценке точности. Модель часто игнорирует редкие объекты. Глубокая кластеризация, напротив, не использует метки классов на этапе обучения представлений, поэтому, по мнению авторов, может быть менее подвержена смещению.
Методы глубокой кластеризации уже применяли для изображений, текстов и графов, в то время как для табличных данных такие подходы начали использовать недавно. Работа относится к числу первых, где их качество проверяют при разной степени несбалансированности.
Исследователи описали два способа объединения моделей. Первый собирает результаты кластеризации по разным размерностям эмбеддингов. Второй использует простое большинство голосов среди лучших алгоритмов. Эксперименты провели на 16 бинарных табличных наборах данных с искусственно созданным дисбалансом.
По метрикам ACC, NMI и ARI ансамблевые методы в среднем превзошли отдельные алгоритмы кластеризации. Они также показали большую устойчивость к дисбалансу при поиске истинных классов без учителя.
Авторы делают вывод, что в несбалансированном сценарии глубокая кластеризация способна стать сильной альтернативой классификации с учителем. Работа размещена в архиве препринтов arXiv под номером 2608.00346.







