Ученые объяснили, почему алгоритм t-SNE часто показывает ложные кластеры

Алгоритм t-SNE широко применяется для визуализации многомерных данных, но иногда его результаты вводят в заблуждение: на графиках возникают ложные кластеры, которых нет в исходных данных. Исследователи представили на arXiv работу, которая объясняет это явление с математической точки зрения.

Авторы изучили энергетическую функцию t-SNE и обнаружили, что она обладает сложным ландшафтом с бесконечным числом критических точек. Многие из этих точек являются локальными минимумами, которые не соответствуют реальной структуре данных — они порождают нарушение топологии и искусственные группы объектов.

Ключевым механизмом оказались симметрии. Как показано в статье, если данные в исходном пространстве признаков удовлетворяют некоторому непрерывному преобразованию симметрии, а целевое вложение сохраняет дискретную симметрию, то при градиентной динамике возникают целые семейства критических конфигураций.

Результат носит общий характер: такие критические точки существуют не только в исходном алгоритме t-SNE, но и в его недавно выделенных пределах больших данных. Это объясняет, почему артефакты в виде ложных кластеров наблюдаются на практике столь часто.

По мнению авторов, их работа — первый шаг к строгому пониманию того, что именно алгоритм t-SNE способен отражать, а какие структуры на графиках являются лишь следствием математических особенностей метода. Дальнейшие исследования в этом направлении могут помочь в разработке более надёжных алгоритмов визуализации.