ИИ-конвейер Astro-Hunters улучшает поиск экзопланет по данным TESS

Поиск экзопланет всё больше превращается в задачу обработки данных: фотометрические обзоры возвращают огромное количество кривых блеска, которые невозможно проверить вручную. Машинное обучение призвано автоматически распознавать слабые периодические затмения — транзиты. Однако ключевой фактор, определяющий работу такого детектора, — как создавались обучающие метки. Именно этой проблеме посвящена новая научная работа, представленная на arXiv.

Исследователи разработали конвейер Astro-Hunters для анализа двухминутной фотометрии космического телескопа TESS. Он включает извлечение данных, удаление трендов, вычисление семи скользящих статистик для каждого кадра и классификацию на основе градиентного бустинга. Сами по себе компоненты конвейера намеренно стандартные. Главная новизна — в экспериментальном подходе к происхождению меток: в качестве источника использовались опубликованные эфемериды подтверждённых планет, а не сама фотометрия.

Для обучения и проверки авторы собрали корпус из 189 279 кадров, относящихся к двенадцати звёздам с подтверждёнными экзопланетами. Сравнение шести семейств классификаторов проводилось по протоколу, исключающему пересечение звёзд между обучающей и тестовой выборками. Результаты оказались показательными: при неизменных признаках, модели и протоколе производительность в координатах precision-recall варьировалась в 29 раз между разными источниками меток, тогда как между архитектурами — лишь в 1.8 раза.

Особый интерес представляет проверка «кругового» обучения. Когда метки генерировались изоляционным лесом, подогнанным к тем же признакам, что используются классификатором, система выдавала ложную AUC 0.9915 — на самом деле это измерение цикличности. Если эпоха транзита не была конвертирована корректно, эффективность падала до случайного уровня. При правильной аннотации из эфемерид AUC составила 0.788, что в 5.3 раза выше базового уровня распространённости.

Важный вывод работы — наблюдаемый предел точности связан не с архитектурой модели, а с качеством самих данных. Медианное отношение сигнал/шум одиночного кадра в TESS составляет всего 2.10, что ограничивает покадровую AUC значением 0.932. Это означает, что даже идеальный классификатор не сможет превзойти физический потолок, заданный фотометрической точностью.

Дополнительно авторы проверили классический метод BLS (Box Least Squares) на одном секторе данных: он восстановил восемь из двенадцати орбитальных периодов. Это показывает, что доступность транзитного сигнала обеспечивается не столько мощностью классификатора, сколько правильной фазовой свёрткой — накоплением сигнала за несколько периодов.

Работа Astro-Hunters подчёркивает, что в задачах машинного обучения для астрономии маркировка данных — не второстепенная деталь, а ключевой экспериментальный параметр. Исследование даёт практические рекомендации по валидации обучающих наборов и может повысить надёжность автоматического поиска экзопланет в будущих обзорах.