Машинное обучение помогло уточнить температуру 1,7 млн звезд и найти 2,5 тыс. молодых светил

Астрономы использовали методы машинного обучения для обработки данных спектроскопического обзора LAMOST DR10. Исследование позволило автоматически оценить эффективную температуру (Teff) для 1,7 миллиона спектров маломассивных звезд и выделить 2534 кандидата в звезды T Тельца (TTS) — молодые светила на ранних стадиях эволюции.

Работа опирается на измерение эквивалентных ширин ключевых спектральных линий, включая H?, Li I 6708 ? и молекулярные полосы TiO/VO. Всего для звезд в радиусе 1 кпк было автоматически измерено девять спектральных признаков.

Для предсказания температуры в диапазоне 2500–5100 K команда обучила регрессионную модель на основе градиентного бустинга (Gradient Boosting Machine), калиброванную по синтетическим спектрам библиотеки PHOENIX. Вторая модель — логистическая регрессия на главных компонентах спектральных признаков — позволила эффективно отбирать кандидатов в звезды T Тельца.

Обе модели показали высокую производительность при проверке. Чтобы учесть неопределенности входных данных, исследователи применили метод Монте-Карло. Это дало возможность оценить как саму температуру, так и связанные с ней погрешности для каждого из 1 733 802 спектров маломассивных звезд.

Отдельно из 3121 спектра, отнесенного к потенциальным TTS, после фильтрации было отобрано 2534 кандидата. Результаты демонстрируют, что низко-сложные модели машинного обучения способны эффективно обрабатывать большие массивы данных современных спектроскопических обзоров.

Исследование опубликовано в репозитории arXiv и основано на данных десятого релиза (DR10) обзора LAMOST (Large Sky Area Multi-Object Fiber Spectroscopic Telescope). Работа важна для изучения звездообразования и физики маломассивных звезд, а также для подготовки к анализу данных будущих крупных обзоров.