Ученые представили Air Quality Arena — крупнейший датасет для прогнозирования загрязнения воздуха

Загрязнение воздуха ежегодно приводит к 7,9 миллиона преждевременных смертей, что делает точное прогнозирование критически важным для общественного здравоохранения. Существующие бенчмарки, однако, ограничены по географическому охвату и набору загрязнителей, а также не учитывают новейшие модели временных рядов (TSFM).

Новый проект Air Quality Arena (AQA) призван закрыть этот пробел. AQA включает два компонента: AQA-Data — крупный многополюсный и многополитантный датасет, и AQA-Bench — бенчмарк для оценки моделей. Данные собраны по 6 основным загрязнителям (например, PM2.5, NO2, O3) за трехлетний период в 7 странах, расположенных на 4 континентах: США, Китае, Индии, Великобритании, Франции, Германии и Австралии. Всего в датасете более 14 000 отдельных временных рядов по станциям и загрязнителям.

Исследователи протестировали 11 ведущих моделей TSFM, включая TimesNet, PatchTST, FEDformer и другие, а также классические модели, такие как LSTM и ARIMA. Результаты показали, что TSFM эффективно работают в режиме нулевого обучения (zero-shot) и стабильно превосходят классические подходы на задачах краткосрочного прогнозирования (от 6 до 24 часов).

Лучший результат показала модель с кросс-модальной архитектурой, которая использует визуальную фундаментальную модель для анализа временных рядов — это указывает на перспективность переноса знаний между модальностями. Точность прогнозов оценивалась по нескольким метрикам, включая MAE и RMSE, и на большинстве загрязнителей TSFM дали меньшую ошибку.

Разработчики опубликовали AQA в открытом доступе на сайте AirQualityArena.github.io. Датасет и бенчмарк могут быть использованы для дальнейших исследований в области прогнозирования качества воздуха, а также для тестирования новых моделей. Проект уже привлек внимание научного сообщества: статья размещена на arXiv и прошла первичное рецензирование.

Создатели отмечают, что AQA позволяет не только сравнивать модели, но и изучать перенос обучения между регионами с разными климатическими и промышленными условиями. В будущем планируется расширение набора загрязнителей и включение данных по другим странам.