qZACH-ViT: компактная модель ИИ для медицины с квантованием и встроенным объяснением
Разработчики из команды ZACH представили qZACH-ViT — расширение визуального трансформера ZACH-ViT, которое сочетает компактность квантованных моделей с внутренней (интринсик) объяснимостью. Модель использует метод Recursive Attribution-Stabilized Optimization (RASO) для согласования градиентов классификации и атрибуции, что повышает стабильность объяснений.
qZACH-ViT полностью отказывается от CLS-токена и позиционного кодирования, а вместо этого рекурсивно вычисляет доказательства на уровне патчей. Это делает его лёгким и подходящим для развёртывания на устройствах с ограниченными ресурсами. Все 210 проверенных чекпоинтов были конвертированы в смешанный INT8-формат ONNX с 16 знаковыми INT8-проекциями MatMulInteger и накоплением INT32.
Тестирование проводилось на наборе MedMNIST (50 обучающих изображений на класс, 10 фиксированных зерен) — всего 280 запусков. Модель сравнивали с FP32-базлайном. qZACH-ViT с оптимизатором Adam превзошёл базовую точность на всех семи датасетах: средний прирост составил 0,0313 по основной метрике. Применение RASO увеличило выигрыш до 0,0368.
Важный результат — сохранение точности при квантовании. При сравнении 964 920 тестовых пар исходной FP32-модели и INT8-версии совпадение предсказаний достигло 99,9751%, а среднее абсолютное изменение основной метрики составило всего 0,000133. Для 3600 пар внутренних карт объяснений среднее косинусное сходство — 0,999955, ранговая корреляция — 0,9944, а перекрытие топ-10% — 0,9692.
Размер ONNX-артефактов оказался на 70% меньше исходных чекпоинтов. При этом скорость обработки на CPU выросла в 1,41 раза (один поток) и в 2,39 раза (четыре потока). Это делает qZACH-ViT подходящим для применения в клиниках и мобильных диагностических системах.
Метод RASO значительно снижает ошибку достаточности (sufficiency error) и улучшает устойчивость к входному шуму по сравнению с тем же Adam, но не доминирует по всем метрикам объяснимого ИИ. Авторы подчёркивают, что qZACH-ViT можно считать развёртываемой компактной моделью с внутренней объяснимостью, а RASO — целевой процедурой стабилизации атрибуций.





