Наука
Исследователи указали на разрыв между тестами и реальной работой..
Новая научная работа критикует текущие бенчмарки для оценки ИИ-агентов: высокие баллы не гарантируют успеха в реальных задачах. Авторы...
Transcoders раскрывают механизмы галлюцинаций в мультимодальных..
Новый метод интерпретации работы зрения-языковых моделей, основанный на Transcoders, позволяет точнее отслеживать, как изображения влияют...
Новый бенчмарк GENSTRAT оценивает стратегическое мышление ИИ на..
Исследователи представили GENSTRAT — генеративный бенчмарк для оценки стратегических способностей больших языковых моделей. В турнире с 36...
MARICL: ИИ-агенты находят причины ошибок моделей и улучшают..
Исследователи представили Multi-Agent Residual In-Context Learning (MARICL) — фреймворк, в котором LLM-агенты анализируют ошибки базовой...
Ученые предложили концепцию AutoResearch: ИИ берет на себя весь..
Новый обзор на arXiv описывает AutoResearch — автоматизацию научных исследований с помощью ИИ. В работе выделены пять этапов и пять...
Tensor Cache улучшает кэширование Transformer моделей, сочетая..
Исследователи предложили Tensor Cache — двухуровневую архитектуру кэширования для авторегрессионных Transformer моделей. Она сочетает...
Новый метод IDS: ИИ научился создавать формально..
Исследователи представили метод Inductive Deductive Synthesis (IDS), который позволяет ИИ-агентам генерировать код с формальными гарантиями...
EDRM: новый метод определяет, когда LLM стоит включать цепочку..
Исследователи выявили, что эффективность цепочки рассуждений (CoT) в LLM зависит от динамики энтропии на ранних этапах генерации....
Метод PathCal повышает эффективность рассуждений языковых..
Исследователи представили PathCal — новый метод, который калибрует маркеры рефлексии в цепочках рассуждений больших языковых моделей....
MedExpMem: фреймворк для накопления опыта ИИ в диагностике..
Исследователи представили MedExpMem — фреймворк, позволяющий моделям визуального языка накапливать опыт дифференциальной диагностики. В...


