Наука

AI-воркфлоу на основе foundation model ускоряет проектирование пешеходной безопасности в авто

AI-воркфлоу на основе foundation model ускоряет проектирование..

Исследователи представили первый workflow, использующий foundation model для оптимизации краш-тестов. Система сокращает оценку травм...


Новая инфраструктура DeepInsight объединяет оценку Physical AI на всех уровнях

Новая инфраструктура DeepInsight объединяет оценку Physical AI..

Исследователи представили DeepInsight — единую инфраструктуру для оценки Physical AI, охватывающую все уровни стека: от декодирования...


Математики определили фундаментальные ограничения методов отбраковки выбросов в обучении

Математики определили фундаментальные ограничения методов..

Исследователи установили, что максимальный объем зашумления, который может скрыться от сертификата отбраковки выбросов ограниченной...


SEAGym: среда для оценки самоэволюционирующих LLM-агентов

SEAGym: среда для оценки самоэволюционирующих LLM-агентов..

Исследователи представили SEAGym — платформу для тестирования обновлений обвязки LLM-агентов. Она выявляет, приводит ли изменение к...


PowerOPD: стабилизация дистилляции LLM с приростом точности до 6% и ускорением на 59%

PowerOPD: стабилизация дистилляции LLM с приростом точности до..

Исследователи предложили PowerOPD — семейство ограниченных наград на основе преобразования Бокса-Кокса, решающее проблему нестабильности в...


ИИ-пайплайн LLM-as-Judge для проверки экзаменов приблизился к точности учителей

ИИ-пайплайн LLM-as-Judge для проверки экзаменов приблизился к..

Исследователи представили пайплайн LLM-as-Judge для автоматического оценивания ответов на экзаменах. Система использует официальные учебные...


Графовые нейросети на геометрии Финслера: новый метод для облаков точек

Графовые нейросети на геометрии Финслера: новый метод для..

Исследователи из arXiv представили новый класс графовых нейронных сетей, основанных на геометрии Финслера. Они доказали, что такие сети...


CEO-Bench: новый бенчмарк проверяет способность ИИ управлять компанией как CEO

CEO-Bench: новый бенчмарк проверяет способность ИИ управлять..

Исследователи представили CEO-Bench — мультиагентный бенчмарк для оценки способности больших языковых моделей (LLM) принимать...


Multi-agent LLM: верифицированная защита от четырех типов аномалий

Multi-agent LLM: верифицированная защита от четырех типов..

Исследователи представили верифицированные детекторы и методы предотвращения четырех типов аномалий параллелизма в multi-agent LLM...


MapSatisfyBench: бенчмарк для оценки удовлетворённости пользователей при работе с картами

MapSatisfyBench: бенчмарк для оценки удовлетворённости..

Исследователи представили MapSatisfyBench — новый бенчмарк, оценивающий, насколько хорошо ИИ-агенты в картографических сервисах учитывают...