Наука
AI-воркфлоу на основе foundation model ускоряет проектирование..
Исследователи представили первый workflow, использующий foundation model для оптимизации краш-тестов. Система сокращает оценку травм...
Новая инфраструктура DeepInsight объединяет оценку Physical AI..
Исследователи представили DeepInsight — единую инфраструктуру для оценки Physical AI, охватывающую все уровни стека: от декодирования...
Математики определили фундаментальные ограничения методов..
Исследователи установили, что максимальный объем зашумления, который может скрыться от сертификата отбраковки выбросов ограниченной...
SEAGym: среда для оценки самоэволюционирующих LLM-агентов..
Исследователи представили SEAGym — платформу для тестирования обновлений обвязки LLM-агентов. Она выявляет, приводит ли изменение к...
PowerOPD: стабилизация дистилляции LLM с приростом точности до..
Исследователи предложили PowerOPD — семейство ограниченных наград на основе преобразования Бокса-Кокса, решающее проблему нестабильности в...
ИИ-пайплайн LLM-as-Judge для проверки экзаменов приблизился к..
Исследователи представили пайплайн LLM-as-Judge для автоматического оценивания ответов на экзаменах. Система использует официальные учебные...
Графовые нейросети на геометрии Финслера: новый метод для..
Исследователи из arXiv представили новый класс графовых нейронных сетей, основанных на геометрии Финслера. Они доказали, что такие сети...
CEO-Bench: новый бенчмарк проверяет способность ИИ управлять..
Исследователи представили CEO-Bench — мультиагентный бенчмарк для оценки способности больших языковых моделей (LLM) принимать...
Multi-agent LLM: верифицированная защита от четырех типов..
Исследователи представили верифицированные детекторы и методы предотвращения четырех типов аномалий параллелизма в multi-agent LLM...
MapSatisfyBench: бенчмарк для оценки удовлетворённости..
Исследователи представили MapSatisfyBench — новый бенчмарк, оценивающий, насколько хорошо ИИ-агенты в картографических сервисах учитывают...


