Наука
ИИ-поиск по сложным PDF достиг рекордной точности 99% с помощью..
Исследователи представили Multimodal CoLRAG-TF — систему для поиска по многостраничным PDF с мультимодальным содержимым. Комбинируя четыре...
Случайная выборка в LLM уступает ансамблю: одно измерение против..
Исследователи сравнили стохастическую выборку и ансамбль моделей для оценки неопределённости LLM. Оказалось, что множественные запуски...
LLM-поиск сократил параметры нейросети в 14 раз, повысив точность..
Исследователи масштабировали поиск конфигурации каналов нейросети с помощью LLM до 250 кандидатов за цикл. Точность лучшей модели выросла с...
AI-расширение ClickGuard выявляет кликбейт с точностью 91% и..
Ученые представили браузерное расширение ClickGuard, которое с помощью гибридной ML-архитектуры обнаруживает кликбейтные новости. Система...
Обязательные поля в JSON заставляют ИИ галлюцинировать:..
Новое исследование показало, что языковые модели выдумывают ответы, когда формат требует обязательные поля. Даже при отсутствии данных...
Вотермарки LLM ухудшают качество медицинских текстов: новое..
Ученые провели первое масштабное исследование влияния вотермарок на медицинские тексты, сгенерированные ИИ. Выяснилось, что водяные знаки...
DataPrep-Bench: первый унифицированный бенчмарк для оценки LLM в..
Исследователи представили DataPrep-Bench — первый бенчмарк, который комплексно оценивает способности больших языковых моделей и AI-агентов...
Новая архитектура AINTMA: автономное управление тестированием с..
Исследователи представили архитектуру AINTMA — мультиагентную систему ИИ для автономного управления тестированием программного обеспечения....
NEXUS: новый ИИ-монитор безопасности для LLM-агентов с..
Исследователи представили NEXUS — систему runtime-мониторинга безопасности для LLM-агентов, использующих внешние инструменты. Она...
Learn2Discern: крупные языковые модели проваливают проверку..
Исследователи представили бенчмарк Learn2Discern (L2D) для оценки того, насколько языковые модели способны различать надежные источники и...


