Наука

ИИ-поиск по сложным PDF достиг рекордной точности 99% с помощью тройной фильтрации

ИИ-поиск по сложным PDF достиг рекордной точности 99% с помощью..

Исследователи представили Multimodal CoLRAG-TF — систему для поиска по многостраничным PDF с мультимодальным содержимым. Комбинируя четыре...


Случайная выборка в LLM уступает ансамблю: одно измерение против четырёх

Случайная выборка в LLM уступает ансамблю: одно измерение против..

Исследователи сравнили стохастическую выборку и ансамбль моделей для оценки неопределённости LLM. Оказалось, что множественные запуски...


LLM-поиск сократил параметры нейросети в 14 раз, повысив точность

LLM-поиск сократил параметры нейросети в 14 раз, повысив точность..

Исследователи масштабировали поиск конфигурации каналов нейросети с помощью LLM до 250 кандидатов за цикл. Точность лучшей модели выросла с...


AI-расширение ClickGuard выявляет кликбейт с точностью 91% и генерирует спойлеры

AI-расширение ClickGuard выявляет кликбейт с точностью 91% и..

Ученые представили браузерное расширение ClickGuard, которое с помощью гибридной ML-архитектуры обнаруживает кликбейтные новости. Система...


Обязательные поля в JSON заставляют ИИ галлюцинировать: исследование PhantomFill

Обязательные поля в JSON заставляют ИИ галлюцинировать:..

Новое исследование показало, что языковые модели выдумывают ответы, когда формат требует обязательные поля. Даже при отсутствии данных...


Вотермарки LLM ухудшают качество медицинских текстов: новое исследование

Вотермарки LLM ухудшают качество медицинских текстов: новое..

Ученые провели первое масштабное исследование влияния вотермарок на медицинские тексты, сгенерированные ИИ. Выяснилось, что водяные знаки...


DataPrep-Bench: первый унифицированный бенчмарк для оценки LLM в подготовке данных

DataPrep-Bench: первый унифицированный бенчмарк для оценки LLM в..

Исследователи представили DataPrep-Bench — первый бенчмарк, который комплексно оценивает способности больших языковых моделей и AI-агентов...


Новая архитектура AINTMA: автономное управление тестированием с ИИ и генеративным интеллектом

Новая архитектура AINTMA: автономное управление тестированием с..

Исследователи представили архитектуру AINTMA — мультиагентную систему ИИ для автономного управления тестированием программного обеспечения....


NEXUS: новый ИИ-монитор безопасности для LLM-агентов с инструментами — точность до 94,9%

NEXUS: новый ИИ-монитор безопасности для LLM-агентов с..

Исследователи представили NEXUS — систему runtime-мониторинга безопасности для LLM-агентов, использующих внешние инструменты. Она...


Learn2Discern: крупные языковые модели проваливают проверку достоверности информации

Learn2Discern: крупные языковые модели проваливают проверку..

Исследователи представили бенчмарк Learn2Discern (L2D) для оценки того, насколько языковые модели способны различать надежные источники и...