dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

В тесте ИИ-аналитик выполнил 86% задач вместо 43% без проверки связей

0

Кратко

Авторы проверили систему на данных о работе суперкомпьютера: перед обращением к данным ИИ сверял связи между источниками по заранее заданной карте. Доля успешно выполненных задач выросла с 43% до 86%, а расход токенов — небольших фрагментов текста, которые обрабатывает модель, — снизился в 2,4 раза. Проверка охватила ограниченное число задач и один специализированный тип данных. Это препринт, поэтому результат ещё не прошёл независимую экспертную проверку.

Зачем это знать

Результат указывает, что заранее проверенные связи между данными могут сделать ИИ надёжнее и дешевле в сложном анализе. Но это пока предварительный результат: преимущество получили в одном варианте системы, на узком наборе данных и задач.

Разбор

Идея системы — разделить две задачи, которые обычно смешивает языковая модель: рассуждать над вопросом и решать, какие данные можно безопасно запросить. Модель может строить план и уточнять формулировки, но к самим данным обращается только через граф знаний — карту сущностей и связей между ними. Перед выполнением система проверяет, допустим ли такой маршрут по этой карте. Поэтому модели не приходится самостоятельно угадывать, как связать, например, разные источники телеметрии.

Авторы добавили к этому механизму «контур размышления»: он умеет разбирать неоднозначные названия метрик, просить уточнение, делить слишком длинный временной интервал на части и отдавать результат обычным текстом или CSV-файлом. Для сравнения они оставили одинаковыми координатора, навыки, модель и оборудование, а меняли только способ доступа к данным: через предложенный граф, через прежний жёсткий инструмент или напрямую к хранилищу без проверки связей.

Проверка показала не только рост доли успешных ответов. Новый вариант предотвращал скрытые ошибки целостности данных — случаи, когда запрос формально выполняется, но соединяет источники неправильно и выдаёт правдоподобный результат. Авторы также сообщают, что небольшая локальная модель в этой схеме обошла более крупную. При этом тестировали систему на двух типах заданий: на полном анализе и на одном лишь извлечении данных.

Ключевые цифры

49,9 ТБЭто объём телеметрии суперкомпьютера, на котором проверяли работу системы, а не небольшой искусственный пример.
14 задачПолный анализ оценивали на 14 сквозных сценариях — от вопроса пользователя до готового результата.
75 запросовОтдельно проверили 75 запросов на извлечение данных, чтобы оценить именно доступ к нужным показателям.

Можно ли доверять

Это препринт с arXiv, поэтому независимая экспертная проверка ещё впереди. Тест на десятках терабайт и сравнении при одинаковом оборудовании выглядит содержательно, но набор задач узкий: реальные данные одного типа и всего 14 сквозных сценариев, так что перенос результата на другие отрасли пока не доказан.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас16 сентября 2026 г.
Дата источника15 сентября 2026 г.
ОригиналОткрыть
АвторыBaibek Davletiyarov, Junaid Ahmed Khan, Andrea Bartolini