Препринт — материал ещё не прошёл рецензирование
В тесте ИИ-аналитик выполнил 86% задач вместо 43% без проверки связей
Кратко
Авторы проверили систему на данных о работе суперкомпьютера: перед обращением к данным ИИ сверял связи между источниками по заранее заданной карте. Доля успешно выполненных задач выросла с 43% до 86%, а расход токенов — небольших фрагментов текста, которые обрабатывает модель, — снизился в 2,4 раза. Проверка охватила ограниченное число задач и один специализированный тип данных. Это препринт, поэтому результат ещё не прошёл независимую экспертную проверку.
Зачем это знать
Результат указывает, что заранее проверенные связи между данными могут сделать ИИ надёжнее и дешевле в сложном анализе. Но это пока предварительный результат: преимущество получили в одном варианте системы, на узком наборе данных и задач.
Разбор
Идея системы — разделить две задачи, которые обычно смешивает языковая модель: рассуждать над вопросом и решать, какие данные можно безопасно запросить. Модель может строить план и уточнять формулировки, но к самим данным обращается только через граф знаний — карту сущностей и связей между ними. Перед выполнением система проверяет, допустим ли такой маршрут по этой карте. Поэтому модели не приходится самостоятельно угадывать, как связать, например, разные источники телеметрии.
Авторы добавили к этому механизму «контур размышления»: он умеет разбирать неоднозначные названия метрик, просить уточнение, делить слишком длинный временной интервал на части и отдавать результат обычным текстом или CSV-файлом. Для сравнения они оставили одинаковыми координатора, навыки, модель и оборудование, а меняли только способ доступа к данным: через предложенный граф, через прежний жёсткий инструмент или напрямую к хранилищу без проверки связей.
Проверка показала не только рост доли успешных ответов. Новый вариант предотвращал скрытые ошибки целостности данных — случаи, когда запрос формально выполняется, но соединяет источники неправильно и выдаёт правдоподобный результат. Авторы также сообщают, что небольшая локальная модель в этой схеме обошла более крупную. При этом тестировали систему на двух типах заданий: на полном анализе и на одном лишь извлечении данных.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому независимая экспертная проверка ещё впереди. Тест на десятках терабайт и сравнении при одинаковом оборудовании выглядит содержательно, но набор задач узкий: реальные данные одного типа и всего 14 сквозных сценариев, так что перенос результата на другие отрасли пока не доказан.
Пересказано ИИ по научной статье. Как это устроено