dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Внутренняя проверка ИИ показывала 3% ошибок при реальных 32%

0

Кратко

Авторы проверили систему, где большинство задач решает недорогая модель, а сложные ответы перепроверяет более сильная, на математических задачах с известными правильными ответами. Когда недорогую модель дополнительно обучали на ответах, которые проверяющий отверг, она не стала лучше: во всех испытанных вариантах качество ухудшалось и в итоге система разрушалась. При этом внутренняя оценка держалась около 3% ошибок, хотя настоящая доля ошибок доходила до 32%.

Зачем это знать

Для систем, где один ИИ проверяет ответы другого и помогает его улучшать, оценки через этого проверяющего могут скрывать ухудшение качества. Пока это проверили только на математических задачах и конкретных моделях, поэтому переносить вывод на тексты и код рано.

Разбор

Авторы устроили для системы «аэродинамическую трубу»: взяли математические задачи, где существует независимый и надёжный эталонный ответ, но спрятали его от проверяющей модели. Поэтому можно отдельно узнать, ошибся ли ученик на самом деле, и сравнить это с вердиктом проверяющего. Проверяющий видел условие, ход рассуждений и финальный ответ, но не золотое решение — как в реальной задаче, где у него нет идеального ключа. Такой подход нужен потому, что в размытых задачах вроде проверки текста независимой истины обычно нет, а значит, слепую зону самого проверяющего трудно заметить.

Ключевые цифры

0,5–32 млрд параметровПроверили ученические модели от очень компактной до крупной и увидели, что рост их возможностей не делает проверяющего автоматически надёжнее.
β: 0,12 → 0,55Доля настоящих ошибок ученика, которые проверяющий пропускал, выросла примерно с 12% до 55% при масштабировании ученика — сильная модель научилась ошибаться более убедительно.
46%С самым сильным проверяющим системе пришлось отправлять ему почти каждый второй сложный запрос, так что экономия каскада почти исчезала.
39%На этих сложных задачах настоящая доля ошибок ученика составляла почти две пятых — заметно меньше, чем доля запросов, которые пришлось эскалировать.

Можно ли доверять

Это препринт arXiv, поэтому работу ещё не проверили независимые рецензенты. Сильная сторона эксперимента — раздельный тестовый набор, фиксированный проверяющий и независимый эталон правильности; но всё проверяли только на математических задачах и конкретных языковых моделях, так что перенос на реальные тексты или код остаётся открытым.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас2 сентября 2026 г.
Дата источника1 сентября 2026 г.
ОригиналОткрыть
АвторыDushyant Rajput