Препринт — материал ещё не прошёл рецензирование
Внутренняя проверка ИИ показывала 3% ошибок при реальных 32%
Кратко
Авторы проверили систему, где большинство задач решает недорогая модель, а сложные ответы перепроверяет более сильная, на математических задачах с известными правильными ответами. Когда недорогую модель дополнительно обучали на ответах, которые проверяющий отверг, она не стала лучше: во всех испытанных вариантах качество ухудшалось и в итоге система разрушалась. При этом внутренняя оценка держалась около 3% ошибок, хотя настоящая доля ошибок доходила до 32%.
Зачем это знать
Для систем, где один ИИ проверяет ответы другого и помогает его улучшать, оценки через этого проверяющего могут скрывать ухудшение качества. Пока это проверили только на математических задачах и конкретных моделях, поэтому переносить вывод на тексты и код рано.
Разбор
Авторы устроили для системы «аэродинамическую трубу»: взяли математические задачи, где существует независимый и надёжный эталонный ответ, но спрятали его от проверяющей модели. Поэтому можно отдельно узнать, ошибся ли ученик на самом деле, и сравнить это с вердиктом проверяющего. Проверяющий видел условие, ход рассуждений и финальный ответ, но не золотое решение — как в реальной задаче, где у него нет идеального ключа. Такой подход нужен потому, что в размытых задачах вроде проверки текста независимой истины обычно нет, а значит, слепую зону самого проверяющего трудно заметить.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому работу ещё не проверили независимые рецензенты. Сильная сторона эксперимента — раздельный тестовый набор, фиксированный проверяющий и независимый эталон правильности; но всё проверяли только на математических задачах и конкретных языковых моделях, так что перенос на реальные тексты или код остаётся открытым.
Пересказано ИИ по научной статье. Как это устроено