Препринт — материал ещё не прошёл рецензирование
ИИ без явных рассуждений дольше справляется с трудными задачами
Кратко
Авторы проверили более 30 тысяч вопросов из 43 тестов и оценили, сколько времени человеку нужно на задачи, которые модель решает хотя бы в половине случаев без явных шагов рассуждения. По их оценке, этот порог у ведущих моделей рос примерно вдвое в год за последние шесть лет; для GPT-5.5 он уже превышает 3 минуты, а для 2028 и 2030 авторы дают оценки выше 7 и 25 минут, но с большой неопределённостью.
Зачем это знать
Авторы предлагают отдельно следить за таким порогом, потому что внутренние рассуждения без видимых токенов могут сделать контроль за ИИ слабее. Но это препринт и косвенная метрика, так что вывод здесь — скорее повод наблюдать за трендом, чем готовое руководство к действию.
Разбор
Авторы не пытались заставить модели «показывать ход мысли» — наоборот, они проверяли, что происходит, когда модель решает задачу без явных шагов рассуждения. Для этого они собрали больше 30 тысяч вопросов из 43 разных тестов: от математики и кода до головоломок, причинно-следственных задач, задач на понимание чужих намерений и стратегическое мышление. Потом они сравнили модели с человеком не по красоте ответа, а по тому, сколько времени человеку понадобилось бы на задачи, с которыми модель справляется хотя бы в половине случаев.
Идея тут довольно практичная: если модель всё лучше справляется без видимого внутреннего «черновика», то привычный способ контроля через цепочку рассуждений может перестать работать. Поэтому авторы ввели две меры. Первая — «временной горизонт задачи»: сколько минут у человека уходит на задания, которые модель решает с вероятностью 50%. Вторая — «горизонт токенов рассуждения»: сколько внутренних токенов нужно модели o3-mini, чтобы тоже выйти на 50% успеха. Это помогает перевести способности ИИ в более понятные единицы — время и объём внутренней обработки.
Самый заметный результат в том, что этот порог у frontier-моделей рос примерно вдвое каждый год за последние шесть лет. У GPT-5.5 он уже перевалил за 3 минуты, а по оценке авторов соответствующий горизонт токенов рассуждения превысил 1 500 токенов. Ещё важнее прогноз: если тренд сохранится, к 2028 году порог может быть больше 7 минут, а к 2030-му — 25 минут. Но сами авторы подчёркивают, что это именно оценка с большой неопределённостью, а не точное предсказание.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли независимую рецензию. Сильная сторона исследования — очень большой набор задач и сравнение сразу на множестве бенчмарков, но прогнозы на 2028–2030 годы сами авторы называют очень неопределёнными, так что их лучше считать ориентиром для тренда, а не точным планом на будущее.
Пересказано ИИ по научной статье. Как это устроено