dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

ИИ без явных рассуждений дольше справляется с трудными задачами

0

Кратко

Авторы проверили более 30 тысяч вопросов из 43 тестов и оценили, сколько времени человеку нужно на задачи, которые модель решает хотя бы в половине случаев без явных шагов рассуждения. По их оценке, этот порог у ведущих моделей рос примерно вдвое в год за последние шесть лет; для GPT-5.5 он уже превышает 3 минуты, а для 2028 и 2030 авторы дают оценки выше 7 и 25 минут, но с большой неопределённостью.

Зачем это знать

Авторы предлагают отдельно следить за таким порогом, потому что внутренние рассуждения без видимых токенов могут сделать контроль за ИИ слабее. Но это препринт и косвенная метрика, так что вывод здесь — скорее повод наблюдать за трендом, чем готовое руководство к действию.

Разбор

Авторы не пытались заставить модели «показывать ход мысли» — наоборот, они проверяли, что происходит, когда модель решает задачу без явных шагов рассуждения. Для этого они собрали больше 30 тысяч вопросов из 43 разных тестов: от математики и кода до головоломок, причинно-следственных задач, задач на понимание чужих намерений и стратегическое мышление. Потом они сравнили модели с человеком не по красоте ответа, а по тому, сколько времени человеку понадобилось бы на задачи, с которыми модель справляется хотя бы в половине случаев.

Идея тут довольно практичная: если модель всё лучше справляется без видимого внутреннего «черновика», то привычный способ контроля через цепочку рассуждений может перестать работать. Поэтому авторы ввели две меры. Первая — «временной горизонт задачи»: сколько минут у человека уходит на задания, которые модель решает с вероятностью 50%. Вторая — «горизонт токенов рассуждения»: сколько внутренних токенов нужно модели o3-mini, чтобы тоже выйти на 50% успеха. Это помогает перевести способности ИИ в более понятные единицы — время и объём внутренней обработки.

Самый заметный результат в том, что этот порог у frontier-моделей рос примерно вдвое каждый год за последние шесть лет. У GPT-5.5 он уже перевалил за 3 минуты, а по оценке авторов соответствующий горизонт токенов рассуждения превысил 1 500 токенов. Ещё важнее прогноз: если тренд сохранится, к 2028 году порог может быть больше 7 минут, а к 2030-му — 25 минут. Но сами авторы подчёркивают, что это именно оценка с большой неопределённостью, а не точное предсказание.

Ключевые цифры

30 000+ вопросовМодели проверили не на паре примеров, а на очень большом наборе задач, так что картина выглядит намного надёжнее, чем в маленьком тесте.
43 бенчмаркаПроверка охватила много разных типов задач, а не только один узкий навык вроде математики или кода.
3 минутыДля GPT-5.5 задачи без явных шагов рассуждения уже дошли до уровня, где человеку в среднем нужно больше трёх минут.
1 500 токеновЭто объём внутренней «мыслительной работы», который, по оценке авторов, нужен модели для успешного решения части задач.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не прошли независимую рецензию. Сильная сторона исследования — очень большой набор задач и сравнение сразу на множестве бенчмарков, но прогнозы на 2028–2030 годы сами авторы называют очень неопределёнными, так что их лучше считать ориентиром для тренда, а не точным планом на будущее.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас8 июня 2026 г.
Дата источника5 июня 2026 г.
ОригиналОткрыть
АвторыDewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask