dumai
🤖
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Большие языковые модели хуже предсказывают по таблицам при росте числа признаков

0

Кратко

Авторы проверили обычную большую языковую модель на 31 наборе данных и сравнили её с классическими моделями. При росте числа признаков точность языковой модели падала, а у классических моделей в целом оставалась стабильной или даже росла.

Зачем это знать

Это помогает понять, почему такие модели на таблицах пока часто проигрывают классическим методам, хотя хорошо работают во многих других задачах.

Разбор

Авторы не просто сравнили языковую модель с табличными методами «в лоб», а устроили серию контролируемых проверок, чтобы понять, где именно она спотыкается. Они брали один и тот же набор данных, меняли только отдельный фактор — например, насколько классы разделимы, насколько точно записаны числа, сколько ответов просят за один запрос или как выглядит таблица после преобразования в CSV-формат. Идея была простая: если модель проваливается по конкретной причине, то при исправлении этой причины качество должно заметно вырасти.

Но почти все популярные объяснения не подтвердились. Плохо работали не только шумные или сложные данные, не спасали более «удобный» текстовый формат таблицы, более точные числа и просьба предсказывать меньше объектов за раз. Даже на задачах, где классы специально сделали хорошо отделимыми, модель улучшалась слабо и всё равно заметно отставала от классических алгоритмов.

Главный сигнал пришёл от числа признаков — то есть столбцов с информацией. На 31 наборе данных авторы случайно проецировали признаки в пространства разной размерности и увидели, что именно здесь поведение языковой модели резко расходится с обычными методами: у неё точность падала по мере роста размерности, а у остальных девяти методов, наоборот, оставалась примерно на месте или росла. Дополнительно они сравнили предсказания с 252 настроенными классическими моделями и заметили, что в двух измерениях языковая модель ведёт себя как локальный метод, который смотрит на ближайшие примеры, но в больших размерностях уже не повторяет поведение ни одного обычного алгоритма.

Ключевые цифры

31 набор данныхПроверка шла не на одной случайной таблице, а на большой подборке задач, так что это не единичный удачный или неудачный пример.
9 методовЯзыковую модель сравнили сразу с несколькими классическими подходами, поэтому её просадка — не вопрос одного неудачного конкурента.
252 настроенных классических моделиАвторы перебрали очень много вариантов обычных алгоритмов и всё равно не нашли среди них точного аналога поведения языковой модели.
91.6% совпадения по сеткеВ простом двухмерном случае предсказания модели почти совпадали с локальным методом, который ориентируется на близкие точки.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли рецензенты. При этом экспериментальная часть выглядит сильной: много наборов данных, несколько контрольных тестов и большое число сравнений с классическими моделями. Но выводы относятся к одной конкретной языковой модели и к режиму чистого предсказания без донастройки, так что на другие модели и более практичные сценарии их нельзя переносить автоматически.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас4 августа 2026 г.
Дата источника3 августа 2026 г.
ОригиналОткрыть
АвторыMarta Garnelo, Wojciech M. Czarnecki