Препринт — материал ещё не прошёл рецензирование
Большие языковые модели хуже предсказывают по таблицам при росте числа признаков
Кратко
Авторы проверили обычную большую языковую модель на 31 наборе данных и сравнили её с классическими моделями. При росте числа признаков точность языковой модели падала, а у классических моделей в целом оставалась стабильной или даже росла.
Зачем это знать
Это помогает понять, почему такие модели на таблицах пока часто проигрывают классическим методам, хотя хорошо работают во многих других задачах.
Разбор
Авторы не просто сравнили языковую модель с табличными методами «в лоб», а устроили серию контролируемых проверок, чтобы понять, где именно она спотыкается. Они брали один и тот же набор данных, меняли только отдельный фактор — например, насколько классы разделимы, насколько точно записаны числа, сколько ответов просят за один запрос или как выглядит таблица после преобразования в CSV-формат. Идея была простая: если модель проваливается по конкретной причине, то при исправлении этой причины качество должно заметно вырасти.
Но почти все популярные объяснения не подтвердились. Плохо работали не только шумные или сложные данные, не спасали более «удобный» текстовый формат таблицы, более точные числа и просьба предсказывать меньше объектов за раз. Даже на задачах, где классы специально сделали хорошо отделимыми, модель улучшалась слабо и всё равно заметно отставала от классических алгоритмов.
Главный сигнал пришёл от числа признаков — то есть столбцов с информацией. На 31 наборе данных авторы случайно проецировали признаки в пространства разной размерности и увидели, что именно здесь поведение языковой модели резко расходится с обычными методами: у неё точность падала по мере роста размерности, а у остальных девяти методов, наоборот, оставалась примерно на месте или росла. Дополнительно они сравнили предсказания с 252 настроенными классическими моделями и заметили, что в двух измерениях языковая модель ведёт себя как локальный метод, который смотрит на ближайшие примеры, но в больших размерностях уже не повторяет поведение ни одного обычного алгоритма.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли рецензенты. При этом экспериментальная часть выглядит сильной: много наборов данных, несколько контрольных тестов и большое число сравнений с классическими моделями. Но выводы относятся к одной конкретной языковой модели и к режиму чистого предсказания без донастройки, так что на другие модели и более практичные сценарии их нельзя переносить автоматически.
Пересказано ИИ по научной статье. Как это устроено