Препринт — материал ещё не прошёл рецензирование
Открытую модель Thomson приблизили к новейшим системам ИИ
Кратко
Авторы дообучили открытую модель Thomson на широком наборе задач — от безопасности и права до работы на разных языках и сложного поиска. В авторских проверках она стала конкурентоспособной с новейшими системами, заметно расширила способности и почти не утратила прежние навыки.
Зачем это знать
Если результат подтвердится независимыми проверками, небольшим организациям может стать реальнее создавать и контролировать собственные сильные системы ИИ при меньших вычислительных и кадровых затратах. Пока вывод опирается главным образом на тесты, выбранные самими авторами.
Разбор
Авторы предлагают не просто слегка подправить готовую модель, а последовательно переучивать её на разных этапах. Такой подход называют непрерывным обучением: модель получает новые навыки, но после каждого шага её проверяют и защищают уже имеющиеся способности. Это важно, потому что обычная адаптация под узкую область часто приводит к «забыванию» — модель начинает лучше решать новые задачи, но хуже справляется со старыми.
В работе сравнивают этот метод с более ограниченными вариантами: небольшим дообучением, тщательно составленными запросами и подключением инструментов к неизменяемой модели. Авторы стараются менять как можно меньшую часть параметров, одновременно сохраняя гибкость для обучения и устойчивость прежних навыков. В результате улучшения появились не только в специально выбранных профессиональных областях: модель также сохранила базовые возможности там, где её отдельно не переучивали.
Проверку проводили в едином тестовом контуре: одинаковые запросы, сопоставимые настройки рассуждения и общие процедуры оценивания. Инструменты и поиск не давали отдельным моделям преимущество: их подключали только там, где это требовал сам тест, и тогда одинаковый доступ получали все участники. Помимо качества, авторы сравнивали стоимость выполнения задач и показывают, что Thomson может оказаться близкой к сильным закрытым системам при меньших затратах на запуск.
Можно ли доверять
Это препринт с arXiv, поэтому независимая рецензия ещё не подтвердила выводы. Сравнения выглядят аккуратнее обычной демонстрации на одном тесте: модели запускали в одинаковых условиях, но основные результаты и выбор оценок всё равно исходят от авторов, а часть данных о конкурентах взята из публичных рейтингов.
Пересказано ИИ по научной статье. Как это устроено