STARM: пробиваем потолок классических LLM в алгоритмике
Алгоритмические задачи — всё ещё один из главных челленджей для классических языковых моделей. Справляться с ними помогают рекурсивные модели, способные адаптировать объём вычислений под сложность задачи.
Долгое время ориентиром здесь были модели вроде HRM, URM и TRM. При создании
STARM команда Сбера опиралась на исследование этих архитектурных решений: авторы воспроизвели их и выбрали наиболее эффективные компоненты. Итогом стал мощный open-source Python-фреймворк для обучения рассуждающих моделей на основе рекурсивных архитектур.
Что под капотом и почему это важно:
новый подход к reasoning: STARM объединяет наиболее эффективные компоненты HRM, TRM и URM с собственными улучшениями команды
новые SOTA-метрики: обширные вычислительные эксперименты доказали, что фреймворк повышает стабильность обучения, а итоговые модели существенно опережают по качеству предыдущие open-source-аналоги
адаптивные вычисления: рекурсивная архитектура позволяет модели выполнять разное число вычислительных шагов в зависимости от сложности задачи
Забирайте инструменты для своих экспериментов
Подробный разбор архитектуры и замеров качества —
в большом техническом отчёте на Хабре
Полный код фреймворка —
в открытом доступе на GitHub
Подписывайтесь на Sber AI в МАКС
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram