Thinking Machines и Bridgewater научили модель экспертному суждению — и обошли GPT и Claude
📊 Thinking Machines Lab и Bridgewater AIA Labs — подразделение крупнейшего в мире хедж-фонда — показали: дообученная Qwen3-235B на задачах финансовой экспертизы превосходит все фронтир-модели при
13,8-кратно меньшей стоимости инференса. Результат — 84,7% точности против 78,2% у лучшей из протестированных (Opus 4.8), или на 29,8% меньше ошибок.
🧠 Шесть задач из ежедневной рутины инвестора: классификация релевантности статей, определение сигналов в документах центробанков, отсечение шаблонного контента в отчётах и письмах.
Для эксперта-человека тривиально, но для LLM, - сложно.
Фронтир-модели (Gemini 3.1 Pro, GPT-5.4/5.5, Opus 4.6/4.8) давали ~50% точности с простым промптом и ~78% после ручной и автоматической оптимизации.
Порог доверия инвесторов — 80% — так и не был взят.
🔬 Рецепт: GRPO на Qwen3-235B через Tinker → чередующиеся батчи (+12,1%) → CISPO-функция потерь с асимметричным клиппингом (+10,1%) → дистилляция по собственной политике с учителем, обновляемым при каждом новом рекорде на валидации (+3,1%).
Главная фишка проекта, - максимально очищенный датасет.
Все спорные примеры отправляли экспертам на переоценку.
💡 Главный вывод: экспертное суждение плохо формулируется в промпте, но отлично передаётся через качественно размеченные примеры.
Авторы называют это «differentiated intelligence»: организации, способные превратить свою экспертизу в обучающие данные, получат модели, обходящие фронтир на узких задачах. При этом, условно, за копейки.
#ThinkingMachines #Bridgewater #FineTuning
———
@tsingular
Обсуждение 4
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram