avatar
AI-Driven Development. Родион Мостовой
@ai_driven
16.06.2026 20:20
GLM 5.2 - чуть лучше GPT 5.5 в SWE-Marathon

Как вам задача переписать Kubernetes на Rust?
Или создать копию Slack?
Безумие - скажете вы? "SWE-Marathon" скажут ребята из Abundant.
Бенмарк измеряет сразу несколько вещей:
1. Прежде всего, автономность - то есть возможно агента крутиться без пинков до решения задачи столько, сколько нужно. Размер задачи там 7.6M токенов в медиане и 877.4M в пределе.
2. Внимательность к контексту - на длительных задачах навык модели удерживать контекст, не теряя цели и детали крайне важен.
3. Агентность, т. е. способность грамотно применять tools use (function calling).
4. И... Честность. Да, да, каким-то моделям более свойственно читерить, каким-то менее - то есть, некоторые модели банально хакают тесты и подстраиваются под них (ну, вы и сами знаете). Модели в целом довольно ленивы, как правило, а некоторые еще и жульничают. Любопытно, кстати, что этот показатель зависит не только от модели, но и от обвязки (harness).
Собсна, мне этот бенч особенно понравился, т. к. крупные автономные задачи на тысячи и десятки тысячи строк в моем воркфлоу - довольно типичная история, и это как раз про марафон. Спасибо Ибрагиму, что показ мне этот бенч у нас на недавнем стриме.
Так вот, интересно, что новенькая GLM 5.2 там выбивает очень бодрые результаты на уровне GPT 5.5. Из неочевидного: токенов при этом выжирает почти в 8 раз больше, чем GPT 5.5, при том, что из топов жульничает меньше всех. Моделька открытая, т. е. потенциально организации могут такую мощь и в закрытом контуре развернуть. Ждем в ближайшее время на OpenCode Go и на Synthetic.
Напоследок, поворчу про бенч: вообще, такие задачи нужно как минимум в режиме /goal запускать, а по-хорошему на кастомном поэтапном флоу (а-ля ultracode только более контролируемом). Следов goal я paper не нашел, поэтому задал вопрос одному из авторов в X.

Там, кстати, еще Kimi K2.7 Code - пробовал кто ее? В OpenCode Go вижу уже доступна. Бенчей нормальных они, к сожалению, не дали.
И подключайтесь завтра в 13:30 МСК, 15:30 по Алматы на стрим с Иваном Закутным, будем говорить про ошибки Spec-Driven Development: https://youtube.com/live/N01bvw44P60?feature=share

Бенчмарк SWE-Marathon, блогпост по GLM 5.2.

@ai_driven | AI-Driven Development: Родион Мостовой.
11
👍 10
2 39 1.7K

Обсуждение 2

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

AI-Driven Development. Родион Мостовой

5.1K
Увлекательно рассказываю про AI в разработке, про построение продуктов с LLM под капотом и иногда про .NET.
Связь: @rodion_m_tg
Чат: @ai_driven_chat
Открыть в Telegram