avatar
Сиолошная
@seeallochnaya
18.07.2026 20:49
Сиолошная Фото: А теперь наша любимая рубрика...
8 месяцев назад вышла Kimi K2 Thinking, и мы слышали то же самое: «Китайская открытая модель заняла топ-1». Через 3 месяца после релиза я собрал аналитику по 16 бенчмаркам, вышедшим после релиза модели, и сравнил с GPT-5 / Sonnet 4.5. Модель была хуже на 13 (!!!) из них, причём на 7 — более чем на 10 процентных пунктов (пп). Повторится ли это с Kimi K3?

Свои мысли и предсказания я напишу в конце, а пока пришла пора ретроспективно оценить DeepSeek v4 Pro (Preview) — с его релиза прошло почти 3 месяца. За это время я смог найти 32 новопоявившихся бенчмарка. В релизном блогпосте v4 Pro сравнивали с Opus 4.6 и GPT-5.4, и модель якобы «была лучше» в 4 и 3 бенчмарках из 6 соответственно. Конечно же результаты на новых будут сопоставимы?

Нет. Opus 4.6 и DeepSeek v4 Pro обе были замерены на 10 бенчмарках — на 9 из них китайская модель проигрывает, и на 5 — более чем на 20 (!) относительных процентов. Сравнение с GPT-5.4 выглядит чуть менее жестким: DeepSeek v4 Pro оказался лучше на 3... но всё равно хуже на 13. (Количество бенчмарков разное потому, что не каждый бенчмарк замеряет цифры и для GPT, и для Claude). На 6 бенчмарках разница больше 20 относительных процентов.

Но вообще-то стоит вспомнить, что и GPT-5.5, и Opus 4.7 вышли ДО DeepSeek v4 (на самом деле впритык, но всё же). И если добавить эти модели, как будто мы сравниваем со всеми моделями, доступными на момент релиза v4, то ситуация становится просто мрачной. Все 32 бенчмарка проиграны, и средняя разница в абсолютных оценках составляет -18.6 пп. Эта разница вырастает до -23 пп, если брать только те бенчмарки, которые я классифицировал как Agentic Coding (SWE-bench style), где казалось бы падение должно быть не таким существенным.

Только подумайте: модель не решает четверть задач, которые решали проприетарные модели, доступные на момент релиза DeepSeek V4 Pro.

Повторится ли эта ситуация с Kimi K3? Ведь ей предстоит пережить сравнение с GPT-5.6-Sol и Fable 5. Я уверен, что да — по сумме показателей на десятках бенчмарков мы точно увидим разницу, хотя, возможно, не настолько значительную. В конце концов по тем веб-сайтам, что я вижу в своей твиттер-ленте, модель действительно не хуже Fable на фронтенд-задачах, даже на очень креативных промптах.

Вполне возможно, что на широком наборе других задачах на программирование модель тоже конкурентна или хотя бы отстаёт не так сильно. Может быть даже сможет потягаться в подготовке презентаций и экселек. Условно, если снова соберётся 30 бенчмарков, мы можем увидеть, скажем, 8 побед за Kimi, 5 ничьих и 17 поражений. А может быть, она покажет себя даже лучше — поживём увидим.

Главное то, что Kimi K3 может быть той моделью, которая покажет, что существуют некоторые поддомены, в которых Китайские модели действительно не отстают систематически. Это не качество по всем направлениям, и "в среднем" проприетарные всё равно будут лучше — речь именно про поддомены (например, «вебсайты с 3D-графикой на three.js» или «веб-игры», по которым многие делают слишком далекоидущие выводы).

(Не воспринимайте этот текст как «Kimi / DeepSeek говно и никто не должен их использовать». Пожалуйста, прочитайте детали моей позиции в блогпосте по ссылке).

Все графики и данные тут: ссылка.
👍 164
36
🔥 20
🤡 12
💩 8
🤔 3
🤯 2
👨‍💻 2
152 154 14.6K

Обсуждение 152

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Сиолошная

76.3K
Канал SeeAll'а с новостями (и мыслями о них) из мира NLP, VR и космоса.

Более подробно смотри в первом сообщении в канале (оно закреплено). А еще у нас есть чат! Заходи: https://t.me/+i_XzLucdtRJlYWUy
Открыть в Telegram