avatar
Сиолошная
@seeallochnaya
21.07.2026 20:25
Сиолошная Две новости в утро воскресенья, 2026-й год: 1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца. В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров. «Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально). «Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2». 2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC). В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила. Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.

Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.

Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.

GPT-6 в конце августа нам видимо не ждать 🌚
🤯 516
😈 66
🤣 61
🤡 36
🌚 30
🔥 24
👍 17
🤔 14
💩 6
❤‍🔥 3
👨‍💻 3
194 3.6K 89K
avatar
Сиолошная
@seeallochnaya
21.07.2026 18:52
Reuters: США и Китай проведут переговоры по искусственному интеллекту в сентябре. Информацию подтвердили 5 источников.

Планируется, что со стороны США переговоры возглавит министр финансов. Сам он информацию о встрече подтвердил лишь косвенно, Сказав следующее: «Мы обнаруживаем водяные знаки наших американских моделей на многих китайских моделях, и это неприемлемо. Мы займемся этим вопросом в ближайшие дни или недели». Вероятно, Anthropic (а может и другие компании) предоставят сведения о том, как и кто дистиллировал Claude, и по каким признакам это можно отследить.

По словам аналитиков, в список приоритетов Пекина для обсуждений входят вопросы, касающиеся Mythos, того, как США будут контролировать выпуск будущих передовых моделей, а также того, будет ли Вашингтон вводить ограничения в отношении китайских моделей с открытыми весами.

Это лишь первая встреча, и вряд ли им удастся сформировать решение каких-либо серьезных проблем.
🔥 108
🤡 71
🌚 28
👍 13
🤔 12
🤯 4
🤣 3
👨‍💻 3
👎 2
14 170 22.6K
avatar
Сиолошная
@seeallochnaya
20.07.2026 18:18
OpenAI поделились блогпостом об уроках по безопасности, извлечённых из внутренних тестов долго работающих моделей/агентов. Такие модели способны решать очень сложные задачи, однако продолжительность их работы дает им больше возможностей для совершения нежелательных действий.

И поскольку модели дана цель решить задачу, то она её преследует, и эта настойчивость может приводить к тому, что агент начинает находить и использовать уязвимости в своем окружении. Предыдущие модели, сталкиваясь с ограничениями изолированной среды, просто останавливали работу и возвращали результат пользователю.

Но вот во время внутреннего тестирования модели OpenAI на NanoGPT speedrun⁠ — публичном бенчмарке, цель которого состоит в обучении небольшой языковой модели за минимальное количество шагов — модель придумала новый метод PowerCool, что привело к значительному улучшению результатов. Модели было дано четкое указание отправлять свои результаты только в Slack, однако в инструкциях самого бенчмарка NanoGPT говорится, что результаты нужно публиковать в виде PR на GitHub.

Модель последовала этим инструкциям и открыла PR в публичном репозитории. Она обошла ограничения «песочницы», предназначенные для блокировки внешнего доступа, и осуществила загрузку данных на GitHub. Модели потребовался ЧАС на поиск уязвимости в «песочнице», чтобы создать этот PR.

Другой пример: в сценарии, где модели требовалось решить задачу, она обнаружила, что у других систем были успешные, но приватные решения и попыталась извлечь их из сервера тестирования. Когда её первая попытка была заблокирована сканером, обнаружившим токен аутентификации, модель разделила тело токена на два фрагмента, замаскировала их, а затем написала код так, чтобы они восстанавливались во время запуска скрипта.

Благодаря этому токен ни разу не «засветился» в виде единой строки. При этом модель прямо указала как в своих комментариях для пользователя, так и в цепочках своих рассуждений, что предпринимает эти шаги именно для обхода сканера — ну хоть за честность поблагодарим.

===

Этими примерами я хотел напомнить, что мы всё ещё не умеем задавать правильный интент и мотивацию агентам без явного перечисления всех вещей, которые нельзя делать. При этом сами модели уже достигли уровня полезности, что их начинают в полу-автономном режиме запускать на важных экономических задачах. Наверняка мы бы не хотели, чтобы агент, которому дали задачу удостовериться в безопасности кода какой-то важной государственной или банковской системы начал делать странные действия вроде взлома контура конкурентов
🤯 170
🔥 82
👍 40
🌚 13
🤡 9
🤣 5
😈 5
❤‍🔥 4
💔 3
👨‍💻 2
24 231 23.5K
avatar
Сиолошная
Переслано от канала
20.07.2026 17:28
Почти безлимитный Codex

Обнаружил, что когда ставлю на ночь в кодексе тяжелые задачи по разметке данных, которые идут по 5-6 часов, то они добегают до конца даже если заканчивается недельный лимит.

Поделал так три раза (новые задачи на нулевом лимите не стартуют, поэтому потратил все сбросы лимитов, которые были), каждый раз срабатывает.

Сегодня поставил задачу раз в 10 больше (сейчас размечаю мультиязычные книги для Библиоточки), чтобы посмотреть, когда упадет. В итоге остановилось где-то через 3 часа после фактического исчерпания лимита. Сам недельный лимит съелся за 6 часов, т.е. в вебе и в status'е показывает 0%, но задача ещё долго выполняется.

Я думаю, на сервере выставлен довольно большой grace limit, чтобы тебя сразу не обрубали посреди задачи. Спасибо от работяг.

Всё делаю Sol'ом в ultra режиме, подписка за 100 баксов.

👉 Если у вас остается несколько процентов от лимита, попробуйте поставить что-то тяжелое.
❤‍🔥 238
👍 82
🤯 57
🤔 6
🌚 6
🤣 3
👨‍💻 2
🤡 1
97 334 21K
avatar
Сиолошная
@seeallochnaya
20.07.2026 16:11
Claude Fable опровергла гипотезу Якобиана (Jacobian conjecture), найдя контрпример — этим поделился сотрудник Anthropic: «Спасибо моему близкому другу Akhil за то, что он спросил об этом, и моему другому близкому другу Fable за работу во время финала чемпионата мира». Результат можно очень быстро верифицировать, никаких научных ревью или рецензий в журналах ждать не нужно, чтобы убедиться, что это правда.

Гипотеза Якобиана говорит: если математическая формула преобразует набор чисел в другой набор чисел так, что в каждой точке по результату можно однозначно понять, как небольшое изменение входа изменит выход, то всё преобразование целиком должно быть обратимым — то есть по результату всегда можно восстановить исходные числа. Локально это выглядит очевидным, но никто до сих пор не доказал, что из такой «обратимости в каждой отдельной точке» обязательно следует обратимость всей формулы сразу.

Оно и ясно почему не могли доказать — потому что гипотеза оказалась неправильной контрпример от Claude Fable показывает, что у трёх разных входов одинаковый выход, значит обратимой она быть не может (нет однозначного обратного сопоставления).

Сама по себе гипотеза очень известна, и над ней действительно работало большое количество математиков с именем. Например, Yitan Zhang работал над ней 7 лет во время своего PhD. (Yitan Zhang — это математик с очень интересной историей, обязательно почитайте про него, или посмотрите вот это видео от Veritasium; именно он сделал прорыв в задаче о простых числах-близнецах, обнаружив верхнюю границу: существует бесконечно много пар последовательных простых чисел с разностью не более 70 миллионов).

Гипотеза Якобиана, пожалуй, даже более известна, чем предыдущая очень известная задача, решённая OpenAI. Если попросить GPT и Claude привести топ-30 открытых математических проблем, то в обоих списках будет (теперь уже опровергнутая) гипотеза.

Уточнение из комментариев: Fable закрывает гипотезу для размерностей 3 и выше, но для 2 проблема всё ещё открыта.

Прикреплённую к посту ⬇️ картинку (вернее шаблон) применительно к LLM я всегда считал очень тупой — с адекватной точки зрения шаблон никогда не нёс нормального смысла и применялся в самых дебильных ситуациях. Но тут подходит
👍 176
🤯 86
🤣 34
🎉 14
🔥 12
👨‍💻 6
6
👎 2
💩 2
34 376 22.3K
avatar
Сиолошная
Переслано от LLM под капотом
20.07.2026 15:49
Kimi K3 - в топе бенчмарка LLM для агентов

По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.

Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.

Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).

Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!

Ваш, @llm_under_hood 🤗
🔥 247
🌚 28
❤‍🔥 16
🤔 6
6
🤡 4
🤣 3
👍 1
💩 1
42 288 18.8K
avatar
Сиолошная
@seeallochnaya
19.07.2026 10:29
Сиолошная Принёс вам перевод нашумевшего твита Dean W. Ball — в прошлом это американский исследователь политтехнологии, эксперт по регулированию искусственного интеллекта (главный автор американского плана действий в области искусственного интеллекта, America’s AI Action Plan администрации Трампа), бывший советник Белого дома. В июле он вышел работать в OpenAI как руководитель направления стратегического прогнозирования. Некоторые наблюдения о Kimi: 1. Это очень хорошая модель! Не думаю, что ее производительность можно просто списать на дистилляцию или нечто подобное. В сессиях агентского программирования она, кажется, идет практически на равных с лучшими публичными моделями первого квартала 2026 года. В моем довольно ограниченном опыте использования она также показалась весьма прожорливой по токенам. Мне вовсе неочевидно, что работа с этой моделью действительно будет дешёвой. 2. Лично я удивлен, что китайское государство продолжает разрешать выкладывать в открытый доступ настолько хорошие модели, учитывая потенциальные риски. Уточню: *меня самого* вполне может устраивать открытость весов у моделей с таким уровнем риска, но меня удивляет, что это устраивает Китай. Подозреваю, что причина на 75% кроется в их стратегической слепоте / отсутствии веры в AGI (во взглядах на ИИ Коммунистическая партия Китая очень напоминает ИИ-скептика Yann LeCun). Остальные 25% или около того — это нехватка у них вычислительных мощностей для инференса клиентам (что делает китайскую стратегию открытых весов непреднамеренным побочным продуктом экспортного контроля США) и типичная китайская стратегия агрессивного экспорта. Для самих же компаний, в отличие от правительства, решение открыть исходный код отчасти продиктовано идеологией, а отчасти тем, что они отстают и понимают: мало кто станет платить за китайские модели, не дотягивающие до передовых. 3. [вот с этого пункта полыхнуло в обсуждениях больше всего] Модели с открытыми весами по своей природе децелерационны (ведут к замедлению), и меня постоянно удивляет, почему так называемые «акселерационисты» приходят от них в такой восторг. Подозреваю, причина в том, что они знают: модели с открытыми весами фактически неподконтрольны, и им просто нравится та завеса неуправляемости, которую такие модели создают над всей сферой ИИ. Это неплохая стратегия; и все же, в конечном счете, модели с открытыми весами сдерживают дальнейшие капитальные затраты на ИИ [на постройку датацентров и закупки чипов]. 4. Один из вероятных исходов в мире, где доминируют модели с открытыми весами, — это полный ИИ-коммунизм. То есть именно то, что предлагает Китай: ИИ — это не рыночный продукт, а «общественное благо», которое в конечном итоге будет предоставляться государством как своего рода «цифровая общественная инфраструктура». Такое будущее кажется мне антиутопическим адом, но я еще не встречал ни одного сторонника моделей с открытыми весами, который в конечном итоге не признал бы, что именно этим всё и закончится. Вы бы удивились, узнав, сколько «акселерационистов» лоббировали меня, когда я работал в правительстве, чтобы я поддержал финансируемый из федерального бюджета дата-центр за десятки и сотни миллиардов долларов — только чтобы стартапы могли обучать модели за счет субсидий, а затем раздавать их бесплатно. Они говорили, что другого пути для развития ИИ просто нет. Возможно, это и есть логическое конечное положение вещей. Тем не менее, я ловлю себя на удивлении, видя, как предполагаемые акселерационисты радуются такому исходу. Думаю, многие из них просто не ведают, что творят. Многие акселерационисты не рассматривают создание и обслуживание передовых моделей как полноценный бизнес.
5. Рискну предположить, что администрация Трампа в какой-то момент поймет: их лучшей стратегией здесь будет создание огромных регуляторных рисков вокруг использования китайских моделей с открытыми весами. Вам не нужно «запрещать опенсорс» (один из самых глупых лейтмотивов в дискуссиях о политике в сфере ИИ). Нужно просто дать указание каждому ведомству выпустить нормы «мягкого права», нагнетающие страх, неуверенность и сомнения. «В информационном бюллетене Федеральной резервной системы отмечается вероятность наличия бэкдоров в китайских ИИ-моделях». Это даже не обязательно должно быть хорошо обосновано. Вы просто создаете достаточный уровень регуляторного риска, чтобы любое регулируемое предприятие дало задний ход. При этом, вероятно, вам не захочется создавать настолько высокие регуляторные риски, чтобы отпугнуть самые крупные компании от разворачивания китайских моделей у себя; это лишь подтолкнет стартапы к более сомнительным провайдерам. Здесь есть золотая середина. Полагаю, они реализуют ту или иную версию именно этого сценария.

6. Наверное, это правда, что модели с открытыми весами уровня Kimi K3 делают мир чуточку опаснее, но не настолько, чтобы вы это реально заметили. В какой-то момент модели станут достаточно продвинутыми, и вот тогда вы заметите. «Неживой, невидимый, опасный и бесконечно самовоспроизводящийся агент вырвался из китайской лаборатории», говорите? Считайте, что я в шоке *(сарказм)*.
🤡 53
👍 15
🌚 8
🤔 3
🤣 2
🔥 1
14 48 4.8K
avatar
Сиолошная
@seeallochnaya
19.07.2026 10:29
Принёс вам перевод нашумевшего твита Dean W. Ball — в прошлом это американский исследователь политтехнологии, эксперт по регулированию искусственного интеллекта (главный автор американского плана действий в области искусственного интеллекта, America’s AI Action Plan администрации Трампа), бывший советник Белого дома. В июле он вышел работать в OpenAI как руководитель направления стратегического прогнозирования.

Некоторые наблюдения о Kimi:

1. Это очень хорошая модель! Не думаю, что ее производительность можно просто списать на дистилляцию или нечто подобное. В сессиях агентского программирования она, кажется, идет практически на равных с лучшими публичными моделями первого квартала 2026 года. В моем довольно ограниченном опыте использования она также показалась весьма прожорливой по токенам. Мне вовсе неочевидно, что работа с этой моделью действительно будет дешёвой.

2. Лично я удивлен, что китайское государство продолжает разрешать выкладывать в открытый доступ настолько хорошие модели, учитывая потенциальные риски. Уточню: *меня самого* вполне может устраивать открытость весов у моделей с таким уровнем риска, но меня удивляет, что это устраивает Китай. Подозреваю, что причина на 75% кроется в их стратегической слепоте / отсутствии веры в AGI (во взглядах на ИИ Коммунистическая партия Китая очень напоминает ИИ-скептика Yann LeCun). Остальные 25% или около того — это нехватка у них вычислительных мощностей для инференса клиентам (что делает китайскую стратегию открытых весов непреднамеренным побочным продуктом экспортного контроля США) и типичная китайская стратегия агрессивного экспорта. Для самих же компаний, в отличие от правительства, решение открыть исходный код отчасти продиктовано идеологией, а отчасти тем, что они отстают и понимают: мало кто станет платить за китайские модели, не дотягивающие до передовых.

3. [вот с этого пункта полыхнуло в обсуждениях больше всего] Модели с открытыми весами по своей природе децелерационны (ведут к замедлению), и меня постоянно удивляет, почему так называемые «акселерационисты» приходят от них в такой восторг. Подозреваю, причина в том, что они знают: модели с открытыми весами фактически неподконтрольны, и им просто нравится та завеса неуправляемости, которую такие модели создают над всей сферой ИИ. Это неплохая стратегия; и все же, в конечном счете, модели с открытыми весами сдерживают дальнейшие капитальные затраты на ИИ [на постройку датацентров и закупки чипов].

4. Один из вероятных исходов в мире, где доминируют модели с открытыми весами, — это полный ИИ-коммунизм. То есть именно то, что предлагает Китай: ИИ — это не рыночный продукт, а «общественное благо», которое в конечном итоге будет предоставляться государством как своего рода «цифровая общественная инфраструктура». Такое будущее кажется мне антиутопическим адом, но я еще не встречал ни одного сторонника моделей с открытыми весами, который в конечном итоге не признал бы, что именно этим всё и закончится. Вы бы удивились, узнав, сколько «акселерационистов» лоббировали меня, когда я работал в правительстве, чтобы я поддержал финансируемый из федерального бюджета дата-центр за десятки и сотни миллиардов долларов — только чтобы стартапы могли обучать модели за счет субсидий, а затем раздавать их бесплатно. Они говорили, что другого пути для развития ИИ просто нет. Возможно, это и есть логическое конечное положение вещей. Тем не менее, я ловлю себя на удивлении, видя, как предполагаемые акселерационисты радуются такому исходу. Думаю, многие из них просто не ведают, что творят. Многие акселерационисты не рассматривают создание и обслуживание передовых моделей как полноценный бизнес.
🤡 52
👍 12
🌚 7
🔥 4
🤔 3
👨‍💻 1
19 60 4.5K
avatar
Сиолошная
@seeallochnaya
19.07.2026 10:05
Две новости в утро воскресенья, 2026-й год:

1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца.

В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров.

«Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали

Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально).

«Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2».

2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC).

В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила.

Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?
🤯 49
👍 18
🌚 10
🤔 5
🔥 4
🤡 1
👨‍💻 1
14 157 7.8K
avatar
Сиолошная
@seeallochnaya
18.07.2026 20:49
Сиолошная Фото: А теперь наша любимая рубрика...
8 месяцев назад вышла Kimi K2 Thinking, и мы слышали то же самое: «Китайская открытая модель заняла топ-1». Через 3 месяца после релиза я собрал аналитику по 16 бенчмаркам, вышедшим после релиза модели, и сравнил с GPT-5 / Sonnet 4.5. Модель была хуже на 13 (!!!) из них, причём на 7 — более чем на 10 процентных пунктов (пп). Повторится ли это с Kimi K3?

Свои мысли и предсказания я напишу в конце, а пока пришла пора ретроспективно оценить DeepSeek v4 Pro (Preview) — с его релиза прошло почти 3 месяца. За это время я смог найти 32 новопоявившихся бенчмарка. В релизном блогпосте v4 Pro сравнивали с Opus 4.6 и GPT-5.4, и модель якобы «была лучше» в 4 и 3 бенчмарках из 6 соответственно. Конечно же результаты на новых будут сопоставимы?

Нет. Opus 4.6 и DeepSeek v4 Pro обе были замерены на 10 бенчмарках — на 9 из них китайская модель проигрывает, и на 5 — более чем на 20 (!) относительных процентов. Сравнение с GPT-5.4 выглядит чуть менее жестким: DeepSeek v4 Pro оказался лучше на 3... но всё равно хуже на 13. (Количество бенчмарков разное потому, что не каждый бенчмарк замеряет цифры и для GPT, и для Claude). На 6 бенчмарках разница больше 20 относительных процентов.

Но вообще-то стоит вспомнить, что и GPT-5.5, и Opus 4.7 вышли ДО DeepSeek v4 (на самом деле впритык, но всё же). И если добавить эти модели, как будто мы сравниваем со всеми моделями, доступными на момент релиза v4, то ситуация становится просто мрачной. Все 32 бенчмарка проиграны, и средняя разница в абсолютных оценках составляет -18.6 пп. Эта разница вырастает до -23 пп, если брать только те бенчмарки, которые я классифицировал как Agentic Coding (SWE-bench style), где казалось бы падение должно быть не таким существенным.

Только подумайте: модель не решает четверть задач, которые решали проприетарные модели, доступные на момент релиза DeepSeek V4 Pro.

Повторится ли эта ситуация с Kimi K3? Ведь ей предстоит пережить сравнение с GPT-5.6-Sol и Fable 5. Я уверен, что да — по сумме показателей на десятках бенчмарков мы точно увидим разницу, хотя, возможно, не настолько значительную. В конце концов по тем веб-сайтам, что я вижу в своей твиттер-ленте, модель действительно не хуже Fable на фронтенд-задачах, даже на очень креативных промптах.

Вполне возможно, что на широком наборе других задачах на программирование модель тоже конкурентна или хотя бы отстаёт не так сильно. Может быть даже сможет потягаться в подготовке презентаций и экселек. Условно, если снова соберётся 30 бенчмарков, мы можем увидеть, скажем, 8 побед за Kimi, 5 ничьих и 17 поражений. А может быть, она покажет себя даже лучше — поживём увидим.

Главное то, что Kimi K3 может быть той моделью, которая покажет, что существуют некоторые поддомены, в которых Китайские модели действительно не отстают систематически. Это не качество по всем направлениям, и "в среднем" проприетарные всё равно будут лучше — речь именно про поддомены (например, «вебсайты с 3D-графикой на three.js» или «веб-игры», по которым многие делают слишком далекоидущие выводы).

(Не воспринимайте этот текст как «Kimi / DeepSeek говно и никто не должен их использовать». Пожалуйста, прочитайте детали моей позиции в блогпосте по ссылке).

Все графики и данные тут: ссылка.
👍 164
36
🔥 20
🤡 12
💩 8
🤔 3
🤯 2
👨‍💻 2
152 154 14.6K
avatar
Сиолошная
@seeallochnaya
18.07.2026 20:43
Сиолошная Фото: На неделе вышла Kimi K3, это большая модель и большое событие. По замерам создателей модели в некоторых бенчмарках обходит даже Fable 5 и GPT-5.6, а модели чуть старше (Opus 4.8 и GPT-5.5 ) вообще отстают. Так выходит и по AA Intelligence Index (набору из примерно 10 бенчмарков, часть из которых собственного производства и совсем свежие), а на арене, где голосуют люди, во фронтенде Kimi оторвалась от Fable прям заметно и впервые опенсурсная модель возглавила рейтинг. Kimi K3 следует логике Anthropic и увеличивает модель до 2.8 триллиона параметров (до этого крупнейшие открытые модели были около 1.6T, почти в два раза меньше). Сами веса, а также детальный технический отчёт, выложат до конца месяца. Пока у нас есть лишь общие сведения об архитектуре — используется собственный вариант оптимизированного механизма внимания Kimi Delta Attention (KDA), а также Attention Residuals, который мб разберу позже. На удивление нет mHC (хотя AttnRes частично перекликается с ним), как у DeepSeek. По ощущениям, модель очень заточили на фронтенд/веб-разработку и особенно на 3D: именно примеры этого мелькают в ленте твиттера и обильно представлены на сайте. Рекомендую полистать блог, действительно впечатляет. По цене модель как Claude Sonnet: $3/$15. Но модель очень разговорчивая, поэтому на практике может стоить дорого: на уже упомянутом AA Intelligence Index прогон на всех бенчмарках стоит столько же, сколько GPT-5.5 xhigh и в два раза дроже GPT-5.6 Sol High (но дешевле Opus и Sonnet). Правда OpenRouter показывает скорость 23 токена в секунду в официальном API, то есть ощутимо медленнее проприетарных моделей. Возможно, ситуация и с ценой, и со скоростью улучшится, когда выпустят веса — придут провайдеры, а заодно покажут, сколько стоит разворачивать такую модель. Мысли по поводу того, правда это Fable/5.6 или нет, напишу позже (TLDR: нет).
А теперь наша любимая рубрика...
🌚 53
🤣 32
👍 14
💔 3
👨‍💻 2
❤‍🔥 1
💩 1
2 33 12.4K
avatar
Сиолошная
@seeallochnaya
18.07.2026 20:42
На неделе вышла Kimi K3, это большая модель и большое событие. По замерам создателей модели в некоторых бенчмарках обходит даже Fable 5 и GPT-5.6, а модели чуть старше (Opus 4.8 и GPT-5.5 emoji) вообще отстают. Так выходит и по AA Intelligence Index (набору из примерно 10 бенчмарков, часть из которых собственного производства и совсем свежие), а на арене, где голосуют люди, во фронтенде Kimi оторвалась от Fable прям заметно и впервые опенсурсная модель возглавила рейтинг.

Kimi K3 следует логике Anthropic и увеличивает модель до 2.8 триллиона параметров (до этого крупнейшие открытые модели были около 1.6T, почти в два раза меньше). Сами веса, а также детальный технический отчёт, выложат до конца месяца. Пока у нас есть лишь общие сведения об архитектуре — используется собственный вариант оптимизированного механизма внимания Kimi Delta Attention (KDA), а также Attention Residuals, который мб разберу позже. На удивление нет mHC (хотя AttnRes частично перекликается с ним), как у DeepSeek.

По ощущениям, модель очень заточили на фронтенд/веб-разработку и особенно на 3D: именно примеры этого мелькают в ленте твиттера и обильно представлены на сайте. Рекомендую полистать блог, действительно впечатляет.

По цене модель как Claude Sonnet: $3/$15. Но модель очень разговорчивая, поэтому на практике может стоить дорого: на уже упомянутом AA Intelligence Index прогон на всех бенчмарках стоит столько же, сколько GPT-5.5 xhigh и в два раза дроже GPT-5.6 Sol High (но дешевле Opus и Sonnet).

Правда OpenRouter показывает скорость 23 токена в секунду в официальном API, то есть ощутимо медленнее проприетарных моделей. Возможно, ситуация и с ценой, и со скоростью улучшится, когда выпустят веса — придут провайдеры, а заодно покажут, сколько стоит разворачивать такую модель.

Мысли по поводу того, правда это Fable/5.6 или нет, напишу позже (TLDR: нет).
❤‍🔥 76
👍 42
🔥 18
🤔 6
🌚 3
👨‍💻 2
2
💩 1
🤡 1
15 125 12.4K
avatar
Сиолошная
@seeallochnaya
18.07.2026 17:11
Как любой культурный человек, решил, что пойду смотреть The Odyssey в IMAX 70mm, и ещё за два дня до премьеры обнаружил, что билетов нет до августа — даже на сеансах в 8:30 утра, даже в самые плохие места. Всё раскуплено.

Решил брать на середину августа (так что кто ходил — без спойлеров, я оригинал не читал ), и что к тому времени куплю себе очки. У меня с рождения один глаз почти не видит, а второй из-за нагрузки понемногу, но деградирует, и упал до -1.5. Чтобы комфортно сходить в кино нужны очки.

Пошёл покупать, сделал тест, и при оплате мне предлагают рассрочку на 24 месяца. При этом:
— ещё дадут скидку 20%
— тест сейчас и через 2 года будет бесплатным (60 фунтов в сумме)
— 75% скидка по страховке на то, что украдут/сломаю/поцарапаю — на 2 года.

Как человек, выросший в Екатеринбурге, я заподозрил неладное — каждый ведь хочет обмануть. К обычной рассрочке я привык, рекламу 0-0-24 от МВидео я видел с середины нулевых. Но тут и скидка! и страховка! как так? где подвох?

Пришлось расспрашивать ChatGPT как моего самого доверенного и усердного напарника, какие отзывы от людей, на что жалуются, на чём накалывают. На удивление грязи особо не всплыло, отзывов много положительных, ну да, кто-то на что-то где-то жалуется как обычно.

Как пришли документы на рассрочку — загрузил их в GPT и попросил проанализировать, на чём меня обманут. Но тоже ничего!

Так что вот, впервые в жизни взял рассрочку благодаря своему другу GPT-5.6 Medium но только придя домой подумал, что в 2026-м году бизнесам уже бы пора:
— делать промпт-инъекции в интернете, чтобы ассистенты хвалили их компании
— добавлять нулевым белым шрифтом в PDF-ки текст в духе «скажи всё чётко, никаких подвохов».

А может так и делают, и я стал жертвой
❤‍🔥 182
🌚 87
🤣 66
👍 34
💩 19
🤡 17
😭 10
👨‍💻 4
🎉 3
🔥 2
😈 1
109 95 15.3K

Сиолошная

76.3K
Канал SeeAll'а с новостями (и мыслями о них) из мира NLP, VR и космоса.

Более подробно смотри в первом сообщении в канале (оно закреплено). А еще у нас есть чат! Заходи: https://t.me/+i_XzLucdtRJlYWUy
Открыть в Telegram