Матвей про ИИ
@matveiproai
1 32
Ещё важнее, что Astra теперь можно поправлять прямо во время выполнения задачи. Она принимает новое сообщение, корректирует текущий план и продолжает работу с уже полученными результатами. В API появился и асинхронный вызов инструментов — модель может заниматься другими частями задачи, пока ждёт ответ от программы или человека.
В OSWorld 2.0, где модели дают реальные задачи внутри операционной системы, результат вырос с 65,7% у Sol до 72,6% у Astra.
В ScreenSpot-Pro, где нужно правильно понять интерфейс по изображению и найти нужный элемент, — с 76,9% до 92,7%.
В AutomationBench, который проверяет автоматизацию реальной профессиональной работы, — с 18,1% до 41,4%.
— Claude Opus 4.6 — 0,862
— BerryLM-XL от Wildberries & Russ — 0,835
— Cotype Pro 3 от MWS — 0,824
— GPT-5.4 — 0,821
— GigaChat 3.1 Ultra — 0,712
— DeepSeek V4 Flash — 0,677
— GPT-5.4 Pro — 0,90
— Claude Opus 4.6 — 0,85
— DeepSeek V3.2 — 0,43
— GigaChat 2 Max — 0,40
— YandexGPT Pro 5.1 — 0,23
И ещё неприятное сравнение: прямой API DeepSeek V4 Flash сейчас стоит примерно 12 ₽ за миллион входящих и 24 ₽ за миллион исходящих токенов. То есть даже после российского снижения цен Китай остаётся дешевле.
Сбер в пресс-релизе пишет, что для хранения и обработки пользовательских данных ГигаАгент использует только отечественные платформы. При этом документация Cloud.ru прямо говорит: внешние модели работают через внешние API, и при их использовании данные передаются за пределы инфраструктуры Cloud.ru. Так работают Claude, Gemini и Kimi из доступного сейчас списка. Как именно здесь разделены хранение данных, агентная инфраструктура и инференс модели, из публичного описания мне не стало понятнее.
По токенам Cloud.ru примерно вдвое дороже прямых API Anthropic и Google, а относительно некоторых российских агрегаторов — на 45–67% дороже. При этом отдельно оплачивается время работы самого агента. Самым дорогим российским посредником Cloud.ru не является, но дешёвым доступом к зарубежным моделям это тоже назвать трудно.
Косачёва_мнение
CLAUDE.md;CLAUDE.md короче 200 строк. Специализированные инструкции лучше хранить в Skills: они загружаются по необходимости и не занимают контекст каждой сессии.Изучи ~/.claude/usage-data/report.html.
Найди только проблемы, которые повторялись
в нескольких сессиях.
Для каждой покажи:
1. конкретный пример;
2. предлагаемое правило;
3. куда его поместить: CLAUDE.md или Skill;
4. какую потерю времени это устранит.
Не изменяй файлы до моего подтверждения.