avatar
Refat Talks: Tech & AI
@nobilix
09.08.2025 15:57
#ReDigest

Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.

Дайджест недели:

- Релиз GPT-5 наделал много шума поэтому постараюсь несколькими пунктами подытожить что вам вероятно нужно знать.
- по бенчмаркам выглядит солидно: 74.9% на SWE-bench Verified, 46.2% на HealthBench Hard. Главное достижение - борьба с галлюцинациями и снизили "подхалимаж" с 14.5% до 6% - модель стала менее льстивой.
- Единая модель с умным роутером вместо зоопарка версий - система сама решает когда нужен быстрый ответ, а когда thinking режим. Похоже OpenAI хотят избавить юзеров от выбора моделей сосредоточив на продукте. На демо даже попрощались со старыми моделями, 4o потом пришлось пообещать вернуть правда.
- Драматическое снижение цен в API - $1.25 за миллион входных токенов против $15 у Claude Opus, что может спровоцировать ценовую войну.
- Пользователи массово жалуются что модель "глупее" предыдущих версий, Альтман признал проблемы с роутером и пообещал фиксы.


- OpenAI выпустили свои первые опенсорс-модели - gpt-oss-120b и gpt-oss-20b под Apache 2.0. Это MoE-архитектура с ризонингом в трех режимах, младшая помещается в 16GB памяти. По метрикам приближаются к o4-mini и o3-mini, на некоторых бенчах обходят o1 и GPT-4o.

- Anthropic выпустили Claude Opus 4.1 с небольшими но значимыми приростами - +2% на SWE-bench, +2.5% на AIME 25, +4% на агентских задачах. Для насыщенных бенчмарков даже +0.1% уже достижение, обещают еще много крупных обновлений.

- Проблема с "золотым стандартом" бенчмарка: независимые аналитики обнаружили что 29% ответов в Humanity's Last Exam содержат ошибки и противоречат научной литературе. Проблема в том, что экспертам давали только 5 минут на проверку каждого ответа, плюс намеренно мудрили с формулировками.

- Google зарелизили Genie 3 для генерации интерактивных 3D-миров по текстовому запросу - 720p, 24 FPS, долгосрочная память объектов, возможность менять погоду и сцену прямо во время симуляции. Работает несколько минут против 10-20 секунд у Genie 2.

- Cloudflare обвинила Perplexity в незаконном парсинге сайтов через маскировку под обычный Chrome, игнорируя robots.txt и блокировки официальных ботов. Cloudflare исключила Perplexity из верифицированных ботов и добавила блокировку для всех клиентов.

- Claude Code получил автоматическую проверку на уязвимости через /security-review и интеграцию с GitHub Actions. Ищет SQL-инъекции, XSS и утечки данных, сразу предлагает исправления.

- Qwen обновили локальную модель Qwen3-4B в версиях Thinking и Instruct с расширенным контекстом до 256к токенов. Выглядит как имба для локального запуска с достойными приростами по метрикам.

- Google договорился с энергокомпаниями приостанавливать AI-нагрузки при пиках потребления электроэнергии. Соглашение с Indiana Michigan Power и Tennessee Valley Authority - некритические AI-задачи будут откладываться когда все включают кондиционеры.

- Alibaba представила Qwen-Image с 20B параметров - модель для генерации изображений с нормальной поддержкой иероглифов и азиатских языков. Западные модели до сих пор рисуют каракули вместо китайских символов, а эта правильно генерирует даже рукописный текст.

- ElevenLabs добавили генерацию музыки в свою AI-платформу, методично строя полный стек для звука. Главное отличие от Suno/Udio - заранее договорились с правообладателями после судебных исков от RIAA. Качество пока неоднозначное, но для джинглов сойдет.

- Забавное: Fiverr записали рекламный ролик, высмеивая ИИ и Vibe Coding, видимо решили что лучшая защита от AI-угрозы - это троллинг.

- Интересное поизучать: Similarweb опубликовали отчет о реферальном трафике от AI-ботов: 1.13 млрд визитов в июне (+357% год к году). ChatGPT генерирует 80%+ AI-трафика, новостные сайты показали рост 770%. Бизнесам пора адаптировать SEO под AI-платформы, а не только Google - поковыряйте, там много интересного от гиганта веб статистики.
🔥 17
👍 10
4
❤‍🔥 1
2 24 3.6K

Обсуждение 2

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Refat Talks: Tech & AI

11.4K
Заметки про технологии, GenAI и глобал стартапы, прагматично и без лишнего хайпа. Эксперт по разработке и внедрению enterprise-grade AI автоматизаций, строю AI-first компании. Co-founder devstark.com и spreadsimple.com
лс @refatametov
Открыть в Telegram