Refat Talks: Tech & AI
@nobilix
#ReDigest
Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.
Дайджест недели:
- Релиз GPT-5 наделал много шума поэтому постараюсь несколькими пунктами подытожить что вам вероятно нужно знать.
- OpenAI выпустили свои первые опенсорс-модели - gpt-oss-120b и gpt-oss-20b под Apache 2.0. Это MoE-архитектура с ризонингом в трех режимах, младшая помещается в 16GB памяти. По метрикам приближаются к o4-mini и o3-mini, на некоторых бенчах обходят o1 и GPT-4o.
- Anthropic выпустили Claude Opus 4.1 с небольшими но значимыми приростами - +2% на SWE-bench, +2.5% на AIME 25, +4% на агентских задачах. Для насыщенных бенчмарков даже +0.1% уже достижение, обещают еще много крупных обновлений.
- Проблема с "золотым стандартом" бенчмарка: независимые аналитики обнаружили что 29% ответов в Humanity's Last Exam содержат ошибки и противоречат научной литературе. Проблема в том, что экспертам давали только 5 минут на проверку каждого ответа, плюс намеренно мудрили с формулировками.
- Google зарелизили Genie 3 для генерации интерактивных 3D-миров по текстовому запросу - 720p, 24 FPS, долгосрочная память объектов, возможность менять погоду и сцену прямо во время симуляции. Работает несколько минут против 10-20 секунд у Genie 2.
- Cloudflare обвинила Perplexity в незаконном парсинге сайтов через маскировку под обычный Chrome, игнорируя robots.txt и блокировки официальных ботов. Cloudflare исключила Perplexity из верифицированных ботов и добавила блокировку для всех клиентов.
- Claude Code получил автоматическую проверку на уязвимости через
- Qwen обновили локальную модель Qwen3-4B в версиях Thinking и Instruct с расширенным контекстом до 256к токенов. Выглядит как имба для локального запуска с достойными приростами по метрикам.
- Google договорился с энергокомпаниями приостанавливать AI-нагрузки при пиках потребления электроэнергии. Соглашение с Indiana Michigan Power и Tennessee Valley Authority - некритические AI-задачи будут откладываться когда все включают кондиционеры.
- Alibaba представила Qwen-Image с 20B параметров - модель для генерации изображений с нормальной поддержкой иероглифов и азиатских языков. Западные модели до сих пор рисуют каракули вместо китайских символов, а эта правильно генерирует даже рукописный текст.
- ElevenLabs добавили генерацию музыки в свою AI-платформу, методично строя полный стек для звука. Главное отличие от Suno/Udio - заранее договорились с правообладателями после судебных исков от RIAA. Качество пока неоднозначное, но для джинглов сойдет.
- Забавное: Fiverr записали рекламный ролик, высмеивая ИИ и Vibe Coding, видимо решили что лучшая защита от AI-угрозы - это троллинг.
- Интересное поизучать: Similarweb опубликовали отчет о реферальном трафике от AI-ботов: 1.13 млрд визитов в июне (+357% год к году). ChatGPT генерирует 80%+ AI-трафика, новостные сайты показали рост 770%. Бизнесам пора адаптировать SEO под AI-платформы, а не только Google - поковыряйте, там много интересного от гиганта веб статистики.
Продолжаем субботнюю рубрику, тут я кратко рассказываю про новости из мира технологий и AI, которые привлекли мое внимание.
Дайджест недели:
- Релиз GPT-5 наделал много шума поэтому постараюсь несколькими пунктами подытожить что вам вероятно нужно знать.
- по бенчмаркам выглядит солидно: 74.9% на SWE-bench Verified, 46.2% на HealthBench Hard. Главное достижение - борьба с галлюцинациями и снизили "подхалимаж" с 14.5% до 6% - модель стала менее льстивой.
- Единая модель с умным роутером вместо зоопарка версий - система сама решает когда нужен быстрый ответ, а когда thinking режим. Похоже OpenAI хотят избавить юзеров от выбора моделей сосредоточив на продукте. На демо даже попрощались со старыми моделями, 4o потом пришлось пообещать вернуть правда.
- Драматическое снижение цен в API - $1.25 за миллион входных токенов против $15 у Claude Opus, что может спровоцировать ценовую войну.
- Пользователи массово жалуются что модель "глупее" предыдущих версий, Альтман признал проблемы с роутером и пообещал фиксы.
- OpenAI выпустили свои первые опенсорс-модели - gpt-oss-120b и gpt-oss-20b под Apache 2.0. Это MoE-архитектура с ризонингом в трех режимах, младшая помещается в 16GB памяти. По метрикам приближаются к o4-mini и o3-mini, на некоторых бенчах обходят o1 и GPT-4o.
- Anthropic выпустили Claude Opus 4.1 с небольшими но значимыми приростами - +2% на SWE-bench, +2.5% на AIME 25, +4% на агентских задачах. Для насыщенных бенчмарков даже +0.1% уже достижение, обещают еще много крупных обновлений.
- Проблема с "золотым стандартом" бенчмарка: независимые аналитики обнаружили что 29% ответов в Humanity's Last Exam содержат ошибки и противоречат научной литературе. Проблема в том, что экспертам давали только 5 минут на проверку каждого ответа, плюс намеренно мудрили с формулировками.
- Google зарелизили Genie 3 для генерации интерактивных 3D-миров по текстовому запросу - 720p, 24 FPS, долгосрочная память объектов, возможность менять погоду и сцену прямо во время симуляции. Работает несколько минут против 10-20 секунд у Genie 2.
- Cloudflare обвинила Perplexity в незаконном парсинге сайтов через маскировку под обычный Chrome, игнорируя robots.txt и блокировки официальных ботов. Cloudflare исключила Perplexity из верифицированных ботов и добавила блокировку для всех клиентов.
- Claude Code получил автоматическую проверку на уязвимости через
/security-review и интеграцию с GitHub Actions. Ищет SQL-инъекции, XSS и утечки данных, сразу предлагает исправления. - Qwen обновили локальную модель Qwen3-4B в версиях Thinking и Instruct с расширенным контекстом до 256к токенов. Выглядит как имба для локального запуска с достойными приростами по метрикам.
- Google договорился с энергокомпаниями приостанавливать AI-нагрузки при пиках потребления электроэнергии. Соглашение с Indiana Michigan Power и Tennessee Valley Authority - некритические AI-задачи будут откладываться когда все включают кондиционеры.
- Alibaba представила Qwen-Image с 20B параметров - модель для генерации изображений с нормальной поддержкой иероглифов и азиатских языков. Западные модели до сих пор рисуют каракули вместо китайских символов, а эта правильно генерирует даже рукописный текст.
- ElevenLabs добавили генерацию музыки в свою AI-платформу, методично строя полный стек для звука. Главное отличие от Suno/Udio - заранее договорились с правообладателями после судебных исков от RIAA. Качество пока неоднозначное, но для джинглов сойдет.
- Забавное: Fiverr записали рекламный ролик, высмеивая ИИ и Vibe Coding, видимо решили что лучшая защита от AI-угрозы - это троллинг.
- Интересное поизучать: Similarweb опубликовали отчет о реферальном трафике от AI-ботов: 1.13 млрд визитов в июне (+357% год к году). ChatGPT генерирует 80%+ AI-трафика, новостные сайты показали рост 770%. Бизнесам пора адаптировать SEO под AI-платформы, а не только Google - поковыряйте, там много интересного от гиганта веб статистики.
🔥 17
👍 10
❤ 4
❤🔥 1
2 24 3.6K
Обсуждение 2
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram