avatar
Матвей про ИИ
@matveiproai
04.09.2026 07:28
OpenAI выпустила GPT‑6 Astra. Модель сама находит уязвимости и достигает паритета с человеком по тесту ARC‑AGI‑3

Самая дикая цифра релиза — 99,9% на ARC-AGI-3. У GPT-5.6 Sol было 7,8%.

ARC-AGI специально проверяет способность решать совершенно новые задачи, где нельзя просто достать ответ из памяти. Модели приходится по ходу эксперимента понять правила среды, пробовать действия и учиться на результате. На 96% уровней Astra уже превзошла человеческий ориентир по эффективности действий.

Похожий скачок произошёл в математике. На FrontierMath Tier 4 — наборе крайне сложных задач исследовательского уровня — Astra получила 98%.

OpenAI сильно прокачала управление компьютером. Astra может работать с браузером и обычными программами, заполнять формы, менять данные в CRM, делать документы, пользоваться инженерным ПО, тестировать созданный код через интерфейс и исправлять ошибки по тому, что видит на экране.

В OSWorld 2.0, где модели дают реальные задачи внутри операционной системы, результат вырос с 65,7% у Sol до 72,6% у Astra.

В ScreenSpot-Pro, где нужно правильно понять интерфейс по изображению и найти нужный элемент, — с 76,9% до 92,7%.

В AutomationBench, который проверяет автоматизацию реальной профессиональной работы, — с 18,1% до 41,4%.


То есть GPT-6 одновременно сделала огромный скачок в абстрактном мышлении и стала заметно лучше выполнять руками то, что придумала головой.

Кроме того, OpenAI будут давать по бесплатному сбросу квоты использования всем подписчикам каждый день, пока нет доступа к Astra. Их можно использовать в течении месяца.

🐊 Матвей про ИИ в MAX
30

Обсуждение 0

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Матвей про ИИ

83
ИИ-инструменты для медиа. Разработка, внедрение, автоматизация. Разбираю что работает, а что нет.

Сайт: matveigerasimov.ru
Телекграм: @matveigerasimov
Канал в МАКС: https://max.ru/id772370772697_biz
Открыть в Telegram