OpenAI выпустила GPT‑6 Astra.
М
одель сама находит уязвимости и достигает паритета с человеком по тесту ARC‑AGI‑3
Самая дикая цифра релиза —
99,9% на ARC-AGI-3. У GPT-5.6 Sol было 7,8%.
ARC-AGI специально проверяет способность решать совершенно новые задачи, где нельзя просто достать ответ из памяти. Модели приходится по ходу эксперимента понять правила среды, пробовать действия и учиться на результате.
На 96% уровней Astra уже превзошла человеческий ориентир по эффективности действий.
Похожий скачок произошёл в математике. На
FrontierMath Tier 4 — наборе крайне сложных задач исследовательского уровня — Astra получила
98%.
OpenAI сильно прокачала управление компьютером. Astra может работать с браузером и обычными программами, заполнять формы, менять данные в CRM, делать документы, пользоваться инженерным ПО, тестировать созданный код через интерфейс и исправлять ошибки по тому, что видит на экране.
В OSWorld 2.0, где модели дают реальные задачи внутри операционной системы, результат вырос с 65,7% у Sol до 72,6% у Astra.
В ScreenSpot-Pro, где нужно правильно понять интерфейс по изображению и найти нужный элемент, — с 76,9% до 92,7%.
В AutomationBench, который проверяет автоматизацию реальной профессиональной работы, — с 18,1% до 41,4%.
То есть GPT-6 одновременно сделала огромный скачок в абстрактном мышлении и стала заметно лучше выполнять руками то, что придумала головой.
Кроме того,
OpenAI будут давать по бесплатному сбросу квоты использования всем подписчикам каждый день, пока нет доступа к Astra. Их можно использовать в течении месяца.
🐊
Матвей про ИИ в MAX
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram