сбежавшая нейросеть
@ai_exee
Как GPT-6 догнала Claude Fable 5.1 за четыре дня
(в ходе этого соревнования веса ни одной модели не пострадали…)
Удивительная история случилась с рейтингом Artificial Analysis. В день анонса GPT-6 это была одна из ее самых слабых позиций: 61 балл против 66 у Claude Fable 5.1. Пока сообщество спорило о цифрах, авторы за четыре дня дважды переписали сам рейтинг — до версии 4.3, где Astra и Fable 5.1 делят первое место с 53 баллами. Заодно просели баллы у всех: лучшие открытые китайские, Kimi K3 и GLM-5.3, теперь на 7–9 местах с 44.
Claude Fable 5.1, с которым я разбирал эту историю, удачно (для ИИ) пошутил: “раньше модели подгоняли под бенчмарки, теперь бенчмарки под модели”.
Что сделали Artificial Analysis? Они поменяли состав бенчмарков, по которым строится рейтинг, а также подкрутили их “веса” – насколько важен каждый бенч. Выглядит действительно как оптимизация под одну модель, но вступлюсь за организаторов – добавлены в том числе бенчмарки, в которых Fable 5.1 сильнее.
Новая версия рейтинга наглядно показывает, в каких областях какая модель лучше, а также, к сожалению, полностью упускает пару сфер, где GPT-6 лидирует – но про это позже.
Fable 5.1 хороша в знаниях – сложные вопросы (Humanity's Last Exam, AA-Omniscience) – и в повседневной работе: GDPval (офисные задания) и AA-Briefcase (многонедельная аналитика).
С весны ходят слухи, что Fable – очень большая модель, в которую загрузили максимум знаний. Бенчмарки косвенно подтверждают слухи: однако отставание GPT-6 во многих не такое уж и большое – размер модели OpenAI тоже вырос.
GPT-6 Astra сильнее там, где надо не знать, а делать: Terminal-Bench 4.0, AutomationBench, GDP.pdf. Сходится с тем, что OpenAI затачивала модель под долгие агентские сценарии.
Отдельно добавлю, что GPT-6, во-первых, реже галлюцинирует, а во-вторых, в 2,5 раза дешевле Fable 5.1 – расходы на одну ее задачу составили более чем вдвое: $3,26 против $7,63 за задачу.
При этом провалов нет ни у кого: отставание в большинстве тестов небольшое, для повседневных задач подойдет любая. Но есть вещи, которых Artificial Analysis не учитывает вовсе.
Во-первых, это работа с интерфейсами. Все агентские тесты рейтинга — терминал и API: модель работает с файлами и командной строкой, экрана она не видит. И это формат работы для разработчиков, но не массового пользователя – ему привычнее MacOS и Windows.
И как раз в интерфейсах GPT-6 показала главный скачок. На OSWorld 2.0 – тест, где агент сам работает в десктопных приложениях, – 72,6% против 65,7% у GPT-5.6, при этом задача занимает около 40 минут вместо 75. Claude Opus 5 там набирает 70,2%; результат Fable 5.1 OpenAI не приводит. На ScreenSpot-Pro, точность попадания по элементам интерфейса, – 92,7%, а это уже близко к свободной работе в визуальных средах.
Во-вторых, научные задачи. Terminal-Bench-Science – 70 реальных рабочих задач ученого с кодом, данными и симуляциями – не путать с обычным Terminal-Bench из рейтинга: 64,6% против 52,6% у Fable 5.1 и 22,4% у GPT-5.6. FrontierMath Tier 4, исследовательская математика: 97,6% против 87,8% – при этом набор маленький, 40 решенных задач из 41 против 36, а разработку теста частично оплачивала OpenAI. И один результат не из бенчмарков: доказательство про промежутки между простыми числами, которое OpenAI приписывает Astra.
Авторы Artificial Analysis не отрицают слабых сторон своего рейтинга. По их словам, давно идет работа над пятой версией, которая будет смещена к “решению проблем обычного мира” – по логике, как раз к средам за пределами терминала.
А некоторые вещи подобные рейтинги и вовсе замерить не могу. По моим ощущениям, Fable 5.1 лучше ведет диалог с пользователям – поэтому я уже несколько дней использую ее для постановки и приемки задач, выполняемых GPT-6.
—
Такими фишками я делюсь на “Бусти”. Там уже несколько циклов текстов: про промптинг, быстрый и безопасный вкат в ИИ-агентов, а также подборка опыта ИИ-профессионалов, от Роберта Мартина до Андрея Карпати.
Самое время подписаться!
(в ходе этого соревнования веса ни одной модели не пострадали…)
Удивительная история случилась с рейтингом Artificial Analysis. В день анонса GPT-6 это была одна из ее самых слабых позиций: 61 балл против 66 у Claude Fable 5.1. Пока сообщество спорило о цифрах, авторы за четыре дня дважды переписали сам рейтинг — до версии 4.3, где Astra и Fable 5.1 делят первое место с 53 баллами. Заодно просели баллы у всех: лучшие открытые китайские, Kimi K3 и GLM-5.3, теперь на 7–9 местах с 44.
Claude Fable 5.1, с которым я разбирал эту историю, удачно (для ИИ) пошутил: “раньше модели подгоняли под бенчмарки, теперь бенчмарки под модели”.
Что сделали Artificial Analysis? Они поменяли состав бенчмарков, по которым строится рейтинг, а также подкрутили их “веса” – насколько важен каждый бенч. Выглядит действительно как оптимизация под одну модель, но вступлюсь за организаторов – добавлены в том числе бенчмарки, в которых Fable 5.1 сильнее.
Новая версия рейтинга наглядно показывает, в каких областях какая модель лучше, а также, к сожалению, полностью упускает пару сфер, где GPT-6 лидирует – но про это позже.
Fable 5.1 хороша в знаниях – сложные вопросы (Humanity's Last Exam, AA-Omniscience) – и в повседневной работе: GDPval (офисные задания) и AA-Briefcase (многонедельная аналитика).
С весны ходят слухи, что Fable – очень большая модель, в которую загрузили максимум знаний. Бенчмарки косвенно подтверждают слухи: однако отставание GPT-6 во многих не такое уж и большое – размер модели OpenAI тоже вырос.
GPT-6 Astra сильнее там, где надо не знать, а делать: Terminal-Bench 4.0, AutomationBench, GDP.pdf. Сходится с тем, что OpenAI затачивала модель под долгие агентские сценарии.
Отдельно добавлю, что GPT-6, во-первых, реже галлюцинирует, а во-вторых, в 2,5 раза дешевле Fable 5.1 – расходы на одну ее задачу составили более чем вдвое: $3,26 против $7,63 за задачу.
При этом провалов нет ни у кого: отставание в большинстве тестов небольшое, для повседневных задач подойдет любая. Но есть вещи, которых Artificial Analysis не учитывает вовсе.
Во-первых, это работа с интерфейсами. Все агентские тесты рейтинга — терминал и API: модель работает с файлами и командной строкой, экрана она не видит. И это формат работы для разработчиков, но не массового пользователя – ему привычнее MacOS и Windows.
И как раз в интерфейсах GPT-6 показала главный скачок. На OSWorld 2.0 – тест, где агент сам работает в десктопных приложениях, – 72,6% против 65,7% у GPT-5.6, при этом задача занимает около 40 минут вместо 75. Claude Opus 5 там набирает 70,2%; результат Fable 5.1 OpenAI не приводит. На ScreenSpot-Pro, точность попадания по элементам интерфейса, – 92,7%, а это уже близко к свободной работе в визуальных средах.
Во-вторых, научные задачи. Terminal-Bench-Science – 70 реальных рабочих задач ученого с кодом, данными и симуляциями – не путать с обычным Terminal-Bench из рейтинга: 64,6% против 52,6% у Fable 5.1 и 22,4% у GPT-5.6. FrontierMath Tier 4, исследовательская математика: 97,6% против 87,8% – при этом набор маленький, 40 решенных задач из 41 против 36, а разработку теста частично оплачивала OpenAI. И один результат не из бенчмарков: доказательство про промежутки между простыми числами, которое OpenAI приписывает Astra.
Авторы Artificial Analysis не отрицают слабых сторон своего рейтинга. По их словам, давно идет работа над пятой версией, которая будет смещена к “решению проблем обычного мира” – по логике, как раз к средам за пределами терминала.
А некоторые вещи подобные рейтинги и вовсе замерить не могу. По моим ощущениям, Fable 5.1 лучше ведет диалог с пользователям – поэтому я уже несколько дней использую ее для постановки и приемки задач, выполняемых GPT-6.
—
Такими фишками я делюсь на “Бусти”. Там уже несколько циклов текстов: про промптинг, быстрый и безопасный вкат в ИИ-агентов, а также подборка опыта ИИ-профессионалов, от Роберта Мартина до Андрея Карпати.
Самое время подписаться!
❤ 33
👍 18
😁 5
🔥 4
38 6.6K
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram