avatar
Сергей Булаев AI 🤖
@sergiobulaev
18.11.2024 16:37
Тут делятся свежими, ещё не опубликованными данным , об исследовании Claude и o1-preview на способность делать исследования в области ИИ. Гипотетически - дорабатывать и перерабатывать себя.

Тест был необычный - его намеренно сделали максимально сложным для людей, чтобы понять реальный разрыв между ИИ и топовыми исследователями.

Claude выиграл у o1-preview в пяти тестах из семи, в двух с серьезным отрывом. GPT взял два оставшихся теста, один - очень уверенно. Интересный момент: модели давали пробовать каждые 30 минут в течение 8 часов, потому что так они показывали лучший результат. Когда дали только одну попытку на 8 часов - Claude начал проигрывать.

Но самое важное - лучшие исследователи-люди все равно набрали в два раза больше баллов, чем любая из моделей. Claude смог дотянуться до уровня среднего исследователя только в двух задачах, o1 - в одной. И это при том, что задачи были довольно напряжные для людей - например, написать языковую модель без использования деления или провести эксперименты с минимумом вычислительных ресурсов.

​​​​​​​​​​​​​​​​Сергей Булаев AI 🤖 - об AI и не только
10
6
4
1 12 2.3K

Обсуждение 1

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Сергей Булаев AI 🤖

12.5K
Publora.com - коннектор для ваших AI агентов к соцсетям.

Co.actor - помощники по созданию постов для вас и вашей команды

Так же в прошлом соосновывал: Купи Батон! Lifehacker.ru, Взахлёб!

tg: @sergeonsamui
in: linkedin.com/in/sbulaev
Открыть в Telegram