Тут
делятся свежими, ещё не опубликованными данным , об исследовании Claude и o1-preview на способность делать исследования в области ИИ. Гипотетически - дорабатывать и перерабатывать себя.
Тест был необычный - его намеренно сделали максимально сложным для людей, чтобы понять реальный разрыв между ИИ и топовыми исследователями.
Claude выиграл у o1-preview в пяти тестах из семи, в двух с серьезным отрывом. GPT взял два оставшихся теста, один - очень уверенно. Интересный момент: модели давали пробовать каждые 30 минут в течение 8 часов, потому что так они показывали лучший результат. Когда дали только одну попытку на 8 часов - Claude начал проигрывать.
Но самое важное - лучшие исследователи-люди все равно набрали в два раза больше баллов, чем любая из моделей. Claude смог дотянуться до уровня среднего исследователя только в двух задачах, o1 - в одной. И это при том, что задачи были довольно напряжные для людей - например, написать языковую модель без использования деления или провести эксперименты с минимумом вычислительных ресурсов.
Сергей Булаев AI 🤖 - об AI и не только
Обсуждение 1
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram