Refat Talks: Tech & AI
@nobilix
RLI - довольно уникальный в своем роде серьезный бенчмарк, который меряет не абстрактные навыки, а способность AI делать настоящую оплачиваемую работу, сравнивая лоб в лоб с фрилансерами на Upwork. И он показал что AI-агенты проваливают 97.5% реальных задач проектов. Довольно интересно, хотя не все так просто - давайте разбираться.
Итак буквально на днях исследователи из Scale выпустили Remote Labor Index (RLI) - взяли реальные фриланс-проекты, которые люди делали за деньги. От 3D-анимации до архитектурных планов, от создания игр до научных документов. Общая стоимость работ - $144K. Средний проект занимал у человека 29 часов и стоил $633. Сравнивали GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Manus.
Лучший агент (Manus) выполнил 2.5% проектов. Manus заработал $1720 из возможных $144K.
Важный нюанс: RLI тестирует не производственные операции типа "суммаризируй документ" или "напиши функцию", а проекты - законченную работу, которые фрилансеры выполняли за деньги. Методология: наняли 358 верифицированных фрилансеров с Upwork, собрали 550 проектов, отфильтровали до 240 качественных. Каждый проект - это brief + input files + human deliverable, который реальный клиент принял и оплатил. Оценку делали вручную обученные эксперты (94.4% agreement между оценщиками) по принципу "принял бы reasonable client эту работу или нет".
Внимательный читатель заметит: где software development? Ведь именно там агенты показывают лучшие результаты - SWE-Bench и прочие coding benchmarks. Код в RLI есть (веб-разработка, игры), но его намеренно меньше - реальный рынок гораздо разнообразнее.
Методологические вопросы
Странная история с выбором моделей: сравнивают специализированную агентную систему Manus с продуктами широкого назначения типа Claude и GPT. Было бы логичнее включить Claude Code и обвесить его тулами, например.
Второй момент - воспроизводимость. Такой замороченный бенчмарк с ручной оценкой дорого поддерживать. Да и открыли только 10 из 240 проектов (чтобы избежать contamination), manual evaluation занимает в среднем 11-17 минут на проект. Масштабировать это сложно, надеюсь не забросят.
Где побеждает и где проваливается
AI хорошо справился с узким набором задач:
- Аудио: звуковые эффекты, разделение вокала от инструментов
- Генерация картинок: логотипы, ads
- Написание отчетов
- Data visualization и веб-скрейпинг
То есть там, где либо чистая генерация контента, либо простой код.
Провалы кластеризуются так:
- 45.6% - низкое качество работы (буквально "child-like drawings", любительский уровень)
- 35.7% - неполные deliverables (видео на 8 секунд вместо 8 минут, missing files)
- 17.6% - технические проблемы (битые файлы, неправильные форматы)
- 14.8% - неконсистентность (дизайн дома меняется между разными 3D-видами)
Кстати, забавная деталь: GPT-5 лучше работал через CLI (1.7% automation), чем через computer-use интерфейс (0.8%).
Практические выводы
Для разработчиков AI-продуктов:
- Не обещайте клиентам полную автоматизацию сложных процессов. Даже близко не готовы.
- Human-in-the-loop очень важен.
- Узкие задачи работают и чем дальше тем лучше.
Для всех:
- Ваша работа в безопасности (пока)
- Но Elo scores растут с каждой новой моделью - траектория идет вверх.
- Бенчмарк показывает: между "AI производит что-то похожее на правду" и "AI делает работу профессионального уровня" - огромная пропасть.
- 2.5% success rate одновременно и отрезвляет, и показывает прогресс: ну типа представьте, машине дали коммерческий проект на вход как человеку, не подготавливая как-то специально и не поправляя по ходу выполнения, и она на полном автомате хоть в каком-то проценте случаев поняла и выдала результат, который условно приняли и оплатили.
Исследование детальное, стоит полистать: https://arxiv.org/abs/2510.26787
У них есть интерактивный сайт, где можно сравнить работы людей и моделей - реально интересно посмотреть на конкретные примеры провалов и успехов.
🔥 ➕ 🔁
Итак буквально на днях исследователи из Scale выпустили Remote Labor Index (RLI) - взяли реальные фриланс-проекты, которые люди делали за деньги. От 3D-анимации до архитектурных планов, от создания игр до научных документов. Общая стоимость работ - $144K. Средний проект занимал у человека 29 часов и стоил $633. Сравнивали GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Manus.
Лучший агент (Manus) выполнил 2.5% проектов. Manus заработал $1720 из возможных $144K.
Важный нюанс: RLI тестирует не производственные операции типа "суммаризируй документ" или "напиши функцию", а проекты - законченную работу, которые фрилансеры выполняли за деньги. Методология: наняли 358 верифицированных фрилансеров с Upwork, собрали 550 проектов, отфильтровали до 240 качественных. Каждый проект - это brief + input files + human deliverable, который реальный клиент принял и оплатил. Оценку делали вручную обученные эксперты (94.4% agreement между оценщиками) по принципу "принял бы reasonable client эту работу или нет".
Внимательный читатель заметит: где software development? Ведь именно там агенты показывают лучшие результаты - SWE-Bench и прочие coding benchmarks. Код в RLI есть (веб-разработка, игры), но его намеренно меньше - реальный рынок гораздо разнообразнее.
Методологические вопросы
Странная история с выбором моделей: сравнивают специализированную агентную систему Manus с продуктами широкого назначения типа Claude и GPT. Было бы логичнее включить Claude Code и обвесить его тулами, например.
Второй момент - воспроизводимость. Такой замороченный бенчмарк с ручной оценкой дорого поддерживать. Да и открыли только 10 из 240 проектов (чтобы избежать contamination), manual evaluation занимает в среднем 11-17 минут на проект. Масштабировать это сложно, надеюсь не забросят.
Где побеждает и где проваливается
AI хорошо справился с узким набором задач:
- Аудио: звуковые эффекты, разделение вокала от инструментов
- Генерация картинок: логотипы, ads
- Написание отчетов
- Data visualization и веб-скрейпинг
То есть там, где либо чистая генерация контента, либо простой код.
Провалы кластеризуются так:
- 45.6% - низкое качество работы (буквально "child-like drawings", любительский уровень)
- 35.7% - неполные deliverables (видео на 8 секунд вместо 8 минут, missing files)
- 17.6% - технические проблемы (битые файлы, неправильные форматы)
- 14.8% - неконсистентность (дизайн дома меняется между разными 3D-видами)
Кстати, забавная деталь: GPT-5 лучше работал через CLI (1.7% automation), чем через computer-use интерфейс (0.8%).
Практические выводы
Для разработчиков AI-продуктов:
- Не обещайте клиентам полную автоматизацию сложных процессов. Даже близко не готовы.
- Human-in-the-loop очень важен.
- Узкие задачи работают и чем дальше тем лучше.
Для всех:
- Ваша работа в безопасности (пока)
- Но Elo scores растут с каждой новой моделью - траектория идет вверх.
- Бенчмарк показывает: между "AI производит что-то похожее на правду" и "AI делает работу профессионального уровня" - огромная пропасть.
- 2.5% success rate одновременно и отрезвляет, и показывает прогресс: ну типа представьте, машине дали коммерческий проект на вход как человеку, не подготавливая как-то специально и не поправляя по ходу выполнения, и она на полном автомате хоть в каком-то проценте случаев поняла и выдала результат, который условно приняли и оплатили.
Исследование детальное, стоит полистать: https://arxiv.org/abs/2510.26787
У них есть интерактивный сайт, где можно сравнить работы людей и моделей - реально интересно посмотреть на конкретные примеры провалов и успехов.
🔥 ➕ 🔁
🔥 41
❤ 12
👍 10
❤🔥 3
17 130 6.1K
Обсуждение 17
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram