avatar
Refat Talks: Tech & AI
@nobilix
31.10.2025 18:22
RLI - довольно уникальный в своем роде серьезный бенчмарк, который меряет не абстрактные навыки, а способность AI делать настоящую оплачиваемую работу, сравнивая лоб в лоб с фрилансерами на Upwork. И он показал что AI-агенты проваливают 97.5% реальных задач проектов. Довольно интересно, хотя не все так просто - давайте разбираться.

Итак буквально на днях исследователи из Scale выпустили Remote Labor Index (RLI) - взяли реальные фриланс-проекты, которые люди делали за деньги. От 3D-анимации до архитектурных планов, от создания игр до научных документов. Общая стоимость работ - $144K. Средний проект занимал у человека 29 часов и стоил $633. Сравнивали GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Manus.

Лучший агент (Manus) выполнил 2.5% проектов. Manus заработал $1720 из возможных $144K.

Важный нюанс: RLI тестирует не производственные операции типа "суммаризируй документ" или "напиши функцию", а проекты - законченную работу, которые фрилансеры выполняли за деньги. Методология: наняли 358 верифицированных фрилансеров с Upwork, собрали 550 проектов, отфильтровали до 240 качественных. Каждый проект - это brief + input files + human deliverable, который реальный клиент принял и оплатил. Оценку делали вручную обученные эксперты (94.4% agreement между оценщиками) по принципу "принял бы reasonable client эту работу или нет".

Внимательный читатель заметит: где software development? Ведь именно там агенты показывают лучшие результаты - SWE-Bench и прочие coding benchmarks. Код в RLI есть (веб-разработка, игры), но его намеренно меньше - реальный рынок гораздо разнообразнее.

Методологические вопросы

Странная история с выбором моделей: сравнивают специализированную агентную систему Manus с продуктами широкого назначения типа Claude и GPT. Было бы логичнее включить Claude Code и обвесить его тулами, например.

Второй момент - воспроизводимость. Такой замороченный бенчмарк с ручной оценкой дорого поддерживать. Да и открыли только 10 из 240 проектов (чтобы избежать contamination), manual evaluation занимает в среднем 11-17 минут на проект. Масштабировать это сложно, надеюсь не забросят.

Где побеждает и где проваливается

AI хорошо справился с узким набором задач:
- Аудио: звуковые эффекты, разделение вокала от инструментов
- Генерация картинок: логотипы, ads
- Написание отчетов
- Data visualization и веб-скрейпинг
То есть там, где либо чистая генерация контента, либо простой код.

Провалы кластеризуются так:
- 45.6% - низкое качество работы (буквально "child-like drawings", любительский уровень)
- 35.7% - неполные deliverables (видео на 8 секунд вместо 8 минут, missing files)
- 17.6% - технические проблемы (битые файлы, неправильные форматы)
- 14.8% - неконсистентность (дизайн дома меняется между разными 3D-видами)

Кстати, забавная деталь: GPT-5 лучше работал через CLI (1.7% automation), чем через computer-use интерфейс (0.8%).

Практические выводы

Для разработчиков AI-продуктов:
- Не обещайте клиентам полную автоматизацию сложных процессов. Даже близко не готовы.
- Human-in-the-loop очень важен.
- Узкие задачи работают и чем дальше тем лучше.

Для всех:
- Ваша работа в безопасности (пока)
- Но Elo scores растут с каждой новой моделью - траектория идет вверх.
- Бенчмарк показывает: между "AI производит что-то похожее на правду" и "AI делает работу профессионального уровня" - огромная пропасть.
- 2.5% success rate одновременно и отрезвляет, и показывает прогресс: ну типа представьте, машине дали коммерческий проект на вход как человеку, не подготавливая как-то специально и не поправляя по ходу выполнения, и она на полном автомате хоть в каком-то проценте случаев поняла и выдала результат, который условно приняли и оплатили.

Исследование детальное, стоит полистать: https://arxiv.org/abs/2510.26787

У них есть интерактивный сайт, где можно сравнить работы людей и моделей - реально интересно посмотреть на конкретные примеры провалов и успехов.

🔥 ➕ 🔁
🔥 41
12
👍 10
❤‍🔥 3
17 130 6.1K

Обсуждение 17

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Refat Talks: Tech & AI

11.4K
Заметки про технологии, GenAI и глобал стартапы, прагматично и без лишнего хайпа. Эксперт по разработке и внедрению enterprise-grade AI автоматизаций, строю AI-first компании. Co-founder devstark.com и spreadsimple.com
лс @refatametov
Открыть в Telegram