Э
Этихлид
@etechlead
11.06.2026 18:49
Сработаемся?

Навеяно обсуждением бенчмарков на недавнем стриме и тестированием Fable.

Смотрите, какая штука: кажется, фронтирные модели уже пересекли планку "достаточно" для "средних" задач во многих проектах по разработке.

А раз модели выдают решения, разницы между которыми по качеству не видно, то выбор перестаёт быть вопросом оценки модели в абстрактных попугаях.

Вместо этого на первый план выходит характеристика, которую не измерить публичными бенчами: "а сработаемся ли?".
В ней и то, впишется ли модель в ваши процессы, и насколько она инициативна, и даже попадает ли она в удобный для вас стиль общения (нередко - определяющая характеристика, как оказывается!).

● Ну т.е. бенчмарки - резюме модели, сигнал к тому, чтобы в принципе обратить на неё внимание.
Эвалы - тестовое задание, вы даёте модели какие-то типовые для вашей работы задачи.
Вайб-чеки - испытательный срок, с моделью нужно провести некоторое время, чтобы понять, сможете ли вы с ней эффективно работать.

И именно совместная работа на реальных задачах становится самым информативным этапом выбора.



Кстати, взял бы я на работу Fable?
Вайб-чек ещё в процессе, но в рамках подписки - да, это no brainer, как говорят в наших деревнях.

А какой модели/агента вам достаточно?
И достаточно ли :)

#короткопост
🔥 9
👍 6
3
❤‍🔥 1
👏 1
23 15 1.3K

Обсуждение 23

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram
Э

Этихлид

6.4K
Канал техлида с мыслями об AI, IT и спорте.

https://t.me/etechlead/6 - содержание

https://t.me/etechlead/8 - о канале

https://t.me/+NgQZbosvypEyYWQ6 - чат канала, там отвечаю(т) быстрее :)

(без рекламы)
Открыть в Telegram