Сработаемся?
Навеяно обсуждением бенчмарков на недавнем
стриме и тестированием Fable.
Смотрите, какая штука: кажется, фронтирные модели уже пересекли планку "достаточно" для "средних" задач во многих проектах по разработке.
А раз модели выдают решения, разницы между которыми по качеству не видно, то выбор перестаёт быть вопросом оценки модели в абстрактных попугаях.
Вместо этого на первый план выходит характеристика, которую не измерить публичными бенчами: "
а сработаемся ли?".
В ней и то, впишется ли модель в ваши процессы, и насколько она инициативна, и даже попадает ли она в удобный для вас стиль общения (нередко - определяющая характеристика, как оказывается!).
● Ну т.е.
бенчмарки - резюме модели, сигнал к тому, чтобы в принципе обратить на неё внимание.
●
Эвалы - тестовое задание, вы даёте модели какие-то типовые для вашей работы задачи.
●
Вайб-чеки - испытательный срок, с моделью нужно провести некоторое время, чтобы понять, сможете ли вы с ней эффективно работать.
И именно совместная работа на реальных задачах становится самым информативным этапом выбора.
—
Кстати, взял бы я на работу Fable?
Вайб-чек ещё в процессе, но в рамках подписки - да, это
no brainer, как говорят в наших деревнях.
А какой модели/агента вам достаточно?
И достаточно ли :)
#короткопост
Обсуждение 23
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram