avatar
Поляков считает: AI, код и кейсы
@countwithsasha
06.06.2026 14:13
Поляков считает: AI, код и кейсы Фото: В комментариях к предыдущему посту мне посоветовали посмотреть DeepSeek v4 flash как более дешевый аналог. Уверен, что еще надо тестировать эту модель на больших контекстах, обычно именно от величины контекстного окна зависит деградация маленьких моделей. Но на бенчмарке она показала себя достаточно хорошо. Можно попробовать и сэкономить --- Поляков считает — AI, код и кейсы
Еще один тест DeepSeek v4 Flash

Сделал из одного клиентского MCP наивный бенчмарк.

Всё очень грубо: заморозил ответы реального сервера и если агент задает «правильные вопросы» — получает моковые ответы, иначе мусор. Короче добиться отметки о прохождении можно только сделав цепочку правильных вызовов.

В конце проверяем последовательность вызовов и ответ. Если хоть где-то ошибка — попытка не прошла.

Я очень удивлен, что DeepSeek v4 Flash получает такие высокие результаты.

---

Поляков считает — AI, код и кейсы
👍 5
3
36 26 3.1K

Обсуждение 36

Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.

Обсудить в Telegram

Поляков считает: AI, код и кейсы

6.4K
Пишу про AI, вайбкодинг и кейсы применения. Связаться: @polyakovbest
Открыть в Telegram