Инференс
Компании в РФ, кажется, проходят путь от вопроса как внедрить AI, к вопросу как его оптимизировать. А если конкретно, как сделать оптимизацию инференса.
Подходов достаточно много как на уровне каждого конкретного pipeline, так и на уровне железа. Например, часть операций делать на легкой модели - часть уже отдавать в дорогую трилионную. Идут эксперименты с китайскими картами, правда, пока прямо success strories не видел.
Из бизнесового, мне очень нравится кейс
Dystil AI - ребята высаживаются в enterprise небольшой супер продвинутой командой и выжимают экономию OPEX.
Также всем советую обратить внимание на их research и opensource вещи. Недвно выложили
репу с оптимизацией промптов, правда мы пока не тестили.
Обсуждение 0
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram