Хз как люди пользуются OpenRouter
По дурости тестили на нем систему, которая на локалках должна будет работать в контуре клиента, и это такая боль:
- низкие лимиты у провайдеров
- хрен пойми у кого реально есть поддержка structured output, даже если заявлено
- а у кого есть, часто некорректная – натолкнулся на имплементацию с сортировкой ключей в алфавитном порядке 🥴
- нет моделей в целевом кванте
- в какой-то момент провайдер просто лег на два часа (а другие не поддерживают норм SO для нужной модели, ага)
Да, можно сразу тестить на целевой системе, но а) это нужно получать доступ в контур клиента и б) ждать пока одна его карточка все обработает
А у нас autoresearch-like флоу, где агенты в 4 потока эксперименты крутят, нам такое не подходит
Короче, надо было сразу арендовать GPU и поднимать там, а не страдать херней. Благо это делается в один промпт (
если настроено управление браузером):
Codex, сходи через мой браузер на hf и подними мне vLLM на h200 с <model-name> на <context-len> токенов максимального контекста с <concurrency-num> параллельных запросов. Посмотри в документации и на реддите рекомендации по конфигам и проверь, что мои требования вообще выполнимы или предложи трейдоф
P.s. если нужно часто, установите huggingface_hub и дайте токен админский, чтобы агент через браузер не мучался
P.p.s. не забываем потом остановить ноду, а то можно без штанов остаться (если хочется автоматически, юзаем
scale_to_zero_timeout=20)
Альтернативы:
runpod.io,
vast.ai,
modal.com,
cloud.ru (не реклама, а зря)
Хз, для кого-то это очевидно, но у нас это первый проект, на котором сошлись локальные модели, отсутствие доступа к железу клиента, и огромный трафик autoresearch подхода
Обсуждение 35
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram