14000 открытых IT вакансий на одном дашборде
Большой апдейт проекта анализа IT зарплат
VILKY. Расскажу что нового в пет-проекте, с какими проблемами столкнулись и что, в итоге, получилось. Мы всё так же, втроём, понемногу пилим сервис. Последние пару месяцев работали над сбором и обработкой данных.
Что нового?
.
ДАННЫЕ
Сначала о самом заметном изменении. Мы добавили в дашборд 2 новые платформы вакансий:
🔹
FINDER. Этот сервис раньше назывался
Finder.vc. Он начал работу в 2020 как сервис поиска удалёнки. Сейчас там не только удалёнка и IT вакансии занимают 10% от всех. Много вакансий для начинающих специалистов. В день там более 10000 активных вакансий. Говорят что каждая вакансия проходит модерацию.
Основной ТГ канал сервиса, 300k подписчиков
🔹
VSETI. Сервис IT вакансий, активных в день - более 300. Но важно не количество, а то что много уникальных вакансий.
Основной ТГ канал, 57k подписчиков.
Только добавление вакансий этих сервисов увеличило в 4-5 раз общее число вакансий на дашборде. Благодаря Finder, появилось много нетоповых, и их тоже интересно исследовать.
Finder мы собрали вообще весь (2млн+ архивных вакансий). Парсеры Finder были на мне. Рома (пишет в канал
Kotolitic) делал парсер для VSETI. Автоматизацию делал Никита.
.
ETL
Серьёзные изменения в ETL процессах. Полноценно работает DBT, там производятся трансформации данных. Пересмотрена и частично реализована логика сбора вакансий со снепшотов на инкремент. Это и многое другое делал Никита, про всё написал у себя в канале '
Joni in Web'.
.
AI И LLM
Отказались от YandexGPT - набольшом объёме данных нормализация съедает много денег, надо делать своё. Никита написал на sklearn нормализацию. Яндексу больше не платим 🙂. У вакансий Finder нет скиллов и грейдов, поэтому используем скрипты для их извлечения.
Эксперименты с внешними LLM даром не прошли - мы собрали достаточно информации для понимания того что будем собирать собственными LLM, и для чего LLM не нужны. Например, для сбора минимальной и максимальной зарплат достаточно старых добрых регулярных выражений. Работали с YandexGPT, а он иногда в вакансиях находил какие-то числа (зарплаты), которых нет в описании. Непонятно откуда вообще брал. Дальше планируем эксперименты с предобученной моделью.
.
ДАШБОРД И ДАЙДЖЕСТЫ
Дашборд допиливался под новые платформы. Сделали дополнительное поле под локацию: части света, выделили Казахстан и Беларусь. Столкнулись с ограничением Гугл шитов. Их используем для обновления даша на Tableau Public (прямо из базы он тянуть не может). У гугл шитов есть предел 10MB на скачивание данных через драйвер Google Drive. Данных стало заметно больше, поэтому, 7 дней выходили за предел. Ограничили историчность двумя днями. Скорее всего, оставим только 1 день - непонятно, кому недельные тренды вообще нужны.
Сделали новые дайджесты по вакансиям с требованиями AI и требованиями 1C.
Дайджесты по специализациям сейчас вылетают по лимиту гугл шитов. Для них отдельно соберём агрегированные данные.
Траблы. Их хватало: косяки нормализации LLM, вылеты запросов по памяти, нехватка ресурсов для ETL, ограничения публичных сервисов, тормоза дашборда. Без этого - никуда 😁.
Сейчас
14000 вакансий в дашборде. В базе - несколько миллионов. Почти 70 000 просмотров дашборда за всё время.
Появилось много кейсов для анализа данных. Их присылают пользователи. На реализацию всего времени не хватает, но более четко прорисовываются границы того кому и зачем нужен сервис. Фидбек вдохновляет. Спасибо, что пишете!
Обсуждение 9
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram