NGI | Влад Корнышев про AI и создание AI-продуктов
@NGI_ru
Как спарсить данные по 300+ каналам за час с помощью AI-агента и сэкономить время и деньги (работает с любыми открытыми источниками)
Сейчас я с головой погружен в организацию нашей конференции по ИИ (кто пропустил - регистрация там уже открыта и уже почти 300 участников), и одна из горящих задач - это маркетинг и продвижение. Базово спикеры, конечно, пиарят ивент сами, но для хорошего охвата нужны посевы в профильных каналах.
Моя команда ранее собрала шорт-лист из нескольких сотен каналов, но это был просто список. Чтобы не слить бюджет впустую, нужно было принимать решения на основе цифр: актуальные подписчики, охваты, ERR, рекламный охват за 24 часа и контакты админов. Часть данных устарела, части не было вообще.
Вариантов решения было три:
1. Сойти с ума, прокликивая 300 ссылок в TGStat вручную и проклиная все.
2. Нанять ассистента (мало времени на онбординг и работу + стоит денег).
3. Написать парсер на Python (слишком много возни для разовой задачи).
Я выбрал четвертый путь: делегировать это AI-агенту с доступом к браузеру. Я использовал Perplexity Comet, но подойдет любой агент с уверенным Browser Use.
Как это работает
Я дал агенту доступ к Google-таблице и написал четкую инструкцию пройтись по списку и обогатить данные.
Промпт, который я использовал:
Нюансы, без которых агент затупит
Чтобы это сработало и агент не завис на середине, нужно учитывать ограничения LLM. Вот мои выводы из опыта с подобными задачами:
1. Ешьте слона по частям
У любого агента есть лимит контекста, после которого он либо остановится либо затупит. Если попросить сделать все 300 каналов разом, он начнет галлюцинировать или потеряет задачу. Я просил обрабатывать пачки по 20 каналов. Сделал 20 -> пишем "продолжай, следующие 20".
2. Снижайте автономность
Это контринтуитивно, но чем меньше свободы вы даете агенту, тем лучше он работает. Если просто сказать "найди данные в интернете", он начнет "думать": куда пойти, на что нажать, анализировать структуру страниц. Это жрет контекст и время.
В промпте я дал жесткий алгоритм: "Зайди на TGStat -> Нажми кнопку X -> Посмотри в поле Y". Так мы экономим его "мыслительный ресурс" на навигацию и своими размышлениями куда нажать он не засирает контекст.
3. Форматирование данных
Агенты любят копировать "как есть". Если он вставит в таблицу "10 500" с пробелом, то формулы в Google Sheets не сработают. Пропишите в промпте требование убирать пробелы в числах заранее, чтобы не тратить время на чистку данных руками.
4. Гигиена контекста
Даже при итеративном подходе контекст забивается. После обработки примерно 100 каналов я просто открывал новый чат, скидывал ему ту же таблицу и просил начать с 101-й строки. Это работает быстрее, чем заставлять агента ползти дальше.
Итог
Вместо найма человека или часов ручной работы я потратил 10 минут на составление промпта и периодически кликал кнопку "продолжай", занимаясь параллельно другими делами. Задача решена ценой одной подписки за $20.
Используйте этот подход для любых задач, где нужно собрать и структурировать данные из открытых источников.
🚀 Влад Корнышев про AI и создание AI-продуктов
Сейчас я с головой погружен в организацию нашей конференции по ИИ (кто пропустил - регистрация там уже открыта и уже почти 300 участников), и одна из горящих задач - это маркетинг и продвижение. Базово спикеры, конечно, пиарят ивент сами, но для хорошего охвата нужны посевы в профильных каналах.
Моя команда ранее собрала шорт-лист из нескольких сотен каналов, но это был просто список. Чтобы не слить бюджет впустую, нужно было принимать решения на основе цифр: актуальные подписчики, охваты, ERR, рекламный охват за 24 часа и контакты админов. Часть данных устарела, части не было вообще.
Вариантов решения было три:
1. Сойти с ума, прокликивая 300 ссылок в TGStat вручную и проклиная все.
2. Нанять ассистента (мало времени на онбординг и работу + стоит денег).
3. Написать парсер на Python (слишком много возни для разовой задачи).
Я выбрал четвертый путь: делегировать это AI-агенту с доступом к браузеру. Я использовал Perplexity Comet, но подойдет любой агент с уверенным Browser Use.
Как это работает
Я дал агенту доступ к Google-таблице и написал четкую инструкцию пройтись по списку и обогатить данные.
Промпт, который я использовал:
Итоговая таблица должна включать:
1. Название канала
2. Ссылку на канал
3. Количество подписчиков
4. Контакт автора (если есть)
5. Средний охват 1 публикации
6. ERR
7. Средний рекламный охват 1 публикации за 24 часа.
Алгоритм поиска информации:
1. Перейди на https://tgstat.com/ru, в поиске вбей название нужного канала.
2. Выбери нужный канал, на странице нажми кнопку 'Статистика канала'.
3. Забери данные из разделов 'Подписчики', 'Средний охват', 'Средний рекламный охват 1 публикации'. Контакт админа можешь найти в описании канала на этой же странице.
4. Сохрани данные в таблицу. Числа вводи без разделителей разрядов (1000, а не 1 000).
5. Приведи таблицу к аккуратному виду (заливка, шрифты).Нюансы, без которых агент затупит
Чтобы это сработало и агент не завис на середине, нужно учитывать ограничения LLM. Вот мои выводы из опыта с подобными задачами:
1. Ешьте слона по частям
У любого агента есть лимит контекста, после которого он либо остановится либо затупит. Если попросить сделать все 300 каналов разом, он начнет галлюцинировать или потеряет задачу. Я просил обрабатывать пачки по 20 каналов. Сделал 20 -> пишем "продолжай, следующие 20".
2. Снижайте автономность
Это контринтуитивно, но чем меньше свободы вы даете агенту, тем лучше он работает. Если просто сказать "найди данные в интернете", он начнет "думать": куда пойти, на что нажать, анализировать структуру страниц. Это жрет контекст и время.
В промпте я дал жесткий алгоритм: "Зайди на TGStat -> Нажми кнопку X -> Посмотри в поле Y". Так мы экономим его "мыслительный ресурс" на навигацию и своими размышлениями куда нажать он не засирает контекст.
3. Форматирование данных
Агенты любят копировать "как есть". Если он вставит в таблицу "10 500" с пробелом, то формулы в Google Sheets не сработают. Пропишите в промпте требование убирать пробелы в числах заранее, чтобы не тратить время на чистку данных руками.
4. Гигиена контекста
Даже при итеративном подходе контекст забивается. После обработки примерно 100 каналов я просто открывал новый чат, скидывал ему ту же таблицу и просил начать с 101-й строки. Это работает быстрее, чем заставлять агента ползти дальше.
Итог
Вместо найма человека или часов ручной работы я потратил 10 минут на составление промпта и периодически кликал кнопку "продолжай", занимаясь параллельно другими делами. Задача решена ценой одной подписки за $20.
Используйте этот подход для любых задач, где нужно собрать и структурировать данные из открытых источников.
🚀 Влад Корнышев про AI и создание AI-продуктов
👍 25
🔥 19
❤ 9
2 100 2.5K
Обсуждение 2
Обсуждение не доступно в веб-версии. Чтобы написать комментарий, перейдите в приложение Telegram.
Обсудить в Telegram