Как запустить сервис парсинга данных в России — разбор MrScraper
MrScraper — сервис, который превращает любую страницу сайта в таблицу Excel без программирования: пишешь обычными словами, что собрать, нейросеть разбирает страницу и отдаёт готовый файл. Его не строили с нуля — Чахьо Суброто купил готовый сервис с трафиком и переделал продукт, а дальше вырос до $142 тысяч в месяц на поиске, рассылках и одном крупном корпоративном контракте. Беру кейс и проверяю на реальных российских цифрах: есть ли спрос, сколько стоит привести клиента и сходится ли экономика. Спрос здесь средний, но рабочий — и ниже видно, на чём именно держится.
Полный кейс оригинала — как MrScraper вырос — в Базе идей →
Что за продукт
Собирает данные с сайтов в таблицу — без кода
Логика такая. Пользователь открывает сервис, указывает страницу и обычными словами описывает, что нужно собрать: названия товаров, цены, контакты, объявления. Нейросеть сама разбирает разметку страницы, обходит постраничную навигацию и отдаёт результат таблицей Excel или кратким описанием. Раньше для этого писали код на Python и настраивали обход блокировок — здесь это убрано под понятный интерфейс в стиле переписки. Аудитория — маркетологи, интернет-магазины, агентства и корпоративные команды, которым регулярно нужны данные с чужих сайтов.
Модель — подписка плюс отдельные договоры с крупными клиентами. Точные тарифы оригинал не раскрывает. Сейчас это около $142 тысяч в месяц ($1,7 млн в год), один основатель, восемь сотрудников, проект прибыльный. Стартовые расходы — около $6,4 тысячи. Сервис не строили с нуля: его купили готовым на площадке для продажи бизнесов, унаследовали поисковый трафик и базу зарегистрированных пользователей, а затем переделали сам продукт.
Что нужно построить
Из чего собрать такой сервис
Самая чувствительная часть — устойчивый сбор данных. Сайты меняют разметку, отдают контент через скрипты, ставят защиту от автоматических заходов и ограничивают частоту запросов. Поэтому под капотом нужны обход блокировок через сменные адреса, очередь заданий и проверка результата. Поверх этого — слой нейросети, который превращает обычное описание задачи в правила разбора страницы, чтобы пользователю не нужно было указывать селекторы вручную. Дальше проще: показать таблицу, дать выгрузку в Excel и подключить оплату подписки.
Сколько стоит работа нейросети. Каждый сбор — это запрос к языковой модели на разбор страницы плюс расходы на прокси и серверы под обход защиты. Это дороже разовой генерации картинки: задача регулярная, объёмы данных большие, а часть сайтов приходится обходить через платные сменные адреса. Эта себестоимость в калькуляторе ниже сидит в ползунке «маржа».
Есть ли спрос
~3 500
запросов в месяц на сбор данных с сайтов
Беру Wordstat — он показывает, сколько раз в месяц вводят запрос. По задаче «собрать данные с сайта» спрос средний, но рабочий: в сумме по рабочим формулировкам около 3–4 тысяч запросов в месяц. Это не массовый потребительский рынок, а деловой инструмент — людей меньше, но задача регулярная и платная.
Вот как распределён прямой спрос — это люди, которым нужно собрать данные с сайтов:
Прямой спрос средний — несколько сотен запросов на каждую рабочую формулировку, в сумме около 3–4 тысяч в месяц. Для деловой ниши это нормальный объём: задача узкая, но повторяется и за неё платят. Отдельно есть очень широкая фраза «парсинг сайтов» — 2 343 запроса в месяц, но в неё попадают и те, кто ищет готовые программы, и те, кто заказывает разработку под себя.
Сколько стоит клик
В Яндексе клик стоит от 12 рублей
Завёл эти фразы в Директ и снял реальные ставки аукциона. Вот ставка, по которой начинаются показы (низ выдачи):
Клик средний по цене — 12–24 рубля на низе выдачи (минимум, по которому начинаются показы) и 80–182 рубля за основной показ. Это дороже, чем в потребительских нишах, и так и должно быть: за этими фразами стоят компании с бюджетом, а не частные пользователи. Ставки сняты из аукциона Яндекс.Директа, это реальные числа. Считать дальше буду по 17 рублям — это нижняя рабочая граница. Дорого это или нет — будет видно на экономике, потому что здесь продаётся не разовая покупка, а подписка на регулярную задачу.
Сходится ли экономика
Сколько стоит привести платящего
MrScraper берёт подписку, поэтому считаю не разовую продажу, а сколько стоит привести одного платящего. Это цена клика, делённая на конверсию в подписку. Беру три уровня ставки — низ выдачи, средний и основной показ — и считаю при разной конверсии. Конверсия — допущение, поэтому диапазоном.
| Цена клика | 1% конверсия | 2% конверсия | 3% конверсия | 4% конверсия |
|---|---|---|---|---|
| 17 ₽низ выдачи | 1 700 ₽ | 850 ₽ | 567 ₽ | 425 ₽ |
| 55 ₽средний показ | 5 500 ₽ | 2 750 ₽ | 1 833 ₽ | 1 375 ₽ |
| 130 ₽основной показ | 13 000 ₽ | 6 500 ₽ | 4 333 ₽ | 3 250 ₽ |
Стоимость привлечения одного платящего: цена клика ÷ конверсия. Низ выдачи — минимум, по которому начинаются показы; основной показ — объём трафика 100%.
Парсеры в рунете и работающие в рунете держат подписку в коридоре 1 000–5 000 рублей в месяц, беру 2 000 как основной (Datacol — около 1 200 ₽/мес, у иностранных сервисов выше). При клике 17 рублей и конверсии 1% (допущение) привести платящего стоит около 1 700 рублей — около одной первой подписки. На бумаге сходится, и здесь это устойчивее, чем в потребительских нишах: инструмент деловой, задача регулярная, поэтому клиент платит не один месяц. Экономика держится не на дешёвом клике, а на длинном сроке жизни клиента: данные нужны постоянно, и подписку продлевают.
С нуля до миллиона
Начинаем с небольшого бюджета и вкладываем прибыль обратно в рекламу
Логика как у любого проекта: заходишь с небольшим бюджетом и всю прибыль возвращаешь обратно в рекламу — и реклама, и прибыль растут с каждым кругом. Продукт подписочный, поэтому выручка с клиента — это подписка, умноженная на сколько месяцев он платит. Двигай ползунки: клик и подписку взял из реальных данных, конверсию и удержание — это допущения. Удержание для делового инструмента взял 6–9 месяцев — это допущение, проверит только запуск.
Кругов до миллиона
—
Накоплено прибыли
—
Реклама окупается при конверсии выше —. Ниже этого порога каждый круг — в минус.
LTV — сколько он принесёт чистыми за всё время: подписка × срок × маржа.
LTV / CAC — во сколько раз клиент окупает привлечение. Выше 3 — здорово, ниже 1 — в минус.
| Круг | Вложил в рекламу | Прибыль за круг | Накоплено |
|---|
Каждый круг прибыль уходит обратно в рекламу. Здесь упор не в клик, а в удержание: данные нужны регулярно, поэтому сколько месяцев платит клиент — главный рычаг. У делового инструмента срок жизни длиннее, чем у разового потребительского сервиса, и это работает в плюс. Сроки зависят от того, как быстро откручивается бюджет.
Второй канал
Клиентов можно получать и без рекламы — из поиска
Кроме платной рекламы есть второй, бесплатный канал — поиск: статьи и страницы под запросы. Посетители приходят бесплатно, но их число нужно растить материалами. Для этой ниши поиск особенно важен: оригинал вырос именно на нём — унаследовал поисковый трафик и не считал платную рекламу главной. Разбил тему на группы запросов — вот сколько людей ищет каждую (Wordstat, в месяц):
| Кластер | запросов/мес |
|---|---|
Сбор данных с сайтов (сам продукт) автоматический сбор данных, сбор данных с сайтов, собрать данные с сайта, парсер данных | ~3 500 |
Парсинг сайтов (широкая фраза) парсинг сайтов, парсинг данных с сайта, сервис парсинга | ~2 600 |
Мониторинг цен конкурентов мониторинг цен конкурентов, парсинг цен конкурентов | ~330 |
Сбор контактов и баз парсинг контактов с сайта, сбор email с сайтов, сбор базы данных компаний | ~200 |
Парсинг товаров и маркетплейсов парсинг товаров с сайта, парсер для маркетплейсов, парсинг каталога товаров | ~60 |
Видно главное. Спрос рабочий, но дробится на узкие задачи: «автоматический сбор данных» — 741, «сбор данных с сайтов» — 681, «собрать данные с сайта» — 455 запросов в месяц. Самые «вкусные» с точки зрения денег — деловые задачи: мониторинг цен конкурентов и сбор контактов, по ним приходят те, у кого уже есть бюджет. А вот формулировки про обход кода почти не ищут: «парсер без кода» и «парсинг без программирования» — по 2 запроса в месяц. То, что сервис работает без программиста, само по себе людей в поиск не приводит — они ищут результат, а не способ.
Конкуренты
Рынок парсеров в рунете уже плотный
По задаче «собрать данные с сайта» в рунете давно работают местные программы и сервисы, плюс несколько иностранных, которые принимают карты. Это разные форматы: одни — программы с вечной лицензией за разовый платёж, другие — облачные сервисы по подписке. Вот кто это делает и за сколько (цены проверенные; где не нашёл подтверждения — помечаю):
| Сервис | цена |
|---|---|
Datacol программа-парсер сайтов, подписка | около 1 200 ₽/мес |
Content Downloader программа-парсер, вечная лицензия | 2 000–5 000 ₽ разово |
A-Parser парсер для специалистов, вечная лицензия | от $179 разово |
Octoparse облачный сбор данных без кода | от $69/мес |
ParseHub визуальный сбор данных, есть бесплатный тариф | от $189/мес |
Screaming Frog обход сайта для SEO, годовая лицензия | от $279/год |
Вывод
Спрос средний и рабочий, рынок плотный — повторять есть смысл через поиск и деловые задачи
Соберу цифры разбора вместе. Прямой спрос средний, но рабочий — около 3–4 тысяч запросов в месяц по сбору данных с сайтов: «автоматический сбор данных» — 741, «сбор данных с сайтов» — 681, «собрать данные с сайта» — 455 запросов в месяц. Это деловая ниша: людей меньше, чем в потребительских, но задача регулярная и платная. Клик средний — 12–24 рубля на низе выдачи. Подписка у парсеров — 1 000–5 000 рублей в месяц. При конверсии 1% (допущение) привлечение выходит около 1 700 рублей — на бумаге сходится, и держится на длинном сроке жизни клиента: данные нужны постоянно.
Как рос оригинал. MrScraper не строили с нуля — его купили готовым на площадке для продажи бизнесов вместе с поисковым трафиком и базой пользователей, а затем переделали сам продукт за три недели. Главными каналами стали поиск (сервис уже ранжировался по рабочим запросам) и прямые рассылки целевым компаниям. Резкий рост дал один крупный корпоративный контракт, пришедший через заявку с сайта. Платную рекламу основатель пробовал и почти всё отбросил — выручку приносили поиск и рассылки.
Где брать клиентов в России. Канал оригинала здесь переносится почти полностью. Поиск — главный: под рабочие запросы пишутся статьи и страницы, посетители приходят бесплатно. Прямые рассылки целевым компаниям тоже работают в деловой нише. Платный клик есть и он рабочий, но он дороже потребительского, поэтому остаётся вторым каналом, а не первым. Готовый сервис с трафиком на площадке для продажи бизнесов в рунете найти труднее, поэтому в России это, скорее, сборка с нуля под уже понятный спрос.
Пара гипотез — проверит только запуск. Первая (допущение): главный рычаг здесь — не дешёвый клик, а длинный срок жизни клиента; деловой инструмент удерживают дольше потребительского, и именно на этом держится экономика. Вторая (допущение): входить стоит со стороны конкретных деловых задач — мониторинг цен конкурентов и сбор контактов, — где у клиента уже есть бюджет, а не со стороны общего «парсинга без кода», который почти не ищут. Рынок парсеров в рунете плотный — есть и местные программы, и облачные сервисы, — но он раздроблен по форматам и задачам, явного лидера в формате «нейросеть собирает данные обычными словами» нет; место не пустое, но и не закрытое.
Читайте также
- NoteForms: $37K/мес на надстройке к Notion за 6 дней — $37K/мес
- $5M в год на трёх бизнесах — кейс Тима Стоддарта — $430K/мес
- Как запустить проект на $50K/мес: разбираю Early на российских цифрах — $50K/мес
- Как запустить проект на $60K в год: разбираю viral.app на российских цифрах — $5K/мес
- Как запустить проект на $100M в год: разбираю Gamma на российских цифрах — $8,3M/мес
- Early: $50K/мес на будильнике с отжиманиями — $50K/мес
- Live Tourney: $30K/мес — сервис для гольф-турниров — $30K/мес