Looking for international version of our service? Go to 2captcha.com

Логотип «RuCaptcha»Перейти на главную страницу

Scraper API

Получайте данные с любых сайтов по URL. RuCaptcha берёт на себя обработку капчи, прокси-маршрутизацию, браузерный рендеринг и обход блокировок, чтобы вы могли сосредоточиться на продукте, а не на поддержке инфраструктуры для парсинга. Парсите страницы, извлекайте данные и передавайте их в LLM, RAG-системы, аналитику или внутренние пайплайны.

Без риска. Платите только за успешные запросы.

  • Простая интеграция
  • Встроенный обход блокировок
  • Сбор данных по запросу через API
  • Решение капчи в браузерных сценариях
  • Массовая обработка URL
  • Готовый результат в разных форматах

Контакты для быстрой связи по вопросам заказчиков

Отправить сообщение

Полный стек для автоматизации парсинга в одном API

Фингерпринты браузера

Управляйте фингерпринтами браузера, заголовками, cookies и сигналами сессии, чтобы автоматизация работала стабильнее.

Автоматическое решение капчи

API обрабатывает капчу в фоне, включая reCAPTCHA, hCaptcha, Turnstile и другие распространённые проверки.

Встроенные прокси

Используйте резидентские и мобильные прокси с ротацией IP, геотаргетингом и стабильными сессиями для сбора данных в масштабе.

Простая интеграция

Отправляйте стандартные HTTP-запросы из backend-сервисов, скриптов и data pipelines без управления WebSocket-подключениями, CDP-сессиями и браузерными процессами.

Автомасштабируемая инфраструктура

Запускайте автоматизацию в облаке без локальных экземпляров Chrome, Docker-контейнеров и собственных серверов для браузеров.

JavaScript-рендеринг

Рендерите динамические сайты, ожидайте DOM-селекторы и сетевую активность, а затем получайте полностью загруженный HTML или структурированные данные.

Как работать с RuCaptcha Scraping API

Шаги по работе с Scraping API

  1. Отправьте запрос

    Отправьте HTTP-запрос с целевым URL и параметрами: локацией, JavaScript-рендерингом, условиями ожидания и форматом результата.

  2. Подбор ресурсов

    API подбирает подходящий прокси-маршрут и запускает среду headless-браузера для обработки страницы.

  3. Загрузка страницы

    Удалённый браузер открывает сайт, выполняет JavaScript, обрабатывает сетевые запросы и дожидается готовности страницы.

  4. Обработка защиты

    Система учитывает TLS-отпечатки, WAF-проверки и капчу, если они появляются при загрузке страницы.

  5. Получение данных

    В результате ваше приложение получает HTML или готовые структурированные данные прямо в HTTP-ответе.

Scraping API или самописный парсер

Scraping API
Самописный парсер
Переход по страницам и сбор данных
JavaScript-рендеринг
Автоматическая ротация прокси
Обработка WAF-проверок
Автоматический обход и решение любой капчи
Работа с TLS/JA3-отпечатками
Масштабирование инфраструктуры

Как это работает

Отправьте запрос к API-эндпоинту и получайте данные без прокси-инфраструктуры, браузерных ферм и отдельного слоя для обработки капчи. Scraping API управляет IP-ротацией, JavaScript-рендерингом, WAF-проверками и доступом к страницам, возвращая чистый HTML или структурированные данные прямо в ваше приложение или пайплайн.

  • Отправьте API-запрос

    Настройте один HTTP-запрос. Передайте целевой URL и дополнительные параметры обработки. В запросе можно задать локацию, включить JavaScript-рендеринг, передать собственные HTTP-заголовки или указать условия ожидания, например конкретный DOM-селектор.

  • Маршрутизация и выделение ресурсов

    API выбирает подходящий IP из прокси-пула с учётом настроек локации. Одновременно на наших серверах запускается изолированный headless-браузер, поэтому вам не нужно поддерживать браузеры, сессии и сетевую логику на своей стороне.

  • Рендеринг сайта

    Удалённый браузер открывает URL и выполняет клиентский JavaScript. Сервис обрабатывает XHR/fetch-запросы, динамические элементы и одностраничные приложения (SPA). Это помогает получить контент, который подгружается после открытия страницы и отсутствует в первоначальном HTML-ответе.

  • Обработайте ограничения доступа

    Антибот-проверки обрабатываются на стороне API. Система работает с TLS/JA3-отпечатками, сессионными cookies, заголовками и браузерным контекстом. Если WAF или капча останавливают загрузку, API обходит проверку в рамках того же сценария без отдельной логики повторов в вашем коде.

  • Извлеките данные

    Когда страница загружена и защитные проверки обработаны, результат возвращается через HTTP. Ответ может содержать чистый HTML или готовые структурированные данные. Их можно сразу передать в парсеры, LLM-агенты или внутренние базы данных.

Простая интеграция

Scraping API — масштабируемый движок сбора данных для разработчиков, команд автоматизации, AI-агентов и сервисов.

SDK-библиотеки: Подключайте Scraping API с помощью SDK и готовых обёрток для Python, Node.js, Go и PHP. Они помогают создавать запросы, обрабатывать ответы и встраивать сбор данных в backend без лишней низкоуровневой логики.

Готово для AI: Поддержка MCP (Model Context Protocol) для подключения Claude Desktop, Cursor и автономных AI-агентов. Встроен обход антибот-систем, капчи, WAF и блокировок по IP.

Проверьте API прямо из терминала через стандартные HTTP POST-запросы. Так проще быстро протестировать параметры запроса, формат ответа и логику извлечения данных.

BASE_URL="https://scraper.2captcha.com"
API_KEY="<YOUR_API_KEY>"

curl -i -X POST "$BASE_URL/tasks/sync" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "task_type": "scrape",
    "url": "https://example.com",
    "data_format": "raw",
    "format": "json"
  }'

Подключайте сбор данных к Data Science, ML, backend-пайплайнам и внутренним скриптам через SDK или стандартную библиотеку requests.

import os
import requests

base_url = "https://scraper.2captcha.com"
api_key = os.environ["SCRAPER_API_KEY"]

response = requests.post(
    f"{base_url}/tasks/sync",
    headers={
        "Authorization": f"Bearer {api_key}",
        "Content-Type": "application/json",
    },
    json={
        "task_type": "scrape",
        "url": "https://example.com",
        "data_format": "raw",
        "format": "json",
    },
    timeout=120,
)
response.raise_for_status()

result = response.json()
print(result["body"])
print(response.headers.get("x-debug"))

Получайте динамический контент и работайте с защитными проверками в JavaScript/TypeScript-приложениях напрямую или через npm-пакет.

const baseUrl = 'https://scraper.2captcha.com';
const apiKey = process.env.SCRAPER_API_KEY;

const response = await fetch(baseUrl + '/tasks/sync', {
  method: 'POST',
  headers: {
    Authorization: 'Bearer ' + apiKey,
    'Content-Type': 'application/json',
  },
  body: JSON.stringify({
    task_type: 'scrape',
    url: 'https://example.com',
    data_format: 'raw',
    format: 'json',
  }),
});

if (!response.ok) {
  throw new Error('Scraper API error: ' + response.status);
}

const result = await response.json();
console.log(result.body);
console.log(response.headers.get('x-debug'));

Запускайте высоконагруженные сценарии сбора данных через нативный модуль или стандартные возможности net/http.

package main

import (
  "bytes"
  "encoding/json"
  "fmt"
  "io"
  "net/http"
  "os"
  "time"
)

func main() {
  payload, _ := json.Marshal(map[string]any{
    "task_type":  "scrape",
    "url":        "https://example.com",
    "data_format": "raw",
    "format":     "json",
  })

  req, _ := http.NewRequest(http.MethodPost, "https://scraper.2captcha.com/tasks/sync", bytes.NewReader(payload))
  req.Header.Set("Authorization", "Bearer "+os.Getenv("SCRAPER_API_KEY"))
  req.Header.Set("Content-Type", "application/json")

  client := &http.Client{Timeout: 120 * time.Second}
  response, err := client.Do(req)
  if err != nil {
    panic(err)
  }
  defer response.Body.Close()

  body, _ := io.ReadAll(response.Body)
  fmt.Println(string(body))
  fmt.Println("x-debug:", response.Header.Get("x-debug"))
}

Подключайте API к LLM-цепочкам, RAG-пайплайнам и AI-фреймворкам через MCP или специализированные эндпоинты.

{
  "task_type": "scrape",
  "url": "https://example.com",
  "data_format": "markdown",
  "format": "json"
}

Стоимость

Выберите количество запросов, которое хотите добавить на баланс. Стоимость — $0.30 за 1 000 запросов.

100 000 запросов$0.30 / 1 000 запросов

Итого

Запросы
100 000
Цена за 1 000 запросов
$0.30
Итого
$30.00
Пополнить баланс

Сценарии использования

Scraping API берёт на себя блокировки, капчу и прокси, чтобы вы могли сосредоточиться на данных.

Извлечение данных и e-commerce

Извлечение данных и e-commerce

Сбор данных для масштабирования бизнес-процессов и аналитики без риска блокировок.

Цены и рыночная аналитика

Извлекайте цены конкурентов и данные о наличии товаров с маркетплейсов (Amazon, Walmart) в реальном времени. Встроенные прокси помогают обходить агрессивные retail WAF.

SEO-мониторинг и SERP

Массово парсите результаты Google для отслеживания позиций. Выбирайте точную геолокацию (страна/город) и не отвлекайтесь на поисковые капчи.

Данные для AI и LLM

Данные для AI и LLM

Дайте нейросетям и AI-агентам стабильный доступ к свежим данным из интернета.

RAG и инструменты агентов

Интегрируйтесь через Model Context Protocol (MCP). Позвольте LLM-агенту собирать информацию с защищенных сайтов и получать на выходе чистый Markdown или JSON.

Сбор датасетов

Автоматизированный сбор больших текстовых и визуальных датасетов для обучения ML-моделей. API обрабатывает проверки Cloudflare и DataDome во время парсинга.

QA и тестирование безопасности

QA и тестирование безопасности

Надежные инструменты для разработчиков и QA-инженеров, чтобы автоматизировать рутинные задачи и проверять устойчивость систем.

End-to-End (E2E) тесты

Тестируйте пользовательские сценарии (регистрация, checkout) в CI/CD через Playwright или Puppeteer без блокировок в pre-production.

Стресс-тест WAF и антибот-защиты

Эмулируйте сложные сценарии трафика, чтобы проверить устойчивость инфраструктуры и реакцию систем антибот-защиты (Akamai, Imperva) под высокой нагрузкой.

Социальные сети

Социальные сети

Работайте с социальными сетями безопаснее, сохраняя высокий уровень доверия к аккаунтам.

Постоянные сессии

Используйте Sticky Sessions (сохранение IP) и постоянные профили (хранение cookies). Скрипт будет вести себя как обычный пользователь с конкретного мобильного устройства.

Лидогенерация

Собирайте публичные контакты и профили для outreach-кампаний, снижая риск shadowban и ограничений аккаунта благодаря точному фингерпринтингу браузера на уровне ядра.

Комплаенс и ответственное использование

Мы стремимся к тому, чтобы наши технологии использовались законно, ответственно и для легитимных целей. Мы не поддерживаем, не разрешаем и не допускаем незаконную деятельность, злоупотребления или неправильное использование наших продуктов и сервисов.

Наши сервисы предназначены для законного доступа к публично доступной информации, включая сценарии, которые помогают исследованиям, прозрачности, инновациям и разработке полезных решений на основе данных. Мы выступаем против сбора, обработки или использования неавторизованной, закрытой, конфиденциальной или чувствительной информации без надлежащего правового основания или разрешения.

Пользователи самостоятельно отвечают за то, чтобы их использование наших сервисов соответствовало применимым законам, правилам, договорным обязательствам, условиям сайтов, требованиям приватности и правам третьих лиц.

Если вы считаете, что наши сервисы используются с нарушением применимого закона, наших правил или прав других лиц, свяжитесь с нами и предоставьте релевантные детали. Мы внимательно рассматриваем сообщения о нарушениях и можем принять необходимые меры, включая ограничение или прекращение доступа к сервисам.

Чтобы повысить прозрачность, пользовательский контроль и защиту приватности, мы поддерживаем отдельный Privacy Center, где пользователи могут узнать о работе с данными, правах на приватность и доступных настройках контроля.

FAQ

Что такое RuCaptcha Scraping API?
RuCaptcha Scraping API — это API для сбора данных с публичных страниц без разработки и поддержки собственной инфраструктуры для парсинга. Вы отправляете запрос с целевым URL, а API берет на себя доступ к странице, рендеринг, повторы запросов, прокси и обработку капчи, если она появляется.
Для чего можно использовать RuCaptcha Scraping API?
API подходит для мониторинга интернет-магазинов, отслеживания цен, анализа поисковой выдачи, маркетинговых исследований, обогащения лидов, сбора данных о поездках, вакансиях, недвижимости, подготовки датасетов для AI и внутренней аналитики.
Почему лучше использовать Scraping API, а не писать собственный парсер?
Самописный парсер обычно требует прокси, браузерных инстансов, JavaScript-рендеринга, заголовков, cookies, повторов запросов, обработки капчи и масштабирования инфраструктуры. RuCaptcha Scraping API переносит эту работу в управляемый API, чтобы команда занималась данными и продуктовой логикой, а не постоянной поддержкой парсеров под каждый сайт.
Какие данные может возвращать API?
API может возвращать HTML страницы, отрендеренный контент или структурированные данные — в зависимости от режима запроса и настроек. Это удобно как для разработчиков, которые хотят разбирать страницы самостоятельно, так и для команд, которым нужны готовые данные для аналитики, дашбордов или пайплайнов.
Поддерживает ли RuCaptcha Scraping API сайты с JavaScript-рендерингом?
Да. Многие современные сайты загружают данные динамически через JavaScript. RuCaptcha Scraping API может работать с уже отрендеренными страницами, что помогает получать данные, которых нет в первоначальном HTML-ответе.
Как API обрабатывает капчу?
RuCaptcha Scraping API использует опыт RuCaptcha в обработке капчи. Если целевая страница показывает капчу, API может обработать ее как часть общего сценария сбора данных. Это снижает необходимость встраивать отдельный слой для капчи в ваш парсер.
Нужно ли управлять прокси самостоятельно?
Нет. API создан так, чтобы снизить объем ручной работы с прокси. В зависимости от выбранной конфигурации запросы могут использовать подходящую маршрутизацию, ротацию IP, сессии и настройки локации. Если для вашего сценария нужна особая схема прокси, ее можно настроить отдельно.
Можно ли автоматизировать регулярный сбор данных?
Да. API можно вызывать из backend-сервисов, cron-задач, скриптов, data pipelines, no-code-инструментов и внутренних приложений. Ваша автоматизация управляет тем, когда отправлять запросы, какие URL обрабатывать и куда сохранять результат.
Как быстро API возвращает результат?
Время ответа зависит от целевого сайта и включенных функций. Простые страницы обычно возвращаются быстрее. Запросы с JavaScript-рендерингом, прокси-маршрутизацией, повторами или обработкой капчи могут занимать больше времени, потому что API должен выполнить дополнительные шаги перед возвратом результата.
Можно ли использовать RuCaptcha Scraping API в больших объемах?
Да. API подходит для сценариев, где нужно автоматически обрабатывать много URL. Для крупных задач можно группировать запросы в пакеты, использовать очереди и настраивать параллельность с учетом лимитов аккаунта и поведения целевых сайтов.
Работает ли API с моим текущим стеком?
Да. API можно интегрировать с любым backend-сервисом или скриптом, который умеет отправлять HTTP-запросы. Его можно использовать из Python, Node.js, PHP, Go, Java, C#, Ruby и других языков, которые часто применяются для веб-автоматизации и сбора данных.
Нужно ли переписывать существующий парсер?
Не обязательно. Во многих случаях можно оставить текущую логику парсинга, хранения и обработки данных, заменив только слой загрузки страниц на RuCaptcha Scraping API. Вместо прямых запросов к целевому сайту ваше приложение отправляет запросы в API и обрабатывает возвращенный результат.
Что происходит, если запрос не удался?
Ошибки возможны, если целевой сайт недоступен, блокирует доступ, изменил структуру или слишком долго отвечает. В таких случаях приложение должно обработать статус ответа, при необходимости повторить запрос и сохранить проблемные URL в лог для проверки.
Законен ли парсинг сайтов?
Парсинг сайтов может быть допустимым, если он выполняется ответственно и с учетом применимых законов, правил сайта, требований к приватности и ограничений на использование данных. Собирайте только те данные, к которым у вас есть право доступа, а для чувствительных или регулируемых сценариев консультируйтесь с юристами.
Как начать работу?
Создайте аккаунт RuCaptcha, получите API-ключ, выберите нужный режим сбора данных и отправьте первый запрос с целевым URL. После этого API можно подключить к приложению, скриптам, регулярным задачам или data pipeline.
  • логотип «GDPR»
  • логотип «SSL secured»
  • логотип «Google privacy policy»
  • логотип «S/MIME»
  • логотип «CCPA»