Парсинг блокчейн-данных: от API до собственной ноды

Проектируем и разрабатываем блокчейн-решения полного цикла: от архитектуры смарт-контрактов до запуска DeFi-протоколов, NFT-маркетплейсов и криптобирж. Аудит безопасности, токеномика, интеграция с существующей инфраструктурой.
Показано 1 из 1Все 1305 услуг
Парсинг блокчейн-данных: от API до собственной ноды
Средний
~2-3 дня
Часто задаваемые вопросы

Направления блокчейн-разработки

Этапы блокчейн-разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1360
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    957
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1188
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    646
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929

При выгрузке истории с блокчейн-эксплореров мы сталкивались с жёсткими ограничениями: Etherscan отдаёт максимум 10000 записей на запрос, 5 запросов в секунду на бесплатном плане, нет стриминга. Если нужно собрать все транзакции контракта USDT за последние три года — это более 30 миллионов записей. Для анализа DeFi-стратегий или отслеживания транзакций китов нужны миллионы записей — стандартные API не справляются. Простое решение не работает: пагинация через page не даст больше 10000. Нужна стратегия, и мы её нашли: пагинация по блокам с последующей дедупликацией.

В этой статье разберём основные подходы: от прямого Etherscan API до использования Alchemy и Moralis, а также парсинг HTML и работу с собственной нодой. Каждый метод отличается по скорости, полноте и стоимости. Например, Alchemy позволяет получить все транзакции адреса одним запросом без лимита записей, а собственная нода даёт доступ к внутренним вызовам.

Alchemy обходит Etherscan по всем параметрам: в 5 раз выше rate limit, нет лимита записей благодаря pageKey, поддержка WebSocket стриминга и кросс-чейн запросов. Для проектов, требующих максимальной производительности, Alchemy — безальтернативный выбор.

Если вам нужно собрать исторические данные для анализа — свяжитесь с нами, мы подберём оптимальный инструмент за один день.

Как обойти ограничение Etherscan API в 10000 записей?

Etherscan предоставляет параметры startblock и endblock. Пагинация по блокам позволяет вытянуть все транзакции. Код ниже перебирает блоки, увеличивая startblock до последнего встреченного:

import httpx
import asyncio
from typing import AsyncGenerator

async def get_all_transactions(
    address: str, 
    api_key: str,
    start_block: int = 0
) -> AsyncGenerator[dict, None]:
    """Выгрузка ВСЕХ транзакций адреса через пагинацию по блокам"""
    
    base_url = "https://api.etherscan.io/api"
    current_block = start_block
    
    while True:
        async with httpx.AsyncClient() as client:
            resp = await client.get(base_url, params={
                "module": "account",
                "action": "txlist",
                "address": address,
                "startblock": current_block,
                "endblock": 99999999,
                "sort": "asc",
                "apikey": api_key,
                "offset": 10000,
                "page": 1,
            })
        
        data = resp.json()
        if data["status"] != "1" or not data["result"]:
            break
            
        txs = data["result"]
        for tx in txs:
            yield tx
        
        if len(txs) < 10000:
            break
        
        current_block = int(txs[-1]["blockNumber"]) + 1
        await asyncio.sleep(0.2)

Важный нюанс: если в одном блоке > 10000 транзакций на адрес — цикл зависнет. Для таких случаев нужна вложенная пагинация с параметром page внутри блока.

Почему стоит использовать Alchemy или Moralis вместо Etherscan?

Alchemy и Moralis снимают большинство ограничений Etherscan. Alchemy имеет rate limit 25 req/s, что в 5 раз превышает лимит Etherscan (5 req/s). Вот сравнение:

Параметр Etherscan (free) Alchemy (free tier) Moralis (free tier)
Лимит записей 10000 Нет (pageKey) Нет (cursor)
Rate limit 5 req/s 25 req/s 100 requests/min
Streaming Нет WebSocket (Enhanced API) WebSocket (Real-time)
Кросс-чейн Нет Да Да

Alchemy getAssetTransfers возвращает ETH + ERC-20 + ERC-721 одним вызовом.

import { Alchemy, Network } from 'alchemy-sdk';

const alchemy = new Alchemy({ apiKey: process.env.ALCHEMY_KEY, network: Network.ETH_MAINNET });

const transfers = await alchemy.core.getAssetTransfers({
  fromAddress: '0x...',
  category: ['external', 'erc20', 'erc721', 'erc1155'],
  withMetadata: true,
  maxCount: 1000,
});

if (transfers.pageKey) {
  const more = await alchemy.core.getAssetTransfers({
    pageKey: transfers.pageKey,
  });
}

Alchemy Asset Transfers API рекомендует использовать pageKey для пагинации. Moralis дополнительно отдаёт внутренние транзакции через getWalletTransactionsVerbose. Для быстрой оценки масштаба свяжитесь с нами — мы подготовим прототип за 2 дня.

Когда парсинг HTML-страниц оправдан?

Если API не отдаёт держателей токенов или verified-контракты, используем парсинг HTML. Следующий пример собирает держателей токена с Etherscan:

import httpx
from bs4 import BeautifulSoup
import asyncio

async def get_token_holders(token_address: str, pages: int = 10) -> list[dict]:
    headers = {
        "User-Agent": "Mozilla/5.0",
    }
    holders = []
    
    async with httpx.AsyncClient(headers=headers) as client:
        for page in range(1, pages + 1):
            resp = await client.get(
                f"https://etherscan.io/token/{token_address}",
                params={"a": "#holders", "p": page}
            )
            soup = BeautifulSoup(resp.text, 'html.parser')
            table = soup.find('table', {'id': 'holdersTable'})
            if not table:
                break
            for row in table.find_all('tr')[1:]:
                cols = row.find_all('td')
                if len(cols) >= 3:
                    holders.append({
                        'rank': cols[0].text.strip(),
                        'address': cols[1].find('a')['href'].split('/')[-1],
                        'quantity': cols[2].text.strip(),
                    })
            await asyncio.sleep(2)
    return holders

Etherscan защищается Cloudflare — для объёмного сбора нужны резидентные прокси или официальное API. Парсинг BscScan и Solscan работает по аналогии.

Как избежать дублей при параллельном сборе?

При параллельном сборе из нескольких источников дубли неизбежны. Используем ON CONFLICT в PostgreSQL:

CREATE TABLE eth_transactions (
    tx_hash      CHAR(66) PRIMARY KEY,
    block_number BIGINT NOT NULL,
    from_address CHAR(42) NOT NULL,
    to_address   CHAR(42),
    value        NUMERIC(38) DEFAULT 0,
    gas_used     BIGINT,
    status       SMALLINT,
    ts           TIMESTAMPTZ
);

INSERT INTO eth_transactions VALUES (...)
ON CONFLICT (tx_hash) DO NOTHING;

Для событий уникальный ключ — (tx_hash, log_index).

Прямая работа с нодой

Для максимальной полноты (внутренние транзакции, storage slots, MEV) ставим собственную ноду с Erigon и --tracing. Это даёт:

  • Все internal transactions без лимитов
  • Трассировку вызовов
  • Данные из storage
curl -X POST $ETH_RPC_URL \
  -H "Content-Type: application/json" \
  -d '{"jsonrpc":"2.0","method":"eth_getBlockReceipts","params":["0x1234567"],"id":1}'

eth_getBlockReceipts EIP-1559 возвращает все receipts блока одним запросом — альтернатива N отдельных вызовов eth_getTransactionReceipt.

Какие этапы включает сбор данных?

Этап Описание Срок
Анализ источников Определение необходимых данных и их расположения (API, HTML, нода) 1-2 дня
Выбор инструментов Etherscan API, Alchemy, Moralis или собственная нода 1 день
Написание парсера Асинхронный сбор с учётом rate limit и пагинации 2-5 дней
Дедупликация и нормализация Склеивание данных в единую схему 1-2 дня
Тестирование на реальном объёме Миллионы транзакций, проверка на пропуски 2-3 дня
Деплой Контейнеризация, мониторинг, автоматический перезапуск 1-2 дня

Наш процесс занимает от 3 до 10 дней в зависимости от сложности.

Что входит в результат

  • Документация по схеме данных и методам сбора.
  • Готовый код на Python/TypeScript с поддержкой асинхронности.
  • Настройка пагинации под каждый эксплорер.
  • Деплой на сервер или в облако (AWS Lambda, Kubernetes).
  • Обучение команды работе с системой.
  • Поддержка в течение месяца после сдачи.

Наш опыт — более 30 проектов по сбору и анализу данных on-chain. Получите консультацию — мы поможем выбрать оптимальный инструмент под вашу задачу. Закажите проект, и мы настроим сбор данных любой сложности.

Развертывание блокчейн-инфраструктуры: ноды, RPC, индексация

Subgraph упал в 3:47 ночи. К утру пользователи видели устаревшие балансы, транзакции «висели» в UI, поддержка получила 47 тикетов за час. Причина: handler в subgraph упал на транзакции с нестандартным event log — и весь индекс встал. Мы сталкивались с такими ситуациями десятки раз. Наш опыт показывает: блокчейн-инфраструктура не прощает gaps в observability. Гарантировать uptime без многослойного мониторинга и fault‑tolerant архитектуры невозможно. За 8 лет работы с Ethereum, Polygon и Solana мы выработали подход, который позволяет предсказуемо развёртывать инфраструктуру любого масштаба — от одиночной ноды до мультичейн‑сетки с десятками субграфов.

Архитектура RPC-слоя

Каждое взаимодействие dApp с блокчейном идёт через RPC — JSON‑RPC API, которую предоставляет нода. Три варианта:

Managed providers — Alchemy, QuickNode, Infura, Ankr. Минимальные операционные расходы, SLA, встроенный мониторинг. Ограничения: rate limits (Alchemy Free: 300 RU/sec), vendor lock, потенциальные downtime при инцидентах провайдера. Для большинства проектов — правильный выбор на старте.

Собственные ноды — полный контроль, нет rate limits, нет зависимости от третьих сторон. Стоимость: архивная нода Ethereum занимает 2.5–3TB SSD, требует мощный сервер и DevOps‑поддержку. Sync с нуля на Ethereum через Geth/Nethermind — 3–7 дней. Оправдано при высокой нагрузке или требованиях к latency.

Гибрид — собственная нода как primary, managed provider как fallback. Стандарт для протоколов с TVL от $10M. Правильная балансировка может сократить расходы на 20–30% по сравнению с чисто managed‑схемой. При нагрузке 10 млн запросов в месяц гибрид экономит от $1500 до $3000.

Провайдер Сильная сторона Ограничение
Alchemy Supernode, Enhanced APIs, webhooks Дорогой на high-volume
QuickNode Низкая latency, multi-chain Дороже Alchemy на базовом плане
Infura Историческая надёжность Rate limits на бесплатном, один крупный инцидент остановил пол‑DeFi
Ankr Дешёвый, 40+ чейнов Менее стабильный

Как настроить RPC-слой без единой точки отказа?

Минимум два провайдера, DNS round‑robin с health check каждые 5 секунд, автоматическое переключение на fallback при latency >500 мс. На практике это даёт 99.99% доступности при любом сбое провайдера. Для протоколов с TVL от $10M мы рекомендуем собственный HA‑прокси (nginx или Envoy) перед двумя managed‑провайдерами.

Почему гибридная RPC-схема выгоднее чисто managed?

При 50 млн запросов в месяц Alchemy стоит $2000+, QuickNode — $2500+, собственная нода — $400–600 за хостинг + DevOps. Гибрид: primary — своя нода ($500), fallback — QuickNode ($500), итого ~$1000. Экономия 50–60% без потери SLA.

Клиенты нод Ethereum

Execution clients: Geth (наиболее используемый), Nethermind (C#, быстрая sync), Besu (Java, enterprise), Erigon (самый быстрый sync, архивный режим эффективен по диску — ~2TB вместо 3TB).

Consensus clients (post‑Merge): Lighthouse (Rust), Prysm (Go), Teku (Java), Nimbus (Nim). Каждая нода после The Merge требует пары execution + consensus client.

Для DevOps: eth‑docker — Docker Compose конфигурации для всех комбинаций клиентов. Настройка мониторинга через Grafana + Prometheus — обязательна, стандартный дашборд есть в репозитории каждого клиента.

The Graph: индексация событий

The Graph Protocol — decentralized indexing. Subgraph описывает какие события с каких контрактов индексировать и как трансформировать их в GraphQL схему.

Структура subgraph:

  • subgraph.yaml — манифест: адреса контрактов, startBlock, события которые обрабатываются
  • schema.graphql — GraphQL схема entities
  • src/mapping.ts — AssemblyScript обработчики событий
dataSources:
  - kind: ethereum
    name: UniswapV3Pool
    network: mainnet
    source:
      address: "0x88e6A0c2dDD26FEEb64F039a2c41296FcB3f5640"
      abi: UniswapV3Pool
      startBlock: 12370624
    mapping:
      eventHandlers:
        - event: Swap(indexed address,indexed address,int256,int256,uint160,uint128,int24)
          handler: handleSwap

AssemblyScript handlers — не TypeScript. Нет nullable types, нет closures, нет многих стандартных API. Ошибка в handler останавливает индексацию subgraph-а на той транзакции. Важно: добавлять try‑catch на операции которые могут падать (например store.get() для entity которая может не существовать).

Как избежать остановки индексации субграфа?

Лог файлы Graph Node мониторятся в реальном времени, при hasIndexingErrors = true срабатывает алерт и автоматический рестарт ноды (через systemd или Kubernetes). Типичный downtime при ошибке — 150–300 секунд до восстановления. Дополнительно: для production ставим watchdog, который перезапускает Graph Node если subgraph lag превышает 50 блоков.

Выбор между Hosted Service и Decentralized Network

Graph Hosted Service (бесплатный, централизованный) deprecated в пользу Subgraph Studio + Graph Network. Для продакшн: деплой на Graph Network с GRT curation signal — субграф получает indexers пропорционально curation.

Альтернативы The Graph: Ponder (TypeScript, self-hosted, проще дебагать), Envio (ultra‑fast indexer, поддерживает EVM + non‑EVM), Subsquid (TypeScript, своя сеть), Moralis Streams (managed, webhook‑based). Наш опыт показывает: для высоконагруженных проектов с уникальной логикой эффективнее Ponder или Envio — они дают полный контроль над процессом и не требуют токеномики GRT.

Webhooks и real-time нотификации

Alchemy Webhooks и QuickNode Streams позволяют получать события в реальном времени через HTTP webhook или WebSocket. Для мониторинга адресов, новых транзакций, минтов — это быстрее чем polling RPC.

Tenderly — платформа для мониторинга и алертов. Можно настроить alert на конкретный event из контракта, на изменение баланса, на вызов функции с определёнными параметрами. Симуляция транзакций через Tenderly API — бесценно для debugging.

Мониторинг и observability

Минимальный стек мониторинга для протокола:

On‑chain: OpenZeppelin Defender Sentinel — watches contract events, вызывает webhook или Autotask при срабатывании условий. Forta Network — community‑maintained боты детектируют аномалии (большие withdrawals, flash loans, governance attacks).

Infrastructure: Grafana + Prometheus для нод, Datadog или Grafana Cloud для managed метрик. Alert на: нода отстала на 10+ блоков, RPC latency > 500ms, subgraph lag > 100 блоков.

Uptime: Better Uptime или PagerDuty на RPC endpoint и subgraph health endpoint (The Graph предоставляет _meta { hasIndexingErrors, block { number } }).

Почему мониторинг без Tenderly недостаточен?

Tenderly даёт симуляцию транзакций и детальные трейсы — это критично для отладки ошибок в субграфах и смарт‑контрактах. Forta же фокусируется на аномалиях в сети, а не на вашей инфраструктуре. Комбинация Tenderly + собственный дашборд Grafana покрывает 90% сценариев инцидентов.

Мультичейн инфраструктура

Протокол на 5 чейнах = 5 отдельных RPC endpoints, 5 subgraphs, 5 мониторинг‑конфигов. Это управляемо, но нужна автоматизация деплоя.

Для subgraph multi‑network деплой: graph deploy --network mainnet, graph deploy --network arbitrum-one и т.д. с единой кодовой базой и network‑specific адресами в отдельных файлах конфигурации.

Chainlink CCIP и LayerZero для cross‑chain messaging требуют мониторинга состояния обоих чейнов и транзакций на intermediate relayers. Реорг на source chain при уже подтверждённом минте на target chain — классическая проблема мостов. Решение: ждать finality (на Ethereum ~15 минут после Merge для экономической finality) перед подтверждением на target chain.

Процесс настройки инфраструктуры

  1. Аудит текущего стека — определяем чейны, объём запросов, требования к latency и доступности.
  2. Проектирование архитектуры — выбор провайдеров, балансировка, redundancy.
  3. Разработка subgraph — манифест → схема → handlers → тестирование на локальной Graph Node → деплой на testnet → mainnet.
  4. Конфигурация мониторинга — Tenderly alerts, Grafana дашборд, PagerDuty интеграция.
  5. Документация и runbook — что делать при: subgraph fell behind, RPC downtime, нода desync.
  6. Передача в эксплуатацию — обучение команды, передача доступов, поддержка первый месяц.

Что входит в работу

  • Развёртывание managed или self‑hosted нод Ethereum, Polygon, BNB Chain
  • Настройка RPC‑слоя с primary/fallback и load balancing
  • Разработка и деплой subgraph под ваш протокол
  • Подключение мониторинга (Tenderly, Grafana, алерты)
  • Создание runbook и документации по эксплуатации
  • Обучение команды (до 4 часов онлайн)
  • Поддержка в течение 30 дней после сдачи

Сроки

Работа Срок
Настройка RPC и базового мониторинга 1–2 недели
Subgraph для одного протокола 2–4 недели
Self-hosted нода с мониторингом 2–3 недели
Полная инфраструктура (multi-chain, мониторинг, runbooks) 6–10 недель

Все проекты ведутся в репозитории на GitHub/GitLab с CI/CD, код конфигураций остаётся у вас. Закажите развертывание инфраструктуры — расскажем, как сократить расходы на 20–30% без потери надёжности. JSON‑RPC спецификация, документация The Graph. Получите консультацию — покажем, как мы развёртывали инфраструктуру для протокола с TVL $50M+ на Ethereum и Arbitrum.

Свяжитесь с нами.