Парсинг on-chain данных (транзакции, балансы, контракты)
Вы пытаетесь получить исторические балансы кошельков Ethereum, но eth_getBalance возвращает только текущее состояние? Или нужно отследить внутренние транзакции контракта, которые не видны в обычных транзакциях? Мы сталкивались с этими задачами сотни раз и знаем, как их решить эффективно. Вместо того чтобы использовать Dune или Etherscan с их ограничениями, вы можете развернуть собственный парсер, который даёт полный контроль над данными, скоростью и стоимостью. Мы разрабатываем такие решения более 10 лет, и в этой статье расскажем о ключевых аспектах парсинга on-chain данных: от выбора источника до оптимизации хранения. Экономия на инфраструктуре при таком подходе может достигать 60%.
Ethereum JSON-RPC API — официальная документация, на которой основаны примеры ниже.
Доступные типы данных
Транзакции уровня блока (eth_getBlockByNumber с fullTx: true): from/to/value/gas/gasPrice/nonce, input data (calldata в hex), receipt (status, gasUsed, logs).
Internal transactions — вызовы между контрактами, не видны в обычных транзакциях. Нужен debug_traceTransaction или trace_block (Erigon/OpenEthereum trace namespace).
События (logs) — эмитируются через emit Event(...) в Solidity, доступны через eth_getLogs. Самый производительный способ фильтрации по address + topic на уровне ноды.
Storage state — значения storage variables контракта через eth_getStorageAt(address, slot, blockNumber). Для archive node — на любом историческом блоке.
ERC-20 балансы — через balanceOf(address) view call или через Transfer event history.
Выбор источника данных
| Источник |
Что даёт |
Ограничения |
| Публичный RPC (Infura/Alchemy) |
Стандартный JSON-RPC |
Rate limits, нет traces |
| Self-hosted Geth |
Полный JSON-RPC |
Нет traces без --gcmode=archive |
| Self-hosted Erigon |
JSON-RPC + trace namespace |
~2.5 TB, 3-5 дней синхронизации |
| Alchemy/QuickNode (платные планы) |
Расширенный API + traces |
Стоимость при высоком RPS |
| Firehose (StreamingFast) |
Бинарный стриминг, все данные |
Сложная настройка |
| Dune Analytics / Flipside |
SQL интерфейс к indexed данным |
Задержка, ограничения схемы |
Self-hosted Erigon в 10 раз быстрее Geth для парсинга traces и лучше подходит для высоких нагрузок.
Как парсить транзакции?
Базовый парсер блока с получением receipt:
import { createPublicClient, http } from 'viem';
const client = createPublicClient({
transport: http(RPC_URL),
});
async function processBlock(blockNumber: bigint) {
const block = await client.getBlock({
blockNumber,
includeTransactions: true,
});
for (const tx of block.transactions) {
if (typeof tx === 'string') continue;
const receipt = await client.getTransactionReceipt({ hash: tx.hash });
await db.insertTransaction({
hash: tx.hash,
blockNumber: Number(tx.blockNumber),
blockTimestamp: Number(block.timestamp),
from: tx.from,
to: tx.to,
value: tx.value.toString(),
gasPrice: tx.gasPrice?.toString(),
gasLimit: tx.gas.toString(),
input: tx.input,
nonce: tx.nonce,
status: receipt.status === 'success',
gasUsed: receipt.gasUsed.toString(),
});
}
}
Как парсить события (логи)?
События дают доступ к Transfer, Swap и другим действиям. Пример для ERC-20 Transfer:
const logs = await client.getLogs({
address: TOKEN_ADDRESS,
event: parseAbiItem('event Transfer(address indexed from, address indexed to, uint256 value)'),
fromBlock: 19_000_000n,
toBlock: 19_100_000n,
});
for (const log of logs) {
await db.insertTransfer({
txHash: log.transactionHash,
blockNumber: Number(log.blockNumber),
from: log.args.from,
to: log.args.to,
value: log.args.value.toString(),
});
}
Ограничение: диапазон запроса eth_getLogs ограничен 2000 блоками на большинстве публичных нод. Для исторических данных используйте chunked polling с паузами. Мы реализуем автоматическую обработку этих лимитов.
Что делать с историческими балансами?
Для получения баланса на любой блок используйте archive node:
const historicalBalance = await client.readContract({
address: TOKEN_ADDRESS,
abi: erc20Abi,
functionName: 'balanceOf',
args: [walletAddress],
blockNumber: 18_500_000n,
});
Для массовых запросов применяйте мультиколл:
import { multicall } from 'viem';
const balances = await client.multicall({
contracts: addresses.map(addr => ({
address: TOKEN_ADDRESS,
abi: erc20Abi,
functionName: 'balanceOf',
args: [addr],
})),
allowFailure: true,
});
Почему self-hosted Erigon быстрее Geth?
Erigon использует оптимизированную модель хранения, что сокращает время синхронизации и ускоряет доступ к trace-данным. Для задач парсинга с высокими нагрузками Erigon — стандарт де-факто.
Как ускорить массовые запросы балансов?
Мультиколл позволяет объединить несколько view-вызовов в один запрос, сокращая количество RPC-запросов и общее время. Это особенно эффективно при мониторинге портфелей.
Многосетевой парсинг
Конфигурация под разные сети:
const CHAIN_CONFIGS = {
ethereum: { rpc: INFURA_ETH, chunkSize: 1000, blockTime: 12 },
bsc: { rpc: BSC_RPC, chunkSize: 2000, blockTime: 3 },
polygon: { rpc: POLYGON_RPC, chunkSize: 1500, blockTime: 2 },
arbitrum: { rpc: ARB_RPC, chunkSize: 5000, blockTime: 0.25 },
};
Производительность и хранение
Для Ethereum: ~6500 блоков/день × ~6000 TX/блок = ~40M транзакций/день. Каждая с receipts: ~1-5 KB. Итого: ~40-200 GB/день для полного парсинга. Для большинства задач достаточно парсинга только целевых контрактов.
Хранение: PostgreSQL + TimescaleDB для time-series + S3 для raw архива. Критичные индексы: CREATE INDEX ON transactions (from_address, block_number DESC), CREATE INDEX ON transfers (token_address, block_number DESC).
| Тип данных |
Типичный объём |
Рекомендуемое хранилище |
| Транзакции + receipts |
40-200 GB/день |
PostgreSQL + TimescaleDB |
| Логи событий |
5-20 GB/день |
Columnar (ClickHouse) |
| Historical balances |
Зависит от кол-ва адресов |
S3 + кэш Redis |
Как мы работаем и что вы получаете
Мы проходим все этапы: от анализа требований до деплоя и мониторинга. В результате вы получаете:
- Архитектурную документацию
- Доступ к развернутой инфраструктуре
- Исходный код парсера с комментариями
- Обучение вашей команды
- Поддержку в течение 3 месяцев после сдачи
Сроки и стоимость
Базовый парсер для 2-3 сетей с PostgreSQL и REST API: 2-4 недели. Сложные проекты с кастомной логикой — до 8 недель. Стоимость рассчитывается индивидуально на основе ваших требований.
Для консультации и оценки вашего проекта свяжитесь с нами. Закажите разработку парсера под ваши задачи. Мы гарантируем прозрачность и эффективность.
Многолетний опыт в блокчейн-разработке, десятки успешных проектов по парсингу и индексации.
Развертывание блокчейн-инфраструктуры: ноды, RPC, индексация
Subgraph упал в 3:47 ночи. К утру пользователи видели устаревшие балансы, транзакции «висели» в UI, поддержка получила 47 тикетов за час. Причина: handler в subgraph упал на транзакции с нестандартным event log — и весь индекс встал. Мы сталкивались с такими ситуациями десятки раз. Наш опыт показывает: блокчейн-инфраструктура не прощает gaps в observability. Гарантировать uptime без многослойного мониторинга и fault‑tolerant архитектуры невозможно. За 8 лет работы с Ethereum, Polygon и Solana мы выработали подход, который позволяет предсказуемо развёртывать инфраструктуру любого масштаба — от одиночной ноды до мультичейн‑сетки с десятками субграфов.
Архитектура RPC-слоя
Каждое взаимодействие dApp с блокчейном идёт через RPC — JSON‑RPC API, которую предоставляет нода. Три варианта:
Managed providers — Alchemy, QuickNode, Infura, Ankr. Минимальные операционные расходы, SLA, встроенный мониторинг. Ограничения: rate limits (Alchemy Free: 300 RU/sec), vendor lock, потенциальные downtime при инцидентах провайдера. Для большинства проектов — правильный выбор на старте.
Собственные ноды — полный контроль, нет rate limits, нет зависимости от третьих сторон. Стоимость: архивная нода Ethereum занимает 2.5–3TB SSD, требует мощный сервер и DevOps‑поддержку. Sync с нуля на Ethereum через Geth/Nethermind — 3–7 дней. Оправдано при высокой нагрузке или требованиях к latency.
Гибрид — собственная нода как primary, managed provider как fallback. Стандарт для протоколов с TVL от $10M. Правильная балансировка может сократить расходы на 20–30% по сравнению с чисто managed‑схемой. При нагрузке 10 млн запросов в месяц гибрид экономит от $1500 до $3000.
| Провайдер |
Сильная сторона |
Ограничение |
| Alchemy |
Supernode, Enhanced APIs, webhooks |
Дорогой на high-volume |
| QuickNode |
Низкая latency, multi-chain |
Дороже Alchemy на базовом плане |
| Infura |
Историческая надёжность |
Rate limits на бесплатном, один крупный инцидент остановил пол‑DeFi |
| Ankr |
Дешёвый, 40+ чейнов |
Менее стабильный |
Как настроить RPC-слой без единой точки отказа?
Минимум два провайдера, DNS round‑robin с health check каждые 5 секунд, автоматическое переключение на fallback при latency >500 мс. На практике это даёт 99.99% доступности при любом сбое провайдера. Для протоколов с TVL от $10M мы рекомендуем собственный HA‑прокси (nginx или Envoy) перед двумя managed‑провайдерами.
Почему гибридная RPC-схема выгоднее чисто managed?
При 50 млн запросов в месяц Alchemy стоит $2000+, QuickNode — $2500+, собственная нода — $400–600 за хостинг + DevOps. Гибрид: primary — своя нода ($500), fallback — QuickNode ($500), итого ~$1000. Экономия 50–60% без потери SLA.
Клиенты нод Ethereum
Execution clients: Geth (наиболее используемый), Nethermind (C#, быстрая sync), Besu (Java, enterprise), Erigon (самый быстрый sync, архивный режим эффективен по диску — ~2TB вместо 3TB).
Consensus clients (post‑Merge): Lighthouse (Rust), Prysm (Go), Teku (Java), Nimbus (Nim). Каждая нода после The Merge требует пары execution + consensus client.
Для DevOps: eth‑docker — Docker Compose конфигурации для всех комбинаций клиентов. Настройка мониторинга через Grafana + Prometheus — обязательна, стандартный дашборд есть в репозитории каждого клиента.
The Graph: индексация событий
The Graph Protocol — decentralized indexing. Subgraph описывает какие события с каких контрактов индексировать и как трансформировать их в GraphQL схему.
Структура subgraph:
-
subgraph.yaml — манифест: адреса контрактов, startBlock, события которые обрабатываются
-
schema.graphql — GraphQL схема entities
-
src/mapping.ts — AssemblyScript обработчики событий
dataSources:
- kind: ethereum
name: UniswapV3Pool
network: mainnet
source:
address: "0x88e6A0c2dDD26FEEb64F039a2c41296FcB3f5640"
abi: UniswapV3Pool
startBlock: 12370624
mapping:
eventHandlers:
- event: Swap(indexed address,indexed address,int256,int256,uint160,uint128,int24)
handler: handleSwap
AssemblyScript handlers — не TypeScript. Нет nullable types, нет closures, нет многих стандартных API. Ошибка в handler останавливает индексацию subgraph-а на той транзакции. Важно: добавлять try‑catch на операции которые могут падать (например store.get() для entity которая может не существовать).
Как избежать остановки индексации субграфа?
Лог файлы Graph Node мониторятся в реальном времени, при hasIndexingErrors = true срабатывает алерт и автоматический рестарт ноды (через systemd или Kubernetes). Типичный downtime при ошибке — 150–300 секунд до восстановления. Дополнительно: для production ставим watchdog, который перезапускает Graph Node если subgraph lag превышает 50 блоков.
Выбор между Hosted Service и Decentralized Network
Graph Hosted Service (бесплатный, централизованный) deprecated в пользу Subgraph Studio + Graph Network. Для продакшн: деплой на Graph Network с GRT curation signal — субграф получает indexers пропорционально curation.
Альтернативы The Graph: Ponder (TypeScript, self-hosted, проще дебагать), Envio (ultra‑fast indexer, поддерживает EVM + non‑EVM), Subsquid (TypeScript, своя сеть), Moralis Streams (managed, webhook‑based). Наш опыт показывает: для высоконагруженных проектов с уникальной логикой эффективнее Ponder или Envio — они дают полный контроль над процессом и не требуют токеномики GRT.
Webhooks и real-time нотификации
Alchemy Webhooks и QuickNode Streams позволяют получать события в реальном времени через HTTP webhook или WebSocket. Для мониторинга адресов, новых транзакций, минтов — это быстрее чем polling RPC.
Tenderly — платформа для мониторинга и алертов. Можно настроить alert на конкретный event из контракта, на изменение баланса, на вызов функции с определёнными параметрами. Симуляция транзакций через Tenderly API — бесценно для debugging.
Мониторинг и observability
Минимальный стек мониторинга для протокола:
On‑chain: OpenZeppelin Defender Sentinel — watches contract events, вызывает webhook или Autotask при срабатывании условий. Forta Network — community‑maintained боты детектируют аномалии (большие withdrawals, flash loans, governance attacks).
Infrastructure: Grafana + Prometheus для нод, Datadog или Grafana Cloud для managed метрик. Alert на: нода отстала на 10+ блоков, RPC latency > 500ms, subgraph lag > 100 блоков.
Uptime: Better Uptime или PagerDuty на RPC endpoint и subgraph health endpoint (The Graph предоставляет _meta { hasIndexingErrors, block { number } }).
Почему мониторинг без Tenderly недостаточен?
Tenderly даёт симуляцию транзакций и детальные трейсы — это критично для отладки ошибок в субграфах и смарт‑контрактах. Forta же фокусируется на аномалиях в сети, а не на вашей инфраструктуре. Комбинация Tenderly + собственный дашборд Grafana покрывает 90% сценариев инцидентов.
Мультичейн инфраструктура
Протокол на 5 чейнах = 5 отдельных RPC endpoints, 5 subgraphs, 5 мониторинг‑конфигов. Это управляемо, но нужна автоматизация деплоя.
Для subgraph multi‑network деплой: graph deploy --network mainnet, graph deploy --network arbitrum-one и т.д. с единой кодовой базой и network‑specific адресами в отдельных файлах конфигурации.
Chainlink CCIP и LayerZero для cross‑chain messaging требуют мониторинга состояния обоих чейнов и транзакций на intermediate relayers. Реорг на source chain при уже подтверждённом минте на target chain — классическая проблема мостов. Решение: ждать finality (на Ethereum ~15 минут после Merge для экономической finality) перед подтверждением на target chain.
Процесс настройки инфраструктуры
- Аудит текущего стека — определяем чейны, объём запросов, требования к latency и доступности.
- Проектирование архитектуры — выбор провайдеров, балансировка, redundancy.
- Разработка subgraph — манифест → схема → handlers → тестирование на локальной Graph Node → деплой на testnet → mainnet.
- Конфигурация мониторинга — Tenderly alerts, Grafana дашборд, PagerDuty интеграция.
- Документация и runbook — что делать при: subgraph fell behind, RPC downtime, нода desync.
- Передача в эксплуатацию — обучение команды, передача доступов, поддержка первый месяц.
Что входит в работу
- Развёртывание managed или self‑hosted нод Ethereum, Polygon, BNB Chain
- Настройка RPC‑слоя с primary/fallback и load balancing
- Разработка и деплой subgraph под ваш протокол
- Подключение мониторинга (Tenderly, Grafana, алерты)
- Создание runbook и документации по эксплуатации
- Обучение команды (до 4 часов онлайн)
- Поддержка в течение 30 дней после сдачи
Сроки
| Работа |
Срок |
| Настройка RPC и базового мониторинга |
1–2 недели |
| Subgraph для одного протокола |
2–4 недели |
| Self-hosted нода с мониторингом |
2–3 недели |
| Полная инфраструктура (multi-chain, мониторинг, runbooks) |
6–10 недель |
Все проекты ведутся в репозитории на GitHub/GitLab с CI/CD, код конфигураций остаётся у вас. Закажите развертывание инфраструктуры — расскажем, как сократить расходы на 20–30% без потери надёжности. JSON‑RPC спецификация, документация The Graph. Получите консультацию — покажем, как мы развёртывали инфраструктуру для протокола с TVL $50M+ на Ethereum и Arbitrum.
Свяжитесь с нами.