Парсинг on-chain данных (транзакции, балансы, контракты)
Вы пытаетесь получить исторические балансы кошельков Ethereum, но eth_getBalance возвращает только текущее состояние? Или нужно отследить внутренние транзакции контракта, которые не видны в обычных транзакциях? Мы сталкивались с этими задачами сотни раз и знаем, как их решить эффективно. Вместо того чтобы использовать Dune или Etherscan с их ограничениями, вы можете развернуть собственный парсер, который даёт полный контроль над данными, скоростью и стоимостью. Мы разрабатываем такие решения более 10 лет, и в этой статье расскажем о ключевых аспектах парсинга on-chain данных: от выбора источника до оптимизации хранения. Экономия на инфраструктуре при таком подходе может достигать 60%.
Ethereum JSON-RPC API — официальная документация, на которой основаны примеры ниже.
Доступные типы данных
Транзакции уровня блока (eth_getBlockByNumber с fullTx: true): from/to/value/gas/gasPrice/nonce, input data (calldata в hex), receipt (status, gasUsed, logs).
Internal transactions — вызовы между контрактами, не видны в обычных транзакциях. Нужен debug_traceTransaction или trace_block (Erigon/OpenEthereum trace namespace).
События (logs) — эмитируются через emit Event(...) в Solidity, доступны через eth_getLogs. Самый производительный способ фильтрации по address + topic на уровне ноды.
Storage state — значения storage variables контракта через eth_getStorageAt(address, slot, blockNumber). Для archive node — на любом историческом блоке.
ERC-20 балансы — через balanceOf(address) view call или через Transfer event history.
Выбор источника данных
| Источник | Что даёт | Ограничения |
|---|---|---|
| Публичный RPC (Infura/Alchemy) | Стандартный JSON-RPC | Rate limits, нет traces |
| Self-hosted Geth | Полный JSON-RPC | Нет traces без --gcmode=archive |
| Self-hosted Erigon | JSON-RPC + trace namespace | ~2.5 TB, 3-5 дней синхронизации |
| Alchemy/QuickNode (платные планы) | Расширенный API + traces | Стоимость при высоком RPS |
| Firehose (StreamingFast) | Бинарный стриминг, все данные | Сложная настройка |
| Dune Analytics / Flipside | SQL интерфейс к indexed данным | Задержка, ограничения схемы |
Self-hosted Erigon в 10 раз быстрее Geth для парсинга traces и лучше подходит для высоких нагрузок.
Как парсить транзакции?
Базовый парсер блока с получением receipt:
import { createPublicClient, http } from 'viem'; const client = createPublicClient({ transport: http(RPC_URL), }); async function processBlock(blockNumber: bigint) { const block = await client.getBlock({ blockNumber, includeTransactions: true, }); for (const tx of block.transactions) { if (typeof tx === 'string') continue; const receipt = await client.getTransactionReceipt({ hash: tx.hash }); await db.insertTransaction({ hash: tx.hash, blockNumber: Number(tx.blockNumber), blockTimestamp: Number(block.timestamp), from: tx.from, to: tx.to, value: tx.value.toString(), gasPrice: tx.gasPrice?.toString(), gasLimit: tx.gas.toString(), input: tx.input, nonce: tx.nonce, status: receipt.status === 'success', gasUsed: receipt.gasUsed.toString(), }); } } Как парсить события (логи)?
События дают доступ к Transfer, Swap и другим действиям. Пример для ERC-20 Transfer:
const logs = await client.getLogs({ address: TOKEN_ADDRESS, event: parseAbiItem('event Transfer(address indexed from, address indexed to, uint256 value)'), fromBlock: 19_000_000n, toBlock: 19_100_000n, }); for (const log of logs) { await db.insertTransfer({ txHash: log.transactionHash, blockNumber: Number(log.blockNumber), from: log.args.from, to: log.args.to, value: log.args.value.toString(), }); } Ограничение: диапазон запроса eth_getLogs ограничен 2000 блоками на большинстве публичных нод. Для исторических данных используйте chunked polling с паузами. Мы реализуем автоматическую обработку этих лимитов.
Что делать с историческими балансами?
Для получения баланса на любой блок используйте archive node:
const historicalBalance = await client.readContract({ address: TOKEN_ADDRESS, abi: erc20Abi, functionName: 'balanceOf', args: [walletAddress], blockNumber: 18_500_000n, }); Для массовых запросов применяйте мультиколл:
import { multicall } from 'viem'; const balances = await client.multicall({ contracts: addresses.map(addr => ({ address: TOKEN_ADDRESS, abi: erc20Abi, functionName: 'balanceOf', args: [addr], })), allowFailure: true, }); Почему self-hosted Erigon быстрее Geth?
Erigon использует оптимизированную модель хранения, что сокращает время синхронизации и ускоряет доступ к trace-данным. Для задач парсинга с высокими нагрузками Erigon — стандарт де-факто.
Как ускорить массовые запросы балансов?
Мультиколл позволяет объединить несколько view-вызовов в один запрос, сокращая количество RPC-запросов и общее время. Это особенно эффективно при мониторинге портфелей.
Многосетевой парсинг
Конфигурация под разные сети:
const CHAIN_CONFIGS = { ethereum: { rpc: INFURA_ETH, chunkSize: 1000, blockTime: 12 }, bsc: { rpc: BSC_RPC, chunkSize: 2000, blockTime: 3 }, polygon: { rpc: POLYGON_RPC, chunkSize: 1500, blockTime: 2 }, arbitrum: { rpc: ARB_RPC, chunkSize: 5000, blockTime: 0.25 }, }; Производительность и хранение
Для Ethereum: ~6500 блоков/день × ~6000 TX/блок = ~40M транзакций/день. Каждая с receipts: ~1-5 KB. Итого: ~40-200 GB/день для полного парсинга. Для большинства задач достаточно парсинга только целевых контрактов.
Хранение: PostgreSQL + TimescaleDB для time-series + S3 для raw архива. Критичные индексы: CREATE INDEX ON transactions (from_address, block_number DESC), CREATE INDEX ON transfers (token_address, block_number DESC).
| Тип данных | Типичный объём | Рекомендуемое хранилище |
|---|---|---|
| Транзакции + receipts | 40-200 GB/день | PostgreSQL + TimescaleDB |
| Логи событий | 5-20 GB/день | Columnar (ClickHouse) |
| Historical balances | Зависит от кол-ва адресов | S3 + кэш Redis |
Как мы работаем и что вы получаете
Мы проходим все этапы: от анализа требований до деплоя и мониторинга. В результате вы получаете:
- Архитектурную документацию
- Доступ к развернутой инфраструктуре
- Исходный код парсера с комментариями
- Обучение вашей команды
- Поддержку в течение 3 месяцев после сдачи
Сроки и стоимость
Базовый парсер для 2-3 сетей с PostgreSQL и REST API: 2-4 недели. Сложные проекты с кастомной логикой — до 8 недель. Стоимость рассчитывается индивидуально на основе ваших требований.
Для консультации и оценки вашего проекта свяжитесь с нами. Закажите разработку парсера под ваши задачи. Мы гарантируем прозрачность и эффективность.
Многолетний опыт в блокчейн-разработке, десятки успешных проектов по парсингу и индексации.







