Парсинг данных из GitHub (активность крипто-проектов)
Вы анализируете криптопроекты и хотите отсеять хайп? Количество коммитов, число активных контрибьюторов и частота релизов — объективные метрики разработки. Но GitHub API имеет rate limit, много ботов, а ручной сбор данных по 2000 репозиториям занимает недели. Мы автоматизируем сбор и очистку, предоставляя чистые временные ряды для вашего портфеля.
Почему GitHub-активность — надёжный сигнал?
В отличие от рыночных метрик, developer activity сложно накрутить. Подделка коммитов или истории репозитория требует прямого доступа к аккаунтам — это дорого и легко детектится. Около 80% проектов с высокой developer activity (более 50 коммитов в месяц) показывают устойчивый рост TVL. Наши клиенты используют эти данные для инвестиционного скрининга и мониторинга портфеля. Например, один клиент сэкономил $8000 на разработке собственного пайплайна, заказав готовое решение у нас.
Какие данные о разработке можно собрать через GraphQL?
GitHub предоставляет два API. Для сбора данных о репозиториях лучше подходит GraphQL API v4 — позволяет за один запрос получить данные, на которые REST потратил бы 5–10 запросов.
Официальная документация GitHub утверждает, что GraphQL API v4 предоставляет более эффективный и гибкий способ запроса данных. Источник
query RepoActivity($owner: String!, $repo: String!) {
repository(owner: $owner, name: $repo) {
stargazerCount
forkCount
defaultBranchRef {
target {
... on Commit {
history(first: 100) {
totalCount
nodes {
committedDate
author { name email }
additions
deletions
}
}
}
}
}
releases(last: 5) {
nodes { tagName createdAt }
}
issues(states: OPEN) { totalCount }
pullRequests(states: MERGED, last: 30) {
nodes { createdAt mergedAt }
}
}
}
Один запрос — и вы имеете коммиты за 100 последних дней, releases, open issues, merged PRs. Аутентификация: Personal Access Token (PAT) с public_repo scope.
Стандартный набор метрик для dashboard
| Метрика |
Endpoint / поле |
Частота сбора |
| Commit count (30d/90d) |
defaultBranchRef.target.history.totalCount |
Ежедневно |
| Active contributors |
defaultBranchRef.target.history.nodes[].author |
Ежедневно |
| Code churn (additions + deletions) |
history.nodes[].additions/deletions |
Ежедневно |
| Stars / forks |
stargazerCount, forkCount |
Ежедневно |
| Issues velocity |
Open issues + closed last 30d |
Еженедельно |
| PR merge time (median) |
pullRequests.mergedAt - createdAt |
Еженедельно |
| Release cadence |
Даты последних releases |
Еженедельно |
Contributor deduplication: один разработчик может коммитить с разными email. Нормализация через GitHub login (если коммит ассоциирован с аккаунтом) или fuzzy matching по имени. Боты (Dependabot, renovate, github-actions) нужно исключать из подсчёта человеческих контрибьюторов. В среднем 20% коммитов в популярных репозиториях вносятся ботами, поэтому фильтрация критична.
Как обойти rate limit при сборе 2000+ репозиториев?
Crypto-индекс из 200 проектов — каждый с 5–10 репозиториями — это 1000–2000 репозиториев. При ежедневном сборе и 5000 points/час лимите нужно управлять бюджетом запросов. Стоимость GraphQL запроса = sum(requested_nodes). Сложный запрос с 100 коммитами стоит ~100 points. Для 2000 репозиториев нужно ~200k points — это 40 часов при одном PAT токене.
Пример настройки пула PAT-токенов
import httpx
import asyncio
from collections import deque
class GitHubRateLimiter:
def __init__(self, tokens: list[str]):
self.tokens = deque(tokens)
self.current_remaining = {t: 5000 for t in tokens}
async def get_token(self) -> str:
# Rotate to token with most remaining points
token = max(self.tokens, key=lambda t: self.current_remaining[t])
if self.current_remaining[token] < 100:
await asyncio.sleep(3600) # Wait for reset
return token
async def graphql(self, query: str, variables: dict) -> dict:
token = await self.get_token()
async with httpx.AsyncClient() as client:
resp = await client.post(
"https://api.github.com/graphql",
json={"query": query, "variables": variables},
headers={"Authorization": f"Bearer {token}"},
)
# Update remaining from response headers
cost = resp.json().get("data", {}).get("rateLimit", {}).get("cost", 1)
self.current_remaining[token] -= cost
return resp.json()
Решения:
-
Несколько PAT токенов с ротацией. Пул из 10 токенов даёт 50k points/час — достаточно для ежедневного сбора 2000 репозиториев.
-
Incremental collection: не собирать всю историю каждый раз. Хранить
last_collected_at, запрашивать только новые коммиты через since параметр.
-
Prioritization: "горячие" репозитории (высокая активность, большой TVL проекта) собираются чаще, "холодные" — раз в неделю.
Маппинг проектов к репозиториям
Составление и поддержание списка project → github_repos — отдельная задача. Источники:
- Electric Capital Developer Report публикует open-source маппинг проектов к репозиториям на GitHub.
- DeFiLlama API имеет поле
github в данных протоколов: GET https://api.llama.fi/protocols возвращает список протоколов с github URL.
- Manual curation: для новых проектов или проектов с нестандартными github org именами.
Важный нюанс: крупные проекты (Ethereum, Solana, Uniswap) имеют десятки репозиториев в организации. Суммировать активность по всей org нужно с фильтрацией — repo-зеркала, форки, документационные репозитории искажают метрики.
Хранение и агрегация
TimescaleDB или ClickHouse для time-series метрик. Схема:
CREATE TABLE github_metrics (
project_id INTEGER,
repo_full_name TEXT,
measured_date DATE,
commits_30d INTEGER,
contributors_30d INTEGER,
additions_30d BIGINT,
deletions_30d BIGINT,
stars INTEGER,
open_issues INTEGER,
PRIMARY KEY (repo_full_name, measured_date)
);
-- Агрегат по проекту (все его репозитории)
CREATE VIEW project_dev_activity AS
SELECT project_id, measured_date,
SUM(commits_30d) AS total_commits,
COUNT(DISTINCT repo_full_name) AS active_repos,
SUM(contributors_30d) AS total_contributors
FROM github_metrics
GROUP BY project_id, measured_date;
Нормализованный developer activity score: log(commits + 1) × log(contributors + 1) — логарифмирование сглаживает outliers (один проект с 10k commits не должен доминировать в рейтинге).
Что входит в нашу работу по парсингу GitHub-активности
Мы предлагаем полный цикл сбора и анализа developer activity:
| Этап |
Результат |
| Аудит источников |
Список проектов с привязкой к репозиториям |
| Настройка пайплайна |
Асинхронный сбор через GraphQL с ротацией токенов |
| Фильтрация ботов |
Чистые данные по человеческому вкладу |
| Агрегация |
Ежедневные метрики в TimescaleDB + дашборд |
| Документация |
Описание схемы и методологии |
После сбора вы получаете доступ к сырым данным и визуализациям. Мы также обучаем вашу команду поддерживать пайплайн. Закажите парсинг GitHub-активности для вашего портфеля. Получите консультацию по настройке сбора данных — оценим объём и сроки работ.
Развертывание блокчейн-инфраструктуры: ноды, RPC, индексация
Subgraph упал в 3:47 ночи. К утру пользователи видели устаревшие балансы, транзакции «висели» в UI, поддержка получила 47 тикетов за час. Причина: handler в subgraph упал на транзакции с нестандартным event log — и весь индекс встал. Мы сталкивались с такими ситуациями десятки раз. Наш опыт показывает: блокчейн-инфраструктура не прощает gaps в observability. Гарантировать uptime без многослойного мониторинга и fault‑tolerant архитектуры невозможно. За 8 лет работы с Ethereum, Polygon и Solana мы выработали подход, который позволяет предсказуемо развёртывать инфраструктуру любого масштаба — от одиночной ноды до мультичейн‑сетки с десятками субграфов.
Архитектура RPC-слоя
Каждое взаимодействие dApp с блокчейном идёт через RPC — JSON‑RPC API, которую предоставляет нода. Три варианта:
Managed providers — Alchemy, QuickNode, Infura, Ankr. Минимальные операционные расходы, SLA, встроенный мониторинг. Ограничения: rate limits (Alchemy Free: 300 RU/sec), vendor lock, потенциальные downtime при инцидентах провайдера. Для большинства проектов — правильный выбор на старте.
Собственные ноды — полный контроль, нет rate limits, нет зависимости от третьих сторон. Стоимость: архивная нода Ethereum занимает 2.5–3TB SSD, требует мощный сервер и DevOps‑поддержку. Sync с нуля на Ethereum через Geth/Nethermind — 3–7 дней. Оправдано при высокой нагрузке или требованиях к latency.
Гибрид — собственная нода как primary, managed provider как fallback. Стандарт для протоколов с TVL от $10M. Правильная балансировка может сократить расходы на 20–30% по сравнению с чисто managed‑схемой. При нагрузке 10 млн запросов в месяц гибрид экономит от $1500 до $3000.
| Провайдер |
Сильная сторона |
Ограничение |
| Alchemy |
Supernode, Enhanced APIs, webhooks |
Дорогой на high-volume |
| QuickNode |
Низкая latency, multi-chain |
Дороже Alchemy на базовом плане |
| Infura |
Историческая надёжность |
Rate limits на бесплатном, один крупный инцидент остановил пол‑DeFi |
| Ankr |
Дешёвый, 40+ чейнов |
Менее стабильный |
Как настроить RPC-слой без единой точки отказа?
Минимум два провайдера, DNS round‑robin с health check каждые 5 секунд, автоматическое переключение на fallback при latency >500 мс. На практике это даёт 99.99% доступности при любом сбое провайдера. Для протоколов с TVL от $10M мы рекомендуем собственный HA‑прокси (nginx или Envoy) перед двумя managed‑провайдерами.
Почему гибридная RPC-схема выгоднее чисто managed?
При 50 млн запросов в месяц Alchemy стоит $2000+, QuickNode — $2500+, собственная нода — $400–600 за хостинг + DevOps. Гибрид: primary — своя нода ($500), fallback — QuickNode ($500), итого ~$1000. Экономия 50–60% без потери SLA.
Клиенты нод Ethereum
Execution clients: Geth (наиболее используемый), Nethermind (C#, быстрая sync), Besu (Java, enterprise), Erigon (самый быстрый sync, архивный режим эффективен по диску — ~2TB вместо 3TB).
Consensus clients (post‑Merge): Lighthouse (Rust), Prysm (Go), Teku (Java), Nimbus (Nim). Каждая нода после The Merge требует пары execution + consensus client.
Для DevOps: eth‑docker — Docker Compose конфигурации для всех комбинаций клиентов. Настройка мониторинга через Grafana + Prometheus — обязательна, стандартный дашборд есть в репозитории каждого клиента.
The Graph: индексация событий
The Graph Protocol — decentralized indexing. Subgraph описывает какие события с каких контрактов индексировать и как трансформировать их в GraphQL схему.
Структура subgraph:
-
subgraph.yaml — манифест: адреса контрактов, startBlock, события которые обрабатываются
-
schema.graphql — GraphQL схема entities
-
src/mapping.ts — AssemblyScript обработчики событий
dataSources:
- kind: ethereum
name: UniswapV3Pool
network: mainnet
source:
address: "0x88e6A0c2dDD26FEEb64F039a2c41296FcB3f5640"
abi: UniswapV3Pool
startBlock: 12370624
mapping:
eventHandlers:
- event: Swap(indexed address,indexed address,int256,int256,uint160,uint128,int24)
handler: handleSwap
AssemblyScript handlers — не TypeScript. Нет nullable types, нет closures, нет многих стандартных API. Ошибка в handler останавливает индексацию subgraph-а на той транзакции. Важно: добавлять try‑catch на операции которые могут падать (например store.get() для entity которая может не существовать).
Как избежать остановки индексации субграфа?
Лог файлы Graph Node мониторятся в реальном времени, при hasIndexingErrors = true срабатывает алерт и автоматический рестарт ноды (через systemd или Kubernetes). Типичный downtime при ошибке — 150–300 секунд до восстановления. Дополнительно: для production ставим watchdog, который перезапускает Graph Node если subgraph lag превышает 50 блоков.
Выбор между Hosted Service и Decentralized Network
Graph Hosted Service (бесплатный, централизованный) deprecated в пользу Subgraph Studio + Graph Network. Для продакшн: деплой на Graph Network с GRT curation signal — субграф получает indexers пропорционально curation.
Альтернативы The Graph: Ponder (TypeScript, self-hosted, проще дебагать), Envio (ultra‑fast indexer, поддерживает EVM + non‑EVM), Subsquid (TypeScript, своя сеть), Moralis Streams (managed, webhook‑based). Наш опыт показывает: для высоконагруженных проектов с уникальной логикой эффективнее Ponder или Envio — они дают полный контроль над процессом и не требуют токеномики GRT.
Webhooks и real-time нотификации
Alchemy Webhooks и QuickNode Streams позволяют получать события в реальном времени через HTTP webhook или WebSocket. Для мониторинга адресов, новых транзакций, минтов — это быстрее чем polling RPC.
Tenderly — платформа для мониторинга и алертов. Можно настроить alert на конкретный event из контракта, на изменение баланса, на вызов функции с определёнными параметрами. Симуляция транзакций через Tenderly API — бесценно для debugging.
Мониторинг и observability
Минимальный стек мониторинга для протокола:
On‑chain: OpenZeppelin Defender Sentinel — watches contract events, вызывает webhook или Autotask при срабатывании условий. Forta Network — community‑maintained боты детектируют аномалии (большие withdrawals, flash loans, governance attacks).
Infrastructure: Grafana + Prometheus для нод, Datadog или Grafana Cloud для managed метрик. Alert на: нода отстала на 10+ блоков, RPC latency > 500ms, subgraph lag > 100 блоков.
Uptime: Better Uptime или PagerDuty на RPC endpoint и subgraph health endpoint (The Graph предоставляет _meta { hasIndexingErrors, block { number } }).
Почему мониторинг без Tenderly недостаточен?
Tenderly даёт симуляцию транзакций и детальные трейсы — это критично для отладки ошибок в субграфах и смарт‑контрактах. Forta же фокусируется на аномалиях в сети, а не на вашей инфраструктуре. Комбинация Tenderly + собственный дашборд Grafana покрывает 90% сценариев инцидентов.
Мультичейн инфраструктура
Протокол на 5 чейнах = 5 отдельных RPC endpoints, 5 subgraphs, 5 мониторинг‑конфигов. Это управляемо, но нужна автоматизация деплоя.
Для subgraph multi‑network деплой: graph deploy --network mainnet, graph deploy --network arbitrum-one и т.д. с единой кодовой базой и network‑specific адресами в отдельных файлах конфигурации.
Chainlink CCIP и LayerZero для cross‑chain messaging требуют мониторинга состояния обоих чейнов и транзакций на intermediate relayers. Реорг на source chain при уже подтверждённом минте на target chain — классическая проблема мостов. Решение: ждать finality (на Ethereum ~15 минут после Merge для экономической finality) перед подтверждением на target chain.
Процесс настройки инфраструктуры
- Аудит текущего стека — определяем чейны, объём запросов, требования к latency и доступности.
- Проектирование архитектуры — выбор провайдеров, балансировка, redundancy.
- Разработка subgraph — манифест → схема → handlers → тестирование на локальной Graph Node → деплой на testnet → mainnet.
- Конфигурация мониторинга — Tenderly alerts, Grafana дашборд, PagerDuty интеграция.
- Документация и runbook — что делать при: subgraph fell behind, RPC downtime, нода desync.
- Передача в эксплуатацию — обучение команды, передача доступов, поддержка первый месяц.
Что входит в работу
- Развёртывание managed или self‑hosted нод Ethereum, Polygon, BNB Chain
- Настройка RPC‑слоя с primary/fallback и load balancing
- Разработка и деплой subgraph под ваш протокол
- Подключение мониторинга (Tenderly, Grafana, алерты)
- Создание runbook и документации по эксплуатации
- Обучение команды (до 4 часов онлайн)
- Поддержка в течение 30 дней после сдачи
Сроки
| Работа |
Срок |
| Настройка RPC и базового мониторинга |
1–2 недели |
| Subgraph для одного протокола |
2–4 недели |
| Self-hosted нода с мониторингом |
2–3 недели |
| Полная инфраструктура (multi-chain, мониторинг, runbooks) |
6–10 недель |
Все проекты ведутся в репозитории на GitHub/GitLab с CI/CD, код конфигураций остаётся у вас. Закажите развертывание инфраструктуры — расскажем, как сократить расходы на 20–30% без потери надёжности. JSON‑RPC спецификация, документация The Graph. Получите консультацию — покажем, как мы развёртывали инфраструктуру для протокола с TVL $50M+ на Ethereum и Arbitrum.
Свяжитесь с нами.