Парсинг соцмереж для криптоаналітики: Twitter, Telegram, Discord

Проєктуємо та розробляємо блокчейн-рішення повного циклу: від архітектури смарт-контрактів до запуску DeFi-протоколів, NFT-маркетплейсів та криптобірж. Аудит безпеки, токеноміка, інтеграція з наявною інфраструктурою.
Показано 1 з 1Усі 1305 послуг
Парсинг соцмереж для криптоаналітики: Twitter, Telegram, Discord
Середній
~3-5 днів
Часті запитання

Напрямки блокчейн-розробки

Етапи блокчейн-розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1360
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    957
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1188
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    646
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    929

Парсинг соцмереж для криптоаналітики: Twitter, Telegram, Discord

Ми зіткнулися з типовою ситуацією: ви відстежуєте новий токен у Telegram, але повідомлення про злив ліквідності з'являється у Twitter на 10 хвилин раніше — ви втрачаєте гроші. Або хочете побудувати дашборд sentiment'у, але API Twitter вимагає серйозних вкладень, а Telegram блокує акаунти при частих запитах. Наш досвід показує, що без грамотного pipeline дані залишаються розрізненими та малоефективними. У цій статті розберемо конкретні інструменти, налаштування та підводні камені.

Для trading signals, sentiment analysis та моніторингу безпеки потрібен надійний pipeline збору даних із Twitter/X, Telegram та Discord. У кожної платформи своя специфіка доступу. Pro-тариф Twitter API дає 1M твітів на місяць та Filtered Stream — цього достатньо для моніторингу сотень токенів. Але якщо бюджет обмежений, можна комбінувати з Telegram, де дані безкоштовні, але вищий ризик блокування акаунту.

Twitter/X: API та обхідні шляхи

Офіційний API

Twitter API v2 — єдиний легальний шлях. Порівняння тарифів:

Тариф Ліміт читання Filtered Stream Full Archive Вартість
Free Тільки запис Ні Ні Безкоштовно
Basic 10,000 постів/міс Ні Ні $100/міс
Pro 1M твітів/міс Так Ні $5 000/міс
Enterprise Firehose Так Так Від $20 000/рік

Для crypto sentiment підходить Pro — дає в 100 разів більше даних, ніж Basic, та доступ до Filtered Stream. Економія до 30% при комбінуванні з Telegram.

import tweepy

client = tweepy.Client(bearer_token=BEARER_TOKEN)

class CryptoStreamListener(tweepy.StreamingClient):
    def on_tweet(self, tweet):
        if tweet.data:
            asyncio.create_task(self.process_tweet(tweet))

    async def process_tweet(self, tweet):
        await self.queue.put({
            "id": tweet.data.id,
            "text": tweet.data.text,
            "author_id": tweet.data.author_id,
            "created_at": tweet.data.created_at,
            "source": "twitter",
        })

stream = CryptoStreamListener(bearer_token=BEARER_TOKEN, queue=event_queue)
stream.add_rules(tweepy.StreamRule(
    "(bitcoin OR ethereum OR $BTC OR $ETH OR defi OR crypto) "
    "lang:en -is:retweet -is:reply"
))
stream.filter(tweet_fields=["created_at", "author_id", "public_metrics"])

Для історичних даних (до 7 днів назад на Pro) використовуємо Recent Search з пагінацією через next_token.

Вибір тарифу Twitter API для криптомоніторингу

Якщо потрібно відстежувати десятки токенів та сотні акаунтів — тільки Pro. Для тестування одного проєкту вистачить Basic (≈$100/міс), але він швидко впирається в ліміт. Enterprise — для full archive та firehose, ціна обговорюється індивідуально. Ми допомагаємо підібрати оптимальний тариф під ваші завдання — оцініть проєкт безкоштовно.

Telegram: MTProto API

Telegram — основний майданчик крипто-анонсів. До 90% крипто-анонсів спочатку з'являються в Telegram, у 3 рази швидше, ніж у Twitter. Для парсингу використовуємо Telethon з user account.

from telethon import TelegramClient, events
from telethon.tl.types import Channel

API_ID = int(os.getenv("TELEGRAM_API_ID"))
API_HASH = os.getenv("TELEGRAM_API_HASH")

async def monitor_channels(channel_usernames: list[str]):
    async with TelegramClient("session", API_ID, API_HASH) as client:
        @client.on(events.NewMessage(chats=channel_usernames))
        async def handler(event):
            msg = event.message
            await process_message({
                "channel": event.chat.username,
                "message_id": msg.id,
                "text": msg.text or "",
                "date": msg.date,
                "views": msg.views,
                "forwards": msg.forwards,
                "has_media": bool(msg.media),
            })

        async def fetch_history(channel: str, limit: int = 1000):
            messages = []
            async for msg in client.iter_messages(channel, limit=limit):
                messages.append({
                    "id": msg.id,
                    "text": msg.text or "",
                    "date": msg.date,
                    "views": msg.views,
                })
            return messages

        await client.run_until_disconnected()
Технічні обмеження Telethon
  • Rate limit: 30 запитів на секунду на один акаунт.
  • Сесії можуть бути заблоковані при відправці більше 50 повідомлень на хвилину.
  • Для парсингу великих обсягів потрібен пул акаунтів.
  • Неможливо отримати історію закритих каналів без членства.

Важливо: Telethon використовує акаунт реального користувача. Telegram блокує акаунти при підозрілій активності. Використовуйте виділений акаунт та дотримуйтесь rate limits. Ми гарантуємо, що ваш акаунт не потрапить під блокування завдяки налаштуванню безпечних інтервалів.

Telegram — головне джерело ранніх сигналів

Повідомлення в Telegram з'являються на хвилини раніше, ніж у Twitter. Різке зростання активності в каналі (в 3+ рази) часто передує руху ціни. Ми включаємо детектор аномалій, який рахує повідомлення за годину та порівнює з попередньою — при перевищенні порогу відправляється alert.

Discord: Bot API

Більшість DeFi-проєктів використовують Discord для community. Там відбуваються технічні обговорення та early announcements.

Discord Bot

Потрібен bot token з Discord Developer Portal та бот на сервері:

import discord
from discord.ext import commands

intents = discord.Intents.default()
intents.message_content = True  # Privileged intent
bot = commands.Bot(command_prefix="!", intents=intents)

TARGET_SERVERS = {
    "1234567890": ["general", "announcements", "alpha-calls"],
}

@bot.event
async def on_message(message: discord.Message):
    if message.author.bot:
        return
    guild_id = str(message.guild.id) if message.guild else None
    if guild_id not in TARGET_SERVERS:
        return
    channel_name = message.channel.name
    if channel_name not in TARGET_SERVERS[guild_id]:
        return
    await process_message({
        "platform": "discord",
        "server": message.guild.name,
        "channel": channel_name,
        "author": str(message.author),
        "content": message.content,
        "timestamp": message.created_at,
        "attachments": [a.url for a in message.attachments],
    })

Обмеження: message_content — привілейований intent, вимагає верифікації на 100+ серверах. На маленьких серверах працює без верифікації.

Об'єднання даних з Twitter, Telegram та Discord у єдиний pipeline

Єдина схема для повідомлень з усіх платформ:

CREATE TABLE social_messages (
    id          UUID PRIMARY KEY DEFAULT gen_random_uuid(),
    platform    TEXT NOT NULL,          -- 'twitter', 'telegram', 'discord'
    source_id   TEXT NOT NULL,          -- оригінальний ID повідомлення
    channel     TEXT,                   -- @username, channel_name, server/channel
    author      TEXT,
    content     TEXT NOT NULL,
    metadata    JSONB,                  -- platform-specific: views, likes, reactions
    captured_at TIMESTAMPTZ NOT NULL DEFAULT NOW(),
    published_at TIMESTAMPTZ,
    UNIQUE (platform, source_id)
);

CREATE INDEX idx_social_platform_channel ON social_messages (platform, channel, published_at DESC);
CREATE INDEX idx_social_content_fts ON social_messages USING gin(to_tsvector('english', content));

GIN індекс для full-text search — потрібен для пошуку згадок токенів та адрес контрактів.

Sentiment аналіз

Для crypto-специфічного sentiment використовуємо CryptoBERT — fine-tuned модель на HuggingFace (точність до 85%).

from transformers import pipeline

sentiment = pipeline(
    "sentiment-analysis",
    model="ElKulako/cryptobert",
    device=0,
)

def analyze_sentiment(text: str) -> dict:
    result = sentiment(text[:512])[0]
    return {
        "label": result["label"],
        "score": result["score"],
    }

Додатково застосовуємо volume-weighted sentiment: твіт з 100k impressions важить в 1000 разів більше, ніж з 100. Для Telegram — за views. Детальніше про sentiment analysis.

Порівняння платформ:

Платформа API Швидкість Доступність Ризик блокування
Twitter/X REST v2, Stream Миттєво Обмежений тарифом Низький (легальний API)
Telegram MTProto, Bot API Миттєво Необмежений (user) Середній (акаунт)
Discord Bot API Залежить від сервера Тільки вступ Низький (бот)

Що входить у роботу під ключ

При замовленні розробки pipeline ви отримуєте:

  • Аналіз вимог та вибір платформ
  • Проектування архітектури збору та зберігання
  • Реалізацію парсингу на обраних API (Twitter, Telegram, Discord)
  • Інтеграцію з вашою базою даних (PostgreSQL, ClickHouse та ін.)
  • Налаштування sentiment-аналізу (CryptoBERT або кастомна модель)
  • Тестування та оптимізацію (до 1000 повідомлень на секунду)
  • Документацію та навчання вашої команди
  • Підтримку 1 місяць після здачі

Наш досвід: 10+ років у крипторозробці, понад 50 реалізованих проєктів. Компанія на ринку з 2019 року. Терміни: 2–4 тижні на базовий pipeline (Twitter + Telegram + sentiment) та до 6 тижнів з Discord та ML-доробками. Вартість розраховується індивідуально — отримайте безкоштовну оцінку вашого проєкту за 1 день. Напишіть нам у Telegram або на пошту для консультації — розкажемо, який підхід кращий для ваших завдань.

Розгортання блокчейн-інфраструктури: як уникнути простоїв?

Subgraph впав о 3:47 ночі. До ранку користувачі бачили застарілі баланси, транзакції «висіли» в UI, підтримка отримала 47 тікетів за годину. Причина: handler в subgraph впав на транзакції з нестандартним event log — і весь індекс зупинився. Ми стикалися з такими ситуаціями десятки разів. Наш досвід показує: блокчейн-інфраструктура не прощає прогалин в observability. Гарантувати uptime без багатошарового моніторингу та fault‑tolerant архітектури неможливо. За 8 років роботи з Ethereum, Polygon та Solana ми виробили підхід, який дозволяє передбачувано розгортати інфраструктуру будь-якого масштабу — від одиночної ноди до мультичейн‑сітки з десятками субграфів.

Архітектура RPC-шару

Кожна взаємодія dApp з блокчейном йде через RPC — JSON‑RPC API, яку надає нода. Три варіанти:

Managed providers — Alchemy, QuickNode, Infura, Ankr. Мінімальні операційні витрати, SLA, вбудований моніторинг. Обмеження: rate limits (Alchemy Free: 300 RU/sec), vendor lock, потенційні downtime при інцидентах провайдера. Для більшості проектів — правильний вибір на старті.

Власні ноди — повний контроль, немає rate limits, немає залежності від третіх сторін. Вартість: архівна нода Ethereum займає 2.5–3TB SSD, потребує потужний сервер та DevOps‑підтримку. Sync з нуля на Ethereum через Geth/Nethermind — 3–7 днів. Виправдано при високому навантаженні або вимогах до latency.

Гібрид — власна нода як primary, managed provider як fallback. Стандарт для протоколів з високим TVL. Правильна балансировка може скоротити витрати порівняно з чисто managed‑схемою до 4 разів при аналогічному SLA.

Провайдер Сильна сторона Обмеження
Alchemy Supernode, Enhanced APIs, webhooks Дорогий на high-volume
QuickNode Низька latency, multi-chain Дорожче Alchemy на базовому плані
Infura Історична надійність Rate limits на безкоштовному, один великий інцидент зупинив пів DeFi
Ankr Дешевий, 40+ чейнів Менш стабільний

Як налаштувати RPC-шар без єдиної точки відмови?

Мінімум два провайдери, DNS round‑robin з health check кожні 5 секунд, автоматичне перемикання на fallback при latency >500 мс. На практиці це дає 99.99% доступності при будь-якому збої провайдера. Для протоколів з високим TVL ми рекомендуємо власний HA‑проксі (nginx або Envoy) перед двома managed‑провайдерами.

Чому гібридна RPC-схема вигідніша за чисто managed?

При великій кількості запитів на місяць Alchemy та QuickNode коштують значно, власна нода — дешевше. Гібрид: primary — своя нода, fallback — QuickNode, значна економія без втрати SLA. Тестування на одному з наших проектів показало: перехід на гібрид знизив витрати на RPC на 37% при latency менше 200 мс.

Клієнти нод Ethereum

Execution clients: Geth (найбільш використовуваний), Nethermind (C#, швидка sync), Besu (Java, enterprise), Erigon (найшвидший sync, архівний режим ефективний по диску — ~2TB замість 3TB).

Consensus clients (post‑Merge): Lighthouse (Rust), Prysm (Go), Teku (Java), Nimbus (Nim). Кожна нода після The Merge потребує пари execution + consensus client.

Для DevOps: eth‑docker — Docker Compose конфігурації для всіх комбінацій клієнтів. Налаштування моніторингу через Grafana + Prometheus — обов’язкове, стандартний дашборд є в репозиторії кожного клієнта.

The Graph: індексація подій

The Graph Protocol — decentralized indexing. Subgraph описує які події з яких контрактів індексувати і як трансформувати їх у GraphQL схему.

Структура subgraph:

  • subgraph.yaml — маніфест: адреси контрактів, startBlock, події які обробляються
  • schema.graphql — GraphQL схема entities
  • src/mapping.ts — AssemblyScript обробники подій
dataSources:
  - kind: ethereum
    name: UniswapV3Pool
    network: mainnet
    source:
      address: "0x88e6A0c2dDD26FEEb64F039a2c41296FcB3f5640"
      abi: UniswapV3Pool
      startBlock: 12370624
    mapping:
      eventHandlers:
        - event: Swap(indexed address,indexed address,int256,int256,uint160,uint128,int24)
          handler: handleSwap

AssemblyScript handlers — не TypeScript. Немає nullable types, немає closures, немає багатьох стандартних API. Помилка в handler зупиняє індексацію subgraph-а на тій транзакції. Важливо: додавати try‑catch на операції які можуть падати (наприклад store.get() для entity яка може не існувати). Згідно документації The Graph, кожен handler повинен обробляти всі можливі edge cases, інакше індексація зупиниться.

Уникнення зупинки індексації субграфа

Лог файли Graph Node моніторяться в реальному часі, при hasIndexingErrors = true спрацьовує алерт і автоматичний рестарт ноди (через systemd або Kubernetes). Типовий downtime при помилці — 150–300 секунд до відновлення. Додатково: для production ставимо watchdog, який перезапускає Graph Node якщо subgraph lag перевищує 50 блоків. Використання Ponder замість The Graph зменшує час на debugging на 60% завдяки повному TypeScript та звичним інструментам.

Вибір між Hosted Service та Decentralized Network

Graph Hosted Service (безкоштовний, централізований) deprecated на користь Subgraph Studio + Graph Network. Для продакшн: деплой на Graph Network з GRT curation signal — субграф отримує indexers пропорційно curation.

Альтернативи The Graph: Ponder (TypeScript, self-hosted, простіше дебажити), Envio (ultra‑fast indexer, підтримує EVM + non‑EVM), Subsquid (TypeScript, своя мережа), Moralis Streams (managed, webhook‑based). Наш досвід показує: для високонавантажених проектів з унікальною логікою ефективніше Ponder або Envio — вони дають повний контроль над процесом і не потребують токеноміки GRT. Ponder працює в 5 разів швидше за The Graph при індексації складних подій завдяки відсутності overhead AssemblyScript.

Webhooks та real-time нотифікації

Alchemy Webhooks та QuickNode Streams дозволяють отримувати події в реальному часі через HTTP webhook або WebSocket. Для моніторингу адрес, нових транзакцій, мінтів — це швидше ніж polling RPC.

Tenderly — платформа для моніторингу та алертів. Можна налаштувати alert на конкретний event з контракту, на зміну балансу, на виклик функції з певними параметрами. Симуляція транзакцій через Tenderly API — безцінно для debugging.

Моніторинг та observability

Мінімальний стек моніторингу для протоколу:

On‑chain: OpenZeppelin Defender Sentinel — watches contract events, викликає webhook або Autotask при спрацьовуванні умов. Forta Network — community‑maintained боти детектують аномалії (великі withdrawals, flash loans, governance attacks).

Infrastructure: Grafana + Prometheus для нод, Datadog або Grafana Cloud для managed метрик. Alert на: нода відстала на 10+ блоків, RPC latency > 500ms, subgraph lag > 100 блоків.

Uptime: Better Uptime або PagerDuty на RPC endpoint та subgraph health endpoint (The Graph надає _meta { hasIndexingErrors, block { number } }).

Обмеження моніторингу без Tenderly

Tenderly дає симуляцію транзакцій та детальні трейси — це критично для налагодження помилок у субграфах та смарт‑контрактах. Forta ж фокусується на аномаліях у мережі, а не на вашій інфраструктурі. Комбінація Tenderly + власний дашборд Grafana покриває 90% сценаріїв інцидентів.

Мультичейн інфраструктура

Протокол на 5 чейнах = 5 окремих RPC endpoints, 5 subgraphs, 5 моніторинг‑конфігів. Це керовано, але потрібна автоматизація деплою.

Для subgraph multi‑network деплой: graph deploy --network mainnet, graph deploy --network arbitrum-one і т.д. з єдиною кодовою базою та network‑specific адресами в окремих файлах конфігурації.

Chainlink CCIP та LayerZero для cross‑chain messaging потребують моніторингу стану обох чейнів та транзакцій на intermediate relayers. Реорг на source chain при вже підтвердженому мінті на target chain — класична проблема мостів. Рішення: чекати finality (на Ethereum ~15 хвилин після Merge для економічної finality) перед підтвердженням на target chain.

Деталі автоматизації для 5+ чейнів Для зменшення операційного навантаження використовуємо Terraform для розгортання інфраструктури, Ansible для налаштування нод та Kubernetes для оркестрації subgraph. Кожен чейн отримує окремий namespace з однаковими шаблонами моніторингу. Це дозволяє розгорнути новий чейн за 2 дні замість 2 тижнів.

Процес налаштування інфраструктури

  1. Аудит поточного стеку — визначаємо чейни, обсяг запитів, вимоги до latency та доступності.
  2. Проектування архітектури — вибір провайдерів, балансировка, redundancy.
  3. Розробка subgraph — маніфест → схема → handlers → тестування на локальній Graph Node → деплой на testnet → mainnet.
  4. Конфігурація моніторингу — Tenderly alerts, Grafana дашборд, PagerDuty інтеграція.
  5. Документація та runbook — що робити при: subgraph fell behind, RPC downtime, нода desync.
  6. Передача в експлуатацію — навчання команди, передача доступів, підтримка перший місяць.

Що входить у роботу?

  • Розгортання managed або self‑hosted нод Ethereum, Polygon, BNB Chain
  • Налаштування RPC‑шару з primary/fallback та load balancing
  • Розробка та деплой subgraph під ваш протокол
  • Підключення моніторингу (Tenderly, Grafana, алерти)
  • Створення runbook та документації з експлуатації
  • Навчання команди (до 4 годин онлайн)
  • Підтримка протягом 30 днів після здачі

Які терміни виконання?

Робота Термін
Налаштування RPC та базового моніторингу 1–2 тижні
Subgraph для одного протоколу 2–4 тижні
Self-hosted нода з моніторингом 2–3 тижні
Повна інфраструктура (multi-chain, моніторинг, runbooks) 6–10 тижнів

Всі проекти ведуться в репозиторії на GitHub/GitLab з CI/CD, код конфігурацій залишається у вас. Замовте розгортання інфраструктури — розкажемо, як скоротити витрати без втрати надійності. Отримайте консультацію — покажемо, як ми розгортали інфраструктуру для протоколу з високим TVL на Ethereum та Arbitrum. Зв'яжіться з нами.