Настройка автоматического перезапуска торгового бота
Торговый бот работает 24/7. Сбой из-за сетевой ошибки, OOM, необработанного исключения или обновления системы — и процесс падает. Без автоперезапуска бот остаётся мёртвым, пока не вмешается оператор. Чем дольше простой, тем больше упущенная прибыль и риск пропустить торговые сигналы. В production мы добиваемся uptime 99.9% за счёт связки systemd, graceful shutdown и алертов. Расскажу, как это настроить, на примере реального проекта: бот на Python с aiohttp, работающий на Ubuntu 22.04 с 4 ядрами. Мы используем systemd для управления, Docker для изоляции и Prometheus для мониторинга.
systemd — стандартный менеджер сервисов в Linux. Он умеет автоматически перезапускать процесс, ограничивать ресурсы и логировать. Но одной настройки Restart=always недостаточно — нужна защита от crash loop. Рассмотрим три ключевых компонента: systemd unit, graceful shutdown в коде бота и алерты при сбоях. Для контейнеризированных ботов дополним Docker restart policy и health check.
Как настроить systemd для автоматического перезапуска?
Создайте unit-файл в /etc/systemd/system/ с параметрами Restart=always и RestartSec=10. Дополнительно укажите StartLimitBurst=5 и StartLimitIntervalSec=60, чтобы избежать бесконечного перезапуска при критической ошибке. Активируйте сервис: systemctl enable trading-bot.
# /etc/systemd/system/trading-bot.service
[Unit]
Description=Trading Bot
After=network-online.target
Wants=network-online.target
[Service]
Type=simple
User=botuser
WorkingDirectory=/opt/trading-bot
ExecStart=/opt/trading-bot/venv/bin/python -u bot.py
Restart=always
RestartSec=10
StartLimitIntervalSec=60
StartLimitBurst=5
EnvironmentFile=/opt/trading-bot/.env
MemoryLimit=2G
CPUQuota=80%
StandardOutput=journal
StandardError=journal
SyslogIdentifier=trading-bot
[Install]
WantedBy=multi-user.target
Активация:
systemctl daemon-reload
systemctl enable trading-bot
systemctl start trading-bot
journalctl -u trading-bot -f # live логи
Параметр StartLimitBurst=5 + StartLimitIntervalSec=60 — защита от crash loop. Без неё бот при постоянных падениях будет непрерывно перезапускаться, накапливая ошибки (открытые позиции, дублирующиеся ордера). После 5 быстрых падений systemd остановит службу и отправит алерт (если настроен). Это в 5 раз надёжнее, чем простой cron-мониторинг.
Параметры systemd unit: подробный разбор
| Параметр |
Описание |
Пример |
| Restart |
Политика перезапуска |
always |
| RestartSec |
Пауза между рестартами |
10 |
| StartLimitBurst |
Лимит быстрых перезапусков |
5 |
| StartLimitIntervalSec |
Интервал для лимита |
60 |
| MemoryLimit |
Ограничение памяти |
2G |
| CPUQuota |
Квоты CPU |
80% |
Эти параметры повышают стабильность: бот не падает из‑за перегрузок, а при частых ошибках systemd блокирует запуск, предотвращая потерю средств из‑за двойных ордеров.
Что такое graceful shutdown и зачем он нужен?
Бота нельзя убивать SIGKILL — можно оставить открытые ордера, незафиксированные позиции, неотправленные алерты. Обрабатываем SIGTERM:
import signal
import asyncio
class TradingBot:
def __init__(self):
self.running = True
self.open_orders: list = []
async def shutdown(self):
self.running = False
for order_id in self.open_orders:
try:
await self.exchange.cancel_order(order_id)
except Exception as e:
logger.error(f"Failed to cancel order {order_id}: {e}")
logger.info("Graceful shutdown complete")
async def run(self):
loop = asyncio.get_event_loop()
loop.add_signal_handler(
signal.SIGTERM,
lambda: asyncio.create_task(self.shutdown())
)
while self.running:
try:
await self.main_loop()
except Exception as e:
logger.exception(f"Error in main loop: {e}")
await asyncio.sleep(5)
systemd при systemctl stop шлёт SIGTERM, затем через TimeoutStopSec (default 90 сек) — SIGKILL. Для бота с позициями 90 секунд обычно достаточно.
Docker: альтернатива для контейнеризированных ботов
Если бот запускается в Docker, используйте restart: unless-stopped — он перезапускает при падении и при перезагрузке хоста, но не при ручной остановке. Health check критически важен: Docker перезапускает контейнер только при полном падении, а зависание без ошибки не заметит.
# docker-compose.yml
services:
trading-bot:
image: trading-bot:latest
restart: unless-stopped
env_file: .env
volumes:
- ./data:/app/data
- ./logs:/app/logs
mem_limit: 2g
logging:
driver: "json-file"
options:
max-size: "100m"
max-file: "5"
healthcheck:
test: ["CMD", "python", "-c", "import requests; requests.get('http://localhost:8080/health', timeout=5)"]
interval: 30s
timeout: 10s
retries: 3
start_period: 60s
Пример health-эндпоинта на aiohttp:
from aiohttp import web
async def health_check(request):
last_loop_age = time.time() - bot.last_loop_time
if last_loop_age > 300:
return web.Response(status=503, text=f"Bot stuck: last loop {last_loop_age:.0f}s ago")
if not bot.exchange_connected:
return web.Response(status=503, text="Exchange disconnected")
return web.Response(status=200, text="OK")
app = web.Application()
app.router.add_get('/health', health_check)
Сравнение systemd и Docker для автоперезапуска
| Параметр |
systemd |
Docker |
| Механизм перезапуска |
systemd unit |
restart policy |
| Защита от crash loop |
StartLimitBurst + Interval |
Нет встроенной (только health) |
| Graceful shutdown |
SIGTERM + TimeoutStopSec |
SIGTERM + stop_grace_period |
| Мониторинг зависаний |
Нет встроенного |
Health check |
| Рекомендация |
Для собственных Linux‑серверов |
Для контейнеризированной инфраструктуры |
Почему нужны алерты при падении?
Сам факт перезапуска должен генерировать уведомление — даже если бот восстановился автоматически. Минимальное решение — Telegram-бот с именем хоста и временем. В systemd это делается через OnFailure=trading-bot-notify.service. Для Prometheus: правило changes(process_start_time_seconds{job="trading-bot"}[5m]) > 0. Получите консультацию по настройке алертов — подскажем оптимальное решение для вашей инфраструктуры.
Что входит в настройку автоматического перезапуска (deliverables)
- Конфигурация systemd unit или Docker compose с защитой от crash loop
- Реализация graceful shutdown с обработкой открытых ордеров
- Health check endpoint с проверкой состояния бота и биржи
- Настройка алертов (Telegram / Slack) при падении и частых рестартах
- Тестирование на staging-окружении до выхода в production
- Документация конфигурации и инструкция для вашей команды
- 5+ лет опыта в блокчейн-разработке — гарантируем стабильность
Пример crash loop и его последствия
Если бот падает каждые 5 секунд из-за ошибки подключения к бирже, без StartLimitBurst systemd будет перезапускать его бесконечно. Каждый запуск может попытаться отменить ордера или создать новые, что приведёт к двойным позициям. С StartLimitBurst=5 после пятой попытки systemd остановит сервис, и вы получите алерт. Это спасёт от финансовых потерь.
Закажите настройку торгового бота в компании TrueTech — мы обеспечим стабильную работу 24/7. Получите консультацию по конфигурации systemd, Docker и алертов.
Развертывание блокчейн-инфраструктуры: ноды, RPC, индексация
Subgraph упал в 3:47 ночи. К утру пользователи видели устаревшие балансы, транзакции «висели» в UI, поддержка получила 47 тикетов за час. Причина: handler в subgraph упал на транзакции с нестандартным event log — и весь индекс встал. Мы сталкивались с такими ситуациями десятки раз. Наш опыт показывает: блокчейн-инфраструктура не прощает gaps в observability. Гарантировать uptime без многослойного мониторинга и fault‑tolerant архитектуры невозможно. За 8 лет работы с Ethereum, Polygon и Solana мы выработали подход, который позволяет предсказуемо развёртывать инфраструктуру любого масштаба — от одиночной ноды до мультичейн‑сетки с десятками субграфов.
Архитектура RPC-слоя
Каждое взаимодействие dApp с блокчейном идёт через RPC — JSON‑RPC API, которую предоставляет нода. Три варианта:
Managed providers — Alchemy, QuickNode, Infura, Ankr. Минимальные операционные расходы, SLA, встроенный мониторинг. Ограничения: rate limits (Alchemy Free: 300 RU/sec), vendor lock, потенциальные downtime при инцидентах провайдера. Для большинства проектов — правильный выбор на старте.
Собственные ноды — полный контроль, нет rate limits, нет зависимости от третьих сторон. Стоимость: архивная нода Ethereum занимает 2.5–3TB SSD, требует мощный сервер и DevOps‑поддержку. Sync с нуля на Ethereum через Geth/Nethermind — 3–7 дней. Оправдано при высокой нагрузке или требованиях к latency.
Гибрид — собственная нода как primary, managed provider как fallback. Стандарт для протоколов с TVL от $10M. Правильная балансировка может сократить расходы на 20–30% по сравнению с чисто managed‑схемой. При нагрузке 10 млн запросов в месяц гибрид экономит от $1500 до $3000.
| Провайдер |
Сильная сторона |
Ограничение |
| Alchemy |
Supernode, Enhanced APIs, webhooks |
Дорогой на high-volume |
| QuickNode |
Низкая latency, multi-chain |
Дороже Alchemy на базовом плане |
| Infura |
Историческая надёжность |
Rate limits на бесплатном, один крупный инцидент остановил пол‑DeFi |
| Ankr |
Дешёвый, 40+ чейнов |
Менее стабильный |
Как настроить RPC-слой без единой точки отказа?
Минимум два провайдера, DNS round‑robin с health check каждые 5 секунд, автоматическое переключение на fallback при latency >500 мс. На практике это даёт 99.99% доступности при любом сбое провайдера. Для протоколов с TVL от $10M мы рекомендуем собственный HA‑прокси (nginx или Envoy) перед двумя managed‑провайдерами.
Почему гибридная RPC-схема выгоднее чисто managed?
При 50 млн запросов в месяц Alchemy стоит $2000+, QuickNode — $2500+, собственная нода — $400–600 за хостинг + DevOps. Гибрид: primary — своя нода ($500), fallback — QuickNode ($500), итого ~$1000. Экономия 50–60% без потери SLA.
Клиенты нод Ethereum
Execution clients: Geth (наиболее используемый), Nethermind (C#, быстрая sync), Besu (Java, enterprise), Erigon (самый быстрый sync, архивный режим эффективен по диску — ~2TB вместо 3TB).
Consensus clients (post‑Merge): Lighthouse (Rust), Prysm (Go), Teku (Java), Nimbus (Nim). Каждая нода после The Merge требует пары execution + consensus client.
Для DevOps: eth‑docker — Docker Compose конфигурации для всех комбинаций клиентов. Настройка мониторинга через Grafana + Prometheus — обязательна, стандартный дашборд есть в репозитории каждого клиента.
The Graph: индексация событий
The Graph Protocol — decentralized indexing. Subgraph описывает какие события с каких контрактов индексировать и как трансформировать их в GraphQL схему.
Структура subgraph:
-
subgraph.yaml — манифест: адреса контрактов, startBlock, события которые обрабатываются
-
schema.graphql — GraphQL схема entities
-
src/mapping.ts — AssemblyScript обработчики событий
dataSources:
- kind: ethereum
name: UniswapV3Pool
network: mainnet
source:
address: "0x88e6A0c2dDD26FEEb64F039a2c41296FcB3f5640"
abi: UniswapV3Pool
startBlock: 12370624
mapping:
eventHandlers:
- event: Swap(indexed address,indexed address,int256,int256,uint160,uint128,int24)
handler: handleSwap
AssemblyScript handlers — не TypeScript. Нет nullable types, нет closures, нет многих стандартных API. Ошибка в handler останавливает индексацию subgraph-а на той транзакции. Важно: добавлять try‑catch на операции которые могут падать (например store.get() для entity которая может не существовать).
Как избежать остановки индексации субграфа?
Лог файлы Graph Node мониторятся в реальном времени, при hasIndexingErrors = true срабатывает алерт и автоматический рестарт ноды (через systemd или Kubernetes). Типичный downtime при ошибке — 150–300 секунд до восстановления. Дополнительно: для production ставим watchdog, который перезапускает Graph Node если subgraph lag превышает 50 блоков.
Выбор между Hosted Service и Decentralized Network
Graph Hosted Service (бесплатный, централизованный) deprecated в пользу Subgraph Studio + Graph Network. Для продакшн: деплой на Graph Network с GRT curation signal — субграф получает indexers пропорционально curation.
Альтернативы The Graph: Ponder (TypeScript, self-hosted, проще дебагать), Envio (ultra‑fast indexer, поддерживает EVM + non‑EVM), Subsquid (TypeScript, своя сеть), Moralis Streams (managed, webhook‑based). Наш опыт показывает: для высоконагруженных проектов с уникальной логикой эффективнее Ponder или Envio — они дают полный контроль над процессом и не требуют токеномики GRT.
Webhooks и real-time нотификации
Alchemy Webhooks и QuickNode Streams позволяют получать события в реальном времени через HTTP webhook или WebSocket. Для мониторинга адресов, новых транзакций, минтов — это быстрее чем polling RPC.
Tenderly — платформа для мониторинга и алертов. Можно настроить alert на конкретный event из контракта, на изменение баланса, на вызов функции с определёнными параметрами. Симуляция транзакций через Tenderly API — бесценно для debugging.
Мониторинг и observability
Минимальный стек мониторинга для протокола:
On‑chain: OpenZeppelin Defender Sentinel — watches contract events, вызывает webhook или Autotask при срабатывании условий. Forta Network — community‑maintained боты детектируют аномалии (большие withdrawals, flash loans, governance attacks).
Infrastructure: Grafana + Prometheus для нод, Datadog или Grafana Cloud для managed метрик. Alert на: нода отстала на 10+ блоков, RPC latency > 500ms, subgraph lag > 100 блоков.
Uptime: Better Uptime или PagerDuty на RPC endpoint и subgraph health endpoint (The Graph предоставляет _meta { hasIndexingErrors, block { number } }).
Почему мониторинг без Tenderly недостаточен?
Tenderly даёт симуляцию транзакций и детальные трейсы — это критично для отладки ошибок в субграфах и смарт‑контрактах. Forta же фокусируется на аномалиях в сети, а не на вашей инфраструктуре. Комбинация Tenderly + собственный дашборд Grafana покрывает 90% сценариев инцидентов.
Мультичейн инфраструктура
Протокол на 5 чейнах = 5 отдельных RPC endpoints, 5 subgraphs, 5 мониторинг‑конфигов. Это управляемо, но нужна автоматизация деплоя.
Для subgraph multi‑network деплой: graph deploy --network mainnet, graph deploy --network arbitrum-one и т.д. с единой кодовой базой и network‑specific адресами в отдельных файлах конфигурации.
Chainlink CCIP и LayerZero для cross‑chain messaging требуют мониторинга состояния обоих чейнов и транзакций на intermediate relayers. Реорг на source chain при уже подтверждённом минте на target chain — классическая проблема мостов. Решение: ждать finality (на Ethereum ~15 минут после Merge для экономической finality) перед подтверждением на target chain.
Процесс настройки инфраструктуры
- Аудит текущего стека — определяем чейны, объём запросов, требования к latency и доступности.
- Проектирование архитектуры — выбор провайдеров, балансировка, redundancy.
- Разработка subgraph — манифест → схема → handlers → тестирование на локальной Graph Node → деплой на testnet → mainnet.
- Конфигурация мониторинга — Tenderly alerts, Grafana дашборд, PagerDuty интеграция.
- Документация и runbook — что делать при: subgraph fell behind, RPC downtime, нода desync.
- Передача в эксплуатацию — обучение команды, передача доступов, поддержка первый месяц.
Что входит в работу
- Развёртывание managed или self‑hosted нод Ethereum, Polygon, BNB Chain
- Настройка RPC‑слоя с primary/fallback и load balancing
- Разработка и деплой subgraph под ваш протокол
- Подключение мониторинга (Tenderly, Grafana, алерты)
- Создание runbook и документации по эксплуатации
- Обучение команды (до 4 часов онлайн)
- Поддержка в течение 30 дней после сдачи
Сроки
| Работа |
Срок |
| Настройка RPC и базового мониторинга |
1–2 недели |
| Subgraph для одного протокола |
2–4 недели |
| Self-hosted нода с мониторингом |
2–3 недели |
| Полная инфраструктура (multi-chain, мониторинг, runbooks) |
6–10 недель |
Все проекты ведутся в репозитории на GitHub/GitLab с CI/CD, код конфигураций остаётся у вас. Закажите развертывание инфраструктуры — расскажем, как сократить расходы на 20–30% без потери надёжности. JSON‑RPC спецификация, документация The Graph. Получите консультацию — покажем, как мы развёртывали инфраструктуру для протокола с TVL $50M+ на Ethereum и Arbitrum.
Свяжитесь с нами.