Після переходу з REST на GraphQL команди часто втрачають контроль над продуктивністю. Типова картина: запит гальмує, але незрозуміло, який резолвер винен. N+1 запити маскуються під нормальні відповіді, а несумісна зміна схеми ламає мобільний додаток. Ми впровадили моніторинг GraphQL для 50+ проєктів — від стартапів до enterprise — і знаємо, які інструменти реально працюють у production. В одному випадку p95 latency операцій зросла з 200 до 800 мс за тиждень. Тільки трасування резолверів показало, що проблема в новому обробнику user.orders, який робив 50 окремих запитів до бази. Моніторинг допоміг виявити це за годину, скоротивши час діагностики з годин до хвилин, і після усунення N+1 latency впала на 60%.
Проблеми, які вирішуємо
- Невидимість польового використання: Apollo Studio показує, які поля реально запитують клієнти. Це допомагає видалити deprecated поля без страху.
- Повільні резолвери без трасування: OpenTelemetry з Jaeger/Tempo дозволяє побачити, який саме обробник гальмує — до рівня аргументів.
- Breaking changes схеми: автоматична перевірка зворотної сумісності при кожному деплої запобігає падінню production.
Як ми це робимо: стек і конфіги
Apollo Studio (GraphOS)
// Установка npm install @apollo/server @apollo/server/plugin/usageReporting import { ApolloServer } from '@apollo/server' import { ApolloServerPluginUsageReporting } from '@apollo/server/plugin/usageReporting' const server = new ApolloServer({ typeDefs, resolvers, plugins: [ ApolloServerPluginUsageReporting({ // APOLLO_KEY зі змінних середовища sendVariableValues: { // Не відправляти чутливі змінні exceptNames: ['password', 'token', 'secret'] }, sendHeaders: { exceptNames: ['Authorization', 'Cookie'] }, // Вибірка трасувань (100% дорого, 10% достатньо для аналізу) fieldLevelInstrumentation: 0.1 }) ] }) Згідно з документацією Apollo Studio, платформа надає: розбивку p50/p95/p99 latency по операціях, field usage, schema checks з реальними клієнтськими запитами, алерти по деградації.
GraphQL Hive (self-hosted альтернатива)
# Docker Compose для GraphQL Hive docker run -d \ -e HIVE_TOKEN=your-token \ -e TARGET=your-org/your-project/production \ ghcr.io/kamilkisiela/graphql-hive/cli:latest import { useHive } from '@graphql-hive/client' import { envelop, useSchema } from '@envelop/core' const getEnveloped = envelop({ plugins: [ useSchema(schema), useHive({ enabled: true, token: process.env.HIVE_TOKEN, usage: { sampleRate: 1.0, exclude: ['IntrospectionQuery'] }, reporting: { author: 'CI Pipeline', commit: process.env.GIT_SHA } }) ] }) OpenTelemetry трасування резолверів
Для self-hosted моніторингу з Jaeger/Tempo використовуємо плагін, який створює span на кожен обробник. Це дозволяє бачити повну картину запиту, включаючи виклики до баз даних. OpenTelemetry — безкоштовний open-source, витрати лише на хостинг колектора (~$30-50/міс).
Порівняння Apollo Studio vs GraphQL Hive
| Критерій | Apollo Studio | GraphQL Hive |
|---|---|---|
| Hosting | Cloud (SaaS) | Self-hosted (Docker) |
| Field usage | Так, деталізація по клієнтах | Так, через usage reporting |
| Schema checks | Так, інтеграція з CI | Так, через @graphql-inspector |
| TTL даних | 90 днів за замовчуванням | Налаштовуваний (до 2 років) |
| Вартість | Безкоштовно для малих, платно для enterprise ($99/міс) | Open source, платний хостинг опціонально |
| Data residency | Регіони AWS | Повний контроль |
Apollo Studio зручніший для швидкого старту, але GraphQL Hive може бути економічнішим при великих обсягах (до 40% економії за рахунок self-hosted).
Типові метрики моніторингу
| Метрика | Цільове значення | Джерело |
|---|---|---|
| p95 latency | < 500 мс | Apollo/Hive |
| Error rate | < 1% | Apollo/Hive |
| N+1 queries | 0 | OpenTelemetry |
| Schema compliance | 100% | Schema checks |
Як вибрати між Apollo Studio та GraphQL Hive?
Якщо потрібне швидке хмарне рішення без адміністрування — Apollo Studio. Якщо вимоги до data residency або бюджет великий — обирайте Hive. Ми допомагаємо з вибором на етапі аудиту.
Чому варто додати OpenTelemetry додатково?
OpenTelemetry дає повне трасування запиту, включаючи виклики до сторонніх API та баз даних. Apollo Studio/Hive бачать лише GraphQL-шар. Поєднання дає 100% видимість. Це також дозволяє виявити вплив на Core Web Vitals за рахунок оптимізації TTFB.
Приклад: як OpenTelemetry врятував production
Клієнт скаржився на повільні відповіді, але метрики Apollo Studio не показували проблеми. OpenTelemetry розкрив, що один обробник робив 200 запитів до MongoDB замість одного через відсутність dataloader. Виправлення знизило latency в 4 рази.
Типові помилки при налаштуванні
- Занадто низький sample rate (менше 1%) — статистично недостовірні p99.
- Відсутність фільтрації чутливих даних — витік credentials через метрики.
- Ігнорування schema change alerts при деплої — ризик breaking changes.
Процес роботи з налаштування
-
Аналітика: аудит поточної схеми, виявлення вузьких місць за допомогою
@apollo/roverабоgraphql-inspector. - Проєктування: вибір інструменту (Apollo Studio, Hive або OpenTelemetry), проєктування метрик (p50/p95/p99, error rate, Prometheus метрики).
- Реалізація: інтеграція плагіна, налаштування трасування резолверів, публікація схеми.
- Тестування: перевірка на staging, порівняння показників до/після. В одному проєкті знизили p95 latency з 2с до 300 мс.
- Деплой і алерти: налаштування сповіщень у Slack/Telegram при деградації (наприклад, p95 latency > 500ms), а також Grafana дашборди.
Що входить і терміни
Налаштування GraphQL моніторингу займає від 2 до 5 робочих днів залежно від складності схеми та обраного рішення. Включає: підключення Apollo Studio або GraphQL Hive з публікацією схеми, трасування резолверів через OpenTelemetry (Jaeger/Tempo), Prometheus метрики + Grafana дашборд з панелями «Top Slow Operations», «Error Rate», «Slowest Resolvers», налаштування алертів та автоматичних перевірок зворотної сумісності, документацію з експлуатації.
Інвестиції в моніторинг окупаються в середньому за 2-3 місяці — скорочення часу на пошук проблем і запобігання інцидентам економить бюджети. Звертайтеся до нас для налаштування моніторингу під ваш проєкт. Отримайте консультацію щодо вибору інструментів та швидкої інтеграції.







