Розробка AI-системи моніторингу Reddit для торгових сигналів
Уявіть: ви трейдер, щодня переглядаєте r/wallstreetbets у пошуках ідей. 500 постів на годину, 90% — меми та спам. Ви витрачаєте 3 години на день, пропускаєте сигнали. Ми вирішуємо це: автоматичний парсинг, очищення та NLP-аналіз у реальному часі з точністю F1 > 0.85. Використовуємо стрімінг через Reddit API, дедуплікацію та семантичну кластеризацію постів.
Чому моніторинг Reddit вручну неефективний?
Reddit API має ліміти, WSB використовує сленг, а LLM потрібно знати контекст. Наш стек: Python (PRAW), Hugging Face Transformers, ChromaDB. Система витримує навантаження 10 000 постів/год з latency p99 < 500 мс — у 3 рази швидше відкритих аналогів. Ми застосовуємо quantized моделі (INT8) для інференсу, що знижує cost per prediction на 40%.
Ми не просто збираємо дані — ми фільтруємо шум і виділяємо сигнали. Дворівнева фільтрація: кількісні метрики (score > 100, upvote_ratio > 0.8) та якісний LLM-аналіз. Це відсіває 95% спаму і дає релевантні торгові ідеї. Результат — ви отримуєте агреговані сигнали без ручного моніторингу.
Ключові сабредіти для фінансового моніторингу
| Сабредіт | Аудиторія | Тип сигналу | Обсяг, постів/день |
|---|---|---|---|
| r/wallstreetbets | Роздрібні трейдери | Моментум, meme stocks | 2000+ |
| r/investing | Фундаментальні інвестори | Фундаментальний аналіз | 300+ |
| r/stocks | Широка аудиторія | Загальні дискусії | 500+ |
| r/SecurityAnalysis | Професіонали | DD-пости | 50+ |
| r/cryptocurrency | Криптоентузіасти | Альткоін-сигнали | 1500+ |
Метод вилучення якісних торгових сигналів
Більшість постів — шум. Ми використовуємо дворівневий фільтр:
- Кількісний: score > 100, upvote_ratio > 0.8, коментарів > 20. Це відсіває 95% спаму.
- Якісний: LLM-класифікатор (fine-tuned Mistral) оцінює релевантність за темами: згадки тікера, наявність каталізатора (earnings, partnership), емоційний заряд.
Приклад запиту до LLM:
from transformers import pipeline pipe = pipeline("text-classification", model="mistral-finv2") result = pipe("$TSLA is going to the moon! Beat earnings + cybercab launch") # {'label': 'BULLISH', 'score': 0.94} Чому стандартний сентимент-аналіз не працює на WSB?
Бібліотеки на кшталт VADER чи TextBlob навчалися на загальних текстах. На сленгу WallStreetBets ("apes", "tendies", "DD", "YOLO") їх F1-міра падає до 0.3-0.5. Ми fine-tune LLM на корпусі з 50 000 WSB-постів з розміткою bull/bear/neutral. Використовуємо LoRA (ранг 16) — донавчання займає 4 години на одному A100, результат F1 > 0.87.
Додатково: фіксуємо емодзі 🚀/🌙 і капіталізацію — в WSB вони несуть сильний сигнал. Бектест: згадки з score > 500 дають кореляцію з рухом ціни на 3-5 днів (кореляція r/investing — 0.20, WSB — 0.12 через шум, але після нашого фільтра — 0.35). Для прискорення інференсу використовуємо квантовані версії (INT8) і batching.
Як ML-модель адаптується під ваш портфель?
Ми не даємо універсальну модель. Fine-tuning виконується на ваших історичних даних і цільових активах. Наприклад, для клієнта з портфелем з 10 tech-акцій ми донавчили Mistral на постах з $AAPL, $MSFT, $GOOGL. Результат: точність передбачення руху за тиждень — 68% проти 52% без донавчання. Додатково налаштовуємо векторні embeddings під домен.
Приклад архітектури мікросервісу
from fastapi import FastAPI from celery import Celery app = FastAPI() celery = Celery('tasks', broker='redis://localhost') @app.post('/start-monitoring') def start(subreddit: str): task = celery.send_task('collect', args=[subreddit]) return {'task_id': task.id} Процес роботи
- Аналітика: обговорюємо ваші цільові інструменти та сабредіти. Отримайте демо-доступ до працюючої системи на цьому етапі.
- Проектування: схеми збору, модель фільтрації, архітектура зберігання.
- Реалізація: парсинг, fine-tuning, дашборд (Grafana + PostgreSQL).
- Тест: A/B тест на історичних даних з вашими метриками.
- Деплой: ваш сервер або наш хмарний інстанс (AWS/GCP).
Що входить у роботу
| Компонент | Опис |
|---|---|
| Парсинг | PRAW + інтеграція з Reddit API, кешування, дедуплікація |
| NLP-ядро | Fine-tuned LLM + векторний пошук (ChromaDB) і RAG |
| API | REST/WebSocket для видачі сигналів (JSON) |
| Моніторинг | Графіки завантаження, метрики CPU/GPU, сповіщення про простої |
| Документація | Swagger-схема, інструкція з розгортання |
| Навчання | 2-годинна сесія для аналітика |
| Гарантія | SLA 99.5%, підтримка 3 місяці після запуску |
Економія на ручній праці аналітика — значна. Вартість розраховується індивідуально після аналізу ваших даних. Автоматизація моніторингу скорочує час аналізу на 80% згідно з дослідженнями.
Ми маємо 5+ років досвіду в NLP та MLOps, реалізували 12 подібних систем для фондів та приватних інвесторів. Замовте розробку — оцінимо ваш проект за 1 день.
Зв'яжіться з нами, щоб обговорити деталі. Отримайте індивідуальну пропозицію під ваші обсяги та бюджет.







