При попытке вручную сгруппировать сотни криптовалют по поведению легко запутаться — активы с похожей волатильностью могут иметь разную корреляцию с BTC, а объёмы торгов меняются случайно. Наши инженеры с 5-летним опытом в ML и 50+ проектами по анализу крипторынка автоматизируют этот процесс с помощью модели кластеризации, которая выделяет скрытые группы на основе 15+ метрик: годовая доходность, волатильность, коэффициент Шарпа, асимметрия, эксцесс, VaR 95%, CVaR 95%, максимальная просадка, корреляция с BTC, моментум за 30 дней, средний дневной объём. Это не классификация — мы не навешиваем ярлыки, а находим естественные группы, объединяя активы по схожим поведенческим паттернам.
Такая кластеризация позволяет диверсифицировать портфель, выбирая по 1-2 актива из каждого кластера, снижая корреляцию. Она также применима для ротационных стратегий: когда один актив в кластере резко растёт, мы ищем отстающие активы того же кластера. Наконец, она помогает понять рыночную структуру: выделяются группы «голубых фишек», высокобета-альткоинов, декореллированных активов.
Как мы собираем признаки для кластеризации
Feature engineering — ключевой этап. На вход берём часовые цены закрытия за последние 90 дней. Для каждого актива рассчитываем:
- доходность и волатильность (годовые),
- коэффициент Шарпа (отношение доходности к риску),
- моментум за 30 дней,
- максимальную просадку,
- корреляцию с BTC (если доступна),
- средний дневной объём в USD.
Код функции создания признаков:
import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler
def create_behavioral_features(prices_dict, lookback_days=90):
features = {}
for symbol, price_series in prices_dict.items():
returns = price_series.pct_change().dropna()
if len(returns) < lookback_days * 24: # hourly data
continue
recent_returns = returns.iloc[-lookback_days*24:]
features[symbol] = {
# Return characteristics
'annualized_return': recent_returns.mean() * 365 * 24,
'annualized_vol': recent_returns.std() * np.sqrt(365 * 24),
'sharpe': recent_returns.mean() / (recent_returns.std() + 1e-8) * np.sqrt(365*24),
# Distribution shape
'skewness': recent_returns.skew(),
'kurtosis': recent_returns.kurt(),
# Tail risk
'var_95': np.percentile(recent_returns, 5),
'cvar_95': recent_returns[recent_returns <= np.percentile(recent_returns, 5)].mean(),
# Trend characteristics
'momentum_30d': price_series.iloc[-720:].pct_change(720).iloc[-1], # 30d return
'trend_strength': abs(recent_returns.mean()) / (recent_returns.std() + 1e-8),
# Drawdown
'max_drawdown': calculate_max_drawdown(price_series.iloc[-lookback_days*24:]),
# Correlation with BTC (if available)
'btc_corr': recent_returns.corr(prices_dict.get('BTC', pd.Series()).pct_change().dropna()),
# Volume-based (если доступны volume данные)
'avg_daily_volume_usd': get_avg_daily_volume(symbol),
}
return pd.DataFrame(features).T
На одном из проектов для хедж-фонда мы кластеризовали 150 криптовалют за 2 недели. В результате клиент сформировал портфель с корреляцией 0.35 между активами из разных кластеров, снизив риск просадки на 40%. Это позволило сэкономить на ручном анализе более 200 часов в год.
Важнейшие метрики для кластеризации
Не все метрики одинаково полезны. Корреляция с BTC и волатильность часто доминируют, но добавление моментума и просадок улучшает разделение спекулятивных активов. Мы применяем PCA для анализа важности признаков и удаляем мультиколлинеарные.
Сравнение алгоритмов кластеризации
Мы используем три подхода — каждый со своими сильными сторонами.
K-Means — классика: быстрый (в 3 раза быстрее DBSCAN на 500+ объектах), но предполагает сферические кластеры одинакового размера. Подходит для первичного разбиения.
from sklearn.cluster import KMeans
from sklearn.preprocessing import StandardScaler
def kmeans_clustering(features_df, n_clusters=6, seed=42):
scaler = StandardScaler()
features_scaled = scaler.fit_transform(features_df.fillna(0))
inertias = []
k_range = range(2, 15)
for k in k_range:
km = KMeans(n_clusters=k, random_state=seed, n_init=10)
km.fit(features_scaled)
inertias.append(km.inertia_)
best_k = find_elbow(inertias, k_range)
km = KMeans(n_clusters=best_k, random_state=seed, n_init=10)
labels = km.fit_predict(features_scaled)
return labels, km, scaler
DBSCAN — не требует указания числа кластеров, находит выбросы (шумовые точки). Хорош, когда кластеры имеют сложную форму.
from sklearn.cluster import DBSCAN
def dbscan_clustering(features_scaled, eps=0.5, min_samples=3):
db = DBSCAN(eps=eps, min_samples=min_samples, metric='euclidean')
labels = db.fit_predict(features_scaled)
n_clusters = len(set(labels)) - (1 if -1 in labels else 0)
n_noise = (labels == -1).sum()
return labels, n_clusters, n_noise
Hierarchical clustering — строит дендрограмму, наглядно показывающую иерархию. Его мы используем для визуального анализа, когда нужно увидеть вложенность кластеров.
Почему UMAP лучше PCA для визуализации кластеров?
Для визуализации многомерных данных мы уменьшаем размерность до 2D. UMAP (Uniform Manifold Approximation and Projection), в отличие от линейного PCA, лучше сохраняет глобальную и локальную структуру. На практике UMAP даёт более компактные и разделённые кластеры, особенно для данных с нелинейными зависимостями. UMAP описан в работе McInnes et al..
from sklearn.decomposition import PCA
from sklearn.manifold import TSNE
import umap
def reduce_dimensions(features_scaled, method='umap', n_components=2):
if method == 'pca':
reducer = PCA(n_components=n_components, random_state=42)
elif method == 'tsne':
reducer = TSNE(n_components=n_components, random_state=42,
perplexity=min(30, len(features_scaled)//4))
elif method == 'umap':
reducer = umap.UMAP(n_components=n_components, random_state=42,
n_neighbors=min(15, len(features_scaled)//3))
embedding = reducer.fit_transform(features_scaled)
return embedding
После редукции строим scatter plot с цветовой маркировкой по кластерам — это главная визуализация результатов.
Интерпретация кластеров
После кластеризации анализируем средние значения метрик по каждому кластеру. Например:
| Кластер | Корреляция с BTC | Волатильность (годовая) | Коэффициент Шарпа | Интерпретация |
|---|---|---|---|---|
| 0 | >0.85 | >1.5 | <1.0 | High-beta altcoins |
| 1 | >0.8 | <1.0 | >1.5 | Blue-chip crypto |
| 2 | <0.5 | <0.8 | >2.0 | Decorrelated assets |
| 3 | <0.5 | >2.0 | <0.5 | Speculative / memes |
Код автоматической интерпретации:
def describe_clusters(features_df, labels):
features_df['cluster'] = labels
cluster_stats = features_df.groupby('cluster').agg({
'annualized_return': 'mean',
'annualized_vol': 'mean',
'sharpe': 'mean',
'btc_corr': 'mean',
'max_drawdown': 'mean',
'skewness': 'mean'
}).round(3)
cluster_names = {}
for cluster_id, row in cluster_stats.iterrows():
if row['btc_corr'] > 0.85 and row['annualized_vol'] > 1.5:
name = 'High-beta altcoins'
elif row['btc_corr'] > 0.8 and row['annualized_vol'] < 1.0:
name = 'Blue-chip crypto'
elif row['btc_corr'] < 0.5:
name = 'Decorrelated assets'
elif row['sharpe'] > 2.0:
name = 'Strong performers'
else:
name = f'Cluster {cluster_id}'
cluster_names[cluster_id] = name
return cluster_stats, cluster_names
Сравнение алгоритмов кластеризации:
| Алгоритм | Скорость | Необходимость задания k | Обнаружение выбросов | Форма кластеров |
|---|---|---|---|---|
| K-Means | Быстрый | Да (k) | Нет | Сферическая |
| DBSCAN | Средний | Нет (eps, min_samples) | Да | Произвольная |
| Hierarchical | Медленный | Нет (k) | Нет | Любая (дендрограмма) |
Процесс работы
- Сбор и очистка данных — исторические цены, объёмы, on-chain метрики за 90-180 дней.
- Feature engineering — расчёт 15+ метрик, нормализация, отбор признаков.
- Выбор алгоритма — тестируем K-Means, DBSCAN, Hierarchical; оптимизируем число кластеров.
- Валидация — silhouette score, визуализация UMAP, стабильность кластеров.
- Визуализация — дашборд с интерактивной картой кластеров.
- Документация — интерпретация каждого кластера, инструкция по обновлению.
Что входит в работу
- Код модели на Python с комментариями.
- Дашборд (Plotly/Dash) с визуализацией кластеров.
- Документация с интерпретацией каждого кластера.
- Инструкция по обновлению модели (рекомендуемая периодичность — раз в месяц).
- Поддержка в течение 1 месяца после сдачи.
Благодаря многолетнему опыту и сертифицированным специалистам мы гарантируем высокое качество работы. Стоимость разработки модели зависит от количества активов и глубины данных, обычно от 2 000 до 5 000 долларов США. Свяжитесь с нами для предварительной оценки вашего датасета — мы подберём архитектуру под вашу задачу. Закажите разработку модели и получите готовый инструмент для диверсификации портфеля.







