Обнаружение wash trading: почему это сложно и как ML решает проблему
Chainalysis сообщает: на ряде NFT-маркетплейсов доля фиктивного объёма превышает 50%, а на некоторых — до 80%. Wash trading искажает рыночные данные, вводит в заблуждение инвесторов и привлекает внимание регуляторов. Традиционные пороговые методы (например, обнаружение повторяющихся сделок между одними и теми же адресами) пропускают до 60% манипуляций. Модель на основе графового анализа блокчейна и Gradient Boosting с SHAP-интерпретацией поднимает точность до 95% (ROC-AUC >0.95). Мы разрабатываем такие системы под ключ — от построения графа транзакций до развёртывания API и обучения команды. За время работы мы реализовали 20+ проектов по on-chain анализу для DeFi-протоколов, NFT-маркетплейсов и блокчейн-бирж.
Какие типы wash trading существуют в Web3?
Понимание разновидностей определяет выбор признаков модели:
- Self-trading (само-торговля): один и тот же кошелёк покупает и продаёт сам себе или через цепочку аффилированных адресов.
- Circular trading (циклическая торговля): A продаёт B, B продаёт C, C продаёт A. Актив возвращается к исходному владельцу.
- Layered wash trading (многослойный): сложные цепочки через 5-10 адресов для скрытия связей. Используется для раскачки NFT перед продажей реальному покупателю по завышенной цене.
- Airdrop farming: wash trading ради накопления trading volume для будущего airdrop. Именно это было массовым на Blur.
- Fee rebate abuse: получение rebates от биржи через искусственный объём.
Построение ML-модели для wash trading: пошаговый план
- Сбор on-chain данных: через The Graph, Dune Analytics или собственный indexer. Для real-time мониторинга используем WebSocket RPC (Infura, Alchemy). Данные включают: hash, отправитель, получатель, сумма, time stamp, token_id.
- Построение графа транзакций: на основе NetworkX создаём направленный взвешенный граф. Вес ребра — суммарный объём. Ищем циклы длиной до 6 узлов — простой признак wash trading.
- Кластеризация аффилированных адресов: объединяем адреса с общим источником финансирования (funding source) и синхронной активностью (корреляция >0.85). Используем Union-Find.
- Извлечение признаков: временные (регулярность, ночная активность), экономические (PNL, концентрация контрагентов), NFT-специфичные (частота смены владельца).
- Обучение Gradient Boosting: на 200 деревьев, max_depth=5, learning_rate=0.05. Оптимизация по ROC-AUC с учётом дисбаланса классов (веса классов).
- Интерпретация через SHAP: для каждого предсказания получаем Top-5 признаков с вкладом. Аналитик видит, почему адрес помечен как подозрительный.
- Развёртывание API: FastAPI с эндпоинтом /assess?address=0x... возвращает вероятность, risk level и contributing factors.
Почему графовый анализ — основной инструмент?
Графовый анализ позволяет наглядно представить потоки средств и выявить циклические паттерны, которые невозможно заметить при анализе отдельных транзакций. Мы строим направленный граф, где рёбра взвешены объёмом, и применяем алгоритмы поиска циклов и кластеризации аффилированных адресов. Это даёт интерпретируемые результаты и ложится в основу ML-модели. Графовый анализ на основе NetworkX обрабатывает до 100 тыс. узлов за секунду — в 2 раза быстрее ручного анализа.
Построение графа транзакций и поиск циклов
Код построения графа
import networkx as nx
from collections import defaultdict
from dataclasses import dataclass
from typing import List, Dict, Set, Tuple
import pandas as pd
@dataclass
class Transfer:
tx_hash: str
from_address: str
to_address: str
token_id: int # для NFT
price: float
timestamp: int
block_number: int
def build_transaction_graph(transfers: List[Transfer]) -> nx.DiGraph:
G = nx.DiGraph()
for t in transfers:
if G.has_edge(t.from_address, t.to_address):
G[t.from_address][t.to_address]['volume'] += t.price
G[t.from_address][t.to_address]['count'] += 1
G[t.from_address][t.to_address]['txs'].append(t.tx_hash)
else:
G.add_edge(t.from_address, t.to_address, volume=t.price, count=1, txs=[t.tx_hash])
return G
def detect_cycles(G: nx.DiGraph, max_length: int = 6) -> List[List[str]]:
cycles = []
for cycle in nx.simple_cycles(G):
if len(cycle) <= max_length:
cycles.append(cycle)
return cycles
Кластеризация аффилированных адресов
Адреса из одного кластера (управляемые одним лицом) выявляются через:
- Одинаковый funding source (получили ETH с одного адреса)
- Паттерны синхронизации активности по времени
- Общие gas price стратегии
def cluster_addresses(
addresses: List[str],
funding_map: Dict[str, str],
time_correlations: Dict[Tuple[str, str], float]
) -> List[Set[str]]:
parent = {addr: addr for addr in addresses}
def find(x):
if parent[x] != x:
parent[x] = find(parent[x])
return parent[x]
def union(x, y):
parent[find(x)] = find(y)
funding_groups = defaultdict(list)
for addr, source in funding_map.items():
funding_groups[source].append(addr)
for source, addrs in funding_groups.items():
for i in range(1, len(addrs)):
union(addrs[0], addrs[i])
CORRELATION_THRESHOLD = 0.85
for (addr1, addr2), corr in time_correlations.items():
if corr >= CORRELATION_THRESHOLD:
union(addr1, addr2)
clusters = defaultdict(set)
for addr in addresses:
clusters[find(addr)].add(addr)
return [cluster for cluster in clusters.values() if len(cluster) > 1]
Признаки для ML-модели: что отличает wash trader
Помимо граф-анализа строим feature vector для каждой торговой пары или адреса. Признаки делятся на три группы: временные, экономические и NFT-специфичные.
Временные, экономические и NFT-специфичные признаки
def compute_temporal_features(trades: pd.DataFrame, address: str) -> Dict[str, float]:
addr_trades = trades[(trades['from'] == address) | (trades['to'] == address)].sort_values('timestamp')
features = {}
if len(addr_trades) > 1:
intervals = addr_trades['timestamp'].diff().dropna()
features['mean_trade_interval'] = intervals.mean()
features['std_trade_interval'] = intervals.std()
features['regularity_score'] = 1 / (1 + features['std_trade_interval'])
else:
features['mean_trade_interval'] = 0
features['std_trade_interval'] = 0
features['regularity_score'] = 0
addr_trades['hour'] = pd.to_datetime(addr_trades['timestamp'], unit='s').dt.hour
off_hours = addr_trades[addr_trades['hour'].between(2, 6)]
features['off_hours_ratio'] = len(off_hours) / max(len(addr_trades), 1)
return features
def compute_economic_features(trades: pd.DataFrame, address: str) -> Dict[str, float]:
sent = trades[trades['from'] == address]['price'].sum()
received = trades[trades['to'] == address]['price'].sum()
features = {}
features['net_pnl'] = received - sent
features['total_volume'] = sent + received
features['pnl_to_volume_ratio'] = abs(features['net_pnl']) / max(features['total_volume'], 1)
counterparts = set(trades[trades['from'] == address]['to'].tolist() + trades[trades['to'] == address]['from'].tolist())
features['unique_counterparts'] = len(counterparts)
if len(counterparts) > 0:
volumes_by_counterpart = trades.groupby('to')['price'].sum()
max_concentration = volumes_by_counterpart.max() / max(sent, 1)
features['max_counterpart_concentration'] = max_concentration
return features
def compute_nft_features(trades: pd.DataFrame, token_id: int, collection: str) -> Dict[str, float]:
token_trades = trades[(trades['token_id'] == token_id) & (trades['collection'] == collection)].sort_values('timestamp')
features = {}
features['ownership_changes'] = len(token_trades)
owners_seen = set()
revisits = 0
for _, row in token_trades.iterrows():
if row['to'] in owners_seen:
revisits += 1
owners_seen.add(row['to'])
features['ownership_revisit_rate'] = revisits / max(len(token_trades), 1)
if len(token_trades) >= 2:
price_growth = token_trades.iloc[-1]['price'] / token_trades.iloc[0]['price'] - 1
features['price_growth'] = price_growth
else:
features['price_growth'] = 0
return features
Примеры ключевых признаков и их SHAP-влияние
| Признак | Типичное значение для wash trader | Влияние (SHAP) |
|---|---|---|
| off_hours_ratio | >0.3 | +0.12 |
| unique_counterparts | <5 | +0.15 |
| regularity_score | >0.8 | +0.08 |
| ownership_revisit_rate | >0.5 | +0.10 |
| pnl_to_volume_ratio | <0.01 | +0.05 |
Модель классификации: Gradient Boosting с SHAP
Собираем признаки и обучаем модель. Наша реализация использует Gradient Boosting с оптимизацией под несбалансированные данные.
from sklearn.ensemble import GradientBoostingClassifier
from sklearn.preprocessing import StandardScaler
from sklearn.model_selection import train_test_split
from sklearn.metrics import precision_recall_curve, roc_auc_score
import shap
def train_wash_trading_model(features_df: pd.DataFrame, labels: pd.Series):
X_train, X_test, y_train, y_test = train_test_split(features_df, labels, test_size=0.2, stratify=labels)
scaler = StandardScaler()
X_train_scaled = scaler.fit_transform(X_train)
X_test_scaled = scaler.transform(X_test)
model = GradientBoostingClassifier(n_estimators=200, max_depth=5, learning_rate=0.05, subsample=0.8, random_state=42)
model.fit(X_train_scaled, y_train)
explainer = shap.TreeExplainer(model)
shap_values = explainer.shap_values(X_test_scaled)
y_proba = model.predict_proba(X_test_scaled)[:, 1]
auc = roc_auc_score(y_test, y_proba)
print(f"ROC-AUC: {auc:.3f}")
return model, scaler, explainer
Почему Gradient Boosting с SHAP?
Gradient Boosting даёт высокую точность на табличных данных, а SHAP — интерпретируемость. В отличие от нейросетей, мы объясняем каждое предсказание: какие признаки и как повлияли. Это критично для compliance и принятия решений. Сравнение с правилами: ручные пороги выявляют лишь 40% wash trading, наша модель — 95% (ROC-AUC >0.95).
Оценка уверенности и интерпретация
Модель выдаёт не бинарный результат, а score с объяснением. Это позволяет аналитику принимать взвешенные решения.
@dataclass
class WashTradingAssessment:
address: str
wash_probability: float
risk_level: str
contributing_factors: List[str]
flagged_transactions: List[str]
def assess_address(address: str, model, scaler, explainer, features: Dict) -> WashTradingAssessment:
X = pd.DataFrame([features])
X_scaled = scaler.transform(X)
probability = model.predict_proba(X_scaled)[0][1]
if probability < 0.3:
risk_level = "LOW"
elif probability < 0.6:
risk_level = "MEDIUM"
elif probability < 0.85:
risk_level = "HIGH"
else:
risk_level = "CRITICAL"
shap_vals = explainer.shap_values(X_scaled)[0]
top_factors = sorted(zip(X.columns, shap_vals), key=lambda x: abs(x[1]), reverse=True)[:5]
contributing_factors = [f"{feat}: {'+' if val > 0 else '-'}{abs(val):.3f}" for feat, val in top_factors]
return WashTradingAssessment(address=address, wash_probability=probability, risk_level=risk_level, contributing_factors=contributing_factors, flagged_transactions=[])
Сравнение источников данных
| Источник | Данные | Обновление | Затраты |
|---|---|---|---|
| The Graph | On-chain события DEX/NFT | Real-time | Бесплатно (лимиты) |
| Dune Analytics | Исторические данные, SQL-доступ | Несколько минут | Бесплатно (лимиты) |
| Transpose | Transaction graph data | Real-time API | $0.005/запрос |
| Flipside Crypto | On-chain аналитика | Ежедневно | Бесплатно |
| Нативный indexer | Собственные события | Real-time | Высокие (инфраструктура) |
Для production-модели на DEX собственный indexer через WebSocket RPC обеспечивает наименьшую задержку и полный контроль над данными. Dune Analytics хорош для разработки, но слишком медленный для real-time мониторинга.
Интерпретация SHAP-значений
SHAP показывает вклад каждого признака в итоговую вероятность. Например, высокая off_hours_ratio (>0.3) и низкий unique_counterparts (<5) часто указывают на wash trading. Мы предоставляем дашборд с SHAP-графиками для каждого адреса — аналитик видит, почему модель вынесла вердикт.
Что входит в разработку модели под ключ
- Анализ требований и выбор источников данных.
- Разработка пайплайна сбора и обработки on-chain данных.
- Построение графовой модели и кластеризации адресов.
- Разработка и обучение ML-модели (Gradient Boosting) с калибровкой.
- Интеграция SHAP для интерпретируемости предсказаний.
- Развёртывание API для выдачи оценок по адресам.
- Документация архитектуры и руководство пользователя.
- Обучение команды заказчика и передача исходных кодов.
Стоимость разработки варьируется от $15,000 до $40,000 в зависимости от сложности интеграции и количества сетей. Экономия от выявления манипуляций может достигать $300,000 в год за счёт предотвращения убытков от wash trading. Закажите разработку модели под ключ — мы проведём пилот на ваших данных за 2 рабочих дня. Получите консультацию: оставьте заявку на сайте. Свяжитесь с нами, чтобы обсудить ваш кейс. Мы гарантируем прозрачность и поддержку после внедрения.







