Стандартный полнотекстовый поиск (BM25) не справляется с синонимами, перефразировками и опечатками. Запрос «как повысить мотивацию команды» находит документы о «методах управления персоналом» — без единого совпадения по словам. Это принципиально другая архитектура, требующая векторных представлений и ANN-индексов. Мы реализуем такие системы под ключ, начиная с аудита данных и заканчивая деплоем в продакшен. Подробнее о концепции можно прочитать в статье о семантическом поиске.
Архитектура семантического поиска
Bi-encoder — основной рабочий режим: отдельные модели кодируют запрос и документы в общее векторное пространство. Поиск сводится к нахождению ближайших векторов через ANN (Approximate Nearest Neighbor). Cross-encoder работает на этапе reranking: принимает пару «запрос+документ» и выдаёт точный score релевантности. Он медленнее (O(N) против O(log N)), но даёт максимальную точность. Комбинация bi-encoder (retrieve) + cross-encoder (rerank) — стандарт production-систем. Согласно работе Reimers & Gurevych (2019), такой дуэт значительно превосходит каждый из методов по отдельности.
Сравним основные подходы к эмбеддингам:
| Параметр | Bi-encoder | Cross-encoder |
|---|---|---|
| Скорость на 1M документов | <10 мс | >100 мс (для топ-100) |
| Точность (NDCG@10) | 0.75-0.85 | 0.90-0.95 |
| Применение | Первичный поиск | Переранжирование топ-K |
Какую модель эмбеддингов выбрать?
Для русского языка мы используем cointegrated/rubert-tiny2 как baseline — быстрый, компактный (312-мерный вектор). Для максимального качества — intfloat/multilingual-e5-large или sbert-base-ru-mean-tokens (768-мерный вектор). Fine-tuning на ваших данных даёт прирост 5-10% по NDCG. Мы подбираем модель под объём корпуса и latency requirements (p99 до 100 мс).
from sentence_transformers import SentenceTransformer, CrossEncoder # Bi-encoder bi_encoder = SentenceTransformer("cointegrated/rubert-tiny2") # Для лучшего качества: "intfloat/multilingual-e5-large" # Cross-encoder cross_encoder = CrossEncoder("cross-encoder/ms-marco-MiniLM-L-6-v2") # Для русского: "DiTy/cross-encoder-russian-msmarco" Qdrant vs FAISS: что выбрать для продакшена?
Qdrant — production-grade, поддерживает гибридный поиск, фильтры, репликацию. Рекомендуем для корпоративных решений. FAISS — in-memory индекс, не требует отдельного сервиса. Идеален для прототипов и малых корпусов (< 1M векторов).
| Характеристика | Qdrant | FAISS |
|---|---|---|
| Тип | Внешняя БД | In-memory индекс |
| Гибридный поиск | Встроенный | Требует доработки |
| Latency p99 (1M векторов) | < 10 мс | < 5 мс |
| Масштабирование | Кластер/шардинг | Однопоточный |
Пример индексирования в Qdrant:
from qdrant_client import QdrantClient from qdrant_client.models import Distance, VectorParams, PointStruct client = QdrantClient("localhost", port=6333) client.create_collection( collection_name="documents", vectors_config=VectorParams(size=312, distance=Distance.COSINE), ) embeddings = bi_encoder.encode(documents, batch_size=64, show_progress_bar=True) client.upload_points("documents", [ PointStruct(id=i, vector=emb.tolist(), payload={"text": doc}) for i, (emb, doc) in enumerate(zip(embeddings, documents)) ]) Что даёт гибридный поиск?
Семантический поиск + BM25 превосходят каждый из методов по отдельности. BM25 ловит точные совпадения (номера, уникальные термины), а эмбеддинги — смысловые близкие. Гибридный подход улучшает NDCG@10 в 2-3 раза по сравнению с чистым BM25. Мы используем RRF (Reciprocal Rank Fusion) для объединения результатов.
from rank_bm25 import BM25Okapi bm25 = BM25Okapi([doc.split() for doc in corpus]) semantic_scores = cosine_similarity([query_emb], doc_embeddings)[0] def rrf(bm25_ranks, semantic_ranks, k=60): scores = {} for rank, idx in enumerate(bm25_ranks): scores[idx] = scores.get(idx, 0) + 1/(k + rank) for rank, idx in enumerate(semantic_ranks): scores[idx] = scores.get(idx, 0) + 1/(k + rank) return sorted(scores, key=scores.get, reverse=True) Оценка качества поиска
- NDCG@10 — нормализованный дисконтированный кумулятивный выигрыш. Учитывает порядок.
- MAP — средняя точность по всем запросам.
- MRR — обратный ранг первого релевантного результата.
Для оценки нужен qrels (набор запросов с релевантностью). Мы автоматизируем его создание: LLM генерирует вопросы для каждого документа, сам документ — «золотой» ответ. Это даёт репрезентативную выборку для метрик.
Процесс внедрения и сроки
- Аудит данных: объём, формат, язык, специфические термины. Предобработка включает очистку, лемматизацию и чанкинг (размер чанка ~512 токенов с overlap 128).
- Выбор архитектуры: bi-encoder + cross-encoder, гибрид, кастомная модель. Для крупных корпусов (>10M документов) применяем кластеризацию Qdrant с шардированием.
- Разработка пайплайна: чанкинг, эмбеддинг, индексирование с мониторингом latency p99.
- Настройка и деплой: кластер Qdrant (Helm-чарты), A/B тестирование, канареечный rollout.
- Передача документации, обучение команды (2 сессии по 2 часа), гарантия 3 месяца.
Сроки: от 2 недель для прототипа, от 2 месяцев для production-решения. Стоимость рассчитывается индивидуально — свяжитесь с нами для бесплатной оценки.
Что входит в результат
- Развёрнутая архитектурная документация.
- Исходный код пайплайна с комментариями.
- Интеграция с вашей инфраструктурой (Elasticsearch, БД, облака).
- Деплой с Helm-чартами и CI/CD.
- Обучение команды (2 сессии по 2 часа).
- Поддержка на этапе промышленной эксплуатации (1 месяц).
Почему доверяют нам
Нам доверяют благодаря 5-летнему опыту и 20+ реализованным проектам. Все решения покрыты unit-тестами и benchmarks. Наши инженеры — авторы open-source тулов для эмбеддингов и ANN. Получите консультацию по вашему проекту — мы оценим задачу за 1 день. Закажите пилотный проект, чтобы увидеть результат на ваших данных.







