Реализация семантического поиска по текстовым документам

Стандартный полнотекстовый поиск (BM25) не справляется с синонимами, перефразировками и опечатками. Запрос «как повысить мотивацию команды» находит документы о «методах управления персоналом» — без единого совпадения по словам. Это принципиально другая архитектура, требующая векторных представлений

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

Стандартный полнотекстовый поиск (BM25) не справляется с синонимами, перефразировками и опечатками. Запрос «как повысить мотивацию команды» находит документы о «методах управления персоналом» — без единого совпадения по словам. Это принципиально другая архитектура, требующая векторных представлений и ANN-индексов. Мы реализуем такие системы под ключ, начиная с аудита данных и заканчивая деплоем в продакшен. Подробнее о концепции можно прочитать в статье о семантическом поиске.

Архитектура семантического поиска

Bi-encoder — основной рабочий режим: отдельные модели кодируют запрос и документы в общее векторное пространство. Поиск сводится к нахождению ближайших векторов через ANN (Approximate Nearest Neighbor). Cross-encoder работает на этапе reranking: принимает пару «запрос+документ» и выдаёт точный score релевантности. Он медленнее (O(N) против O(log N)), но даёт максимальную точность. Комбинация bi-encoder (retrieve) + cross-encoder (rerank) — стандарт production-систем. Согласно работе Reimers & Gurevych (2019), такой дуэт значительно превосходит каждый из методов по отдельности.

Сравним основные подходы к эмбеддингам:

Параметр Bi-encoder Cross-encoder
Скорость на 1M документов <10 мс >100 мс (для топ-100)
Точность (NDCG@10) 0.75-0.85 0.90-0.95
Применение Первичный поиск Переранжирование топ-K

Какую модель эмбеддингов выбрать?

Для русского языка мы используем cointegrated/rubert-tiny2 как baseline — быстрый, компактный (312-мерный вектор). Для максимального качества — intfloat/multilingual-e5-large или sbert-base-ru-mean-tokens (768-мерный вектор). Fine-tuning на ваших данных даёт прирост 5-10% по NDCG. Мы подбираем модель под объём корпуса и latency requirements (p99 до 100 мс).

from sentence_transformers import SentenceTransformer, CrossEncoder # Bi-encoder bi_encoder = SentenceTransformer("cointegrated/rubert-tiny2") # Для лучшего качества: "intfloat/multilingual-e5-large" # Cross-encoder cross_encoder = CrossEncoder("cross-encoder/ms-marco-MiniLM-L-6-v2") # Для русского: "DiTy/cross-encoder-russian-msmarco" 

Qdrant vs FAISS: что выбрать для продакшена?

Qdrant — production-grade, поддерживает гибридный поиск, фильтры, репликацию. Рекомендуем для корпоративных решений. FAISS — in-memory индекс, не требует отдельного сервиса. Идеален для прототипов и малых корпусов (< 1M векторов).

Характеристика Qdrant FAISS
Тип Внешняя БД In-memory индекс
Гибридный поиск Встроенный Требует доработки
Latency p99 (1M векторов) < 10 мс < 5 мс
Масштабирование Кластер/шардинг Однопоточный

Пример индексирования в Qdrant:

from qdrant_client import QdrantClient from qdrant_client.models import Distance, VectorParams, PointStruct client = QdrantClient("localhost", port=6333) client.create_collection( collection_name="documents", vectors_config=VectorParams(size=312, distance=Distance.COSINE), ) embeddings = bi_encoder.encode(documents, batch_size=64, show_progress_bar=True) client.upload_points("documents", [ PointStruct(id=i, vector=emb.tolist(), payload={"text": doc}) for i, (emb, doc) in enumerate(zip(embeddings, documents)) ]) 

Что даёт гибридный поиск?

Семантический поиск + BM25 превосходят каждый из методов по отдельности. BM25 ловит точные совпадения (номера, уникальные термины), а эмбеддинги — смысловые близкие. Гибридный подход улучшает NDCG@10 в 2-3 раза по сравнению с чистым BM25. Мы используем RRF (Reciprocal Rank Fusion) для объединения результатов.

from rank_bm25 import BM25Okapi bm25 = BM25Okapi([doc.split() for doc in corpus]) semantic_scores = cosine_similarity([query_emb], doc_embeddings)[0] def rrf(bm25_ranks, semantic_ranks, k=60): scores = {} for rank, idx in enumerate(bm25_ranks): scores[idx] = scores.get(idx, 0) + 1/(k + rank) for rank, idx in enumerate(semantic_ranks): scores[idx] = scores.get(idx, 0) + 1/(k + rank) return sorted(scores, key=scores.get, reverse=True) 

Оценка качества поиска

  • NDCG@10 — нормализованный дисконтированный кумулятивный выигрыш. Учитывает порядок.
  • MAP — средняя точность по всем запросам.
  • MRR — обратный ранг первого релевантного результата.

Для оценки нужен qrels (набор запросов с релевантностью). Мы автоматизируем его создание: LLM генерирует вопросы для каждого документа, сам документ — «золотой» ответ. Это даёт репрезентативную выборку для метрик.

Процесс внедрения и сроки

  1. Аудит данных: объём, формат, язык, специфические термины. Предобработка включает очистку, лемматизацию и чанкинг (размер чанка ~512 токенов с overlap 128).
  2. Выбор архитектуры: bi-encoder + cross-encoder, гибрид, кастомная модель. Для крупных корпусов (>10M документов) применяем кластеризацию Qdrant с шардированием.
  3. Разработка пайплайна: чанкинг, эмбеддинг, индексирование с мониторингом latency p99.
  4. Настройка и деплой: кластер Qdrant (Helm-чарты), A/B тестирование, канареечный rollout.
  5. Передача документации, обучение команды (2 сессии по 2 часа), гарантия 3 месяца.

Сроки: от 2 недель для прототипа, от 2 месяцев для production-решения. Стоимость рассчитывается индивидуально — свяжитесь с нами для бесплатной оценки.

Что входит в результат

  • Развёрнутая архитектурная документация.
  • Исходный код пайплайна с комментариями.
  • Интеграция с вашей инфраструктурой (Elasticsearch, БД, облака).
  • Деплой с Helm-чартами и CI/CD.
  • Обучение команды (2 сессии по 2 часа).
  • Поддержка на этапе промышленной эксплуатации (1 месяц).

Почему доверяют нам

Нам доверяют благодаря 5-летнему опыту и 20+ реализованным проектам. Все решения покрыты unit-тестами и benchmarks. Наши инженеры — авторы open-source тулов для эмбеддингов и ANN. Получите консультацию по вашему проекту — мы оценим задачу за 1 день. Закажите пилотный проект, чтобы увидеть результат на ваших данных.