Реализация поиска с исправлением опечаток для веб-приложения

Реализация поиска с исправлением опечаток для веб-приложения

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Реализация поиска с исправлением опечаток для веб-приложения
Сложный
~2-3 дня

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1419
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    983
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1246
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    998

Реализация поиска с исправлением опечаток для веб-приложения

Пользователь вводит «наушниик» — пустой результат. 70% таких посетителей уходят к конкурентам. Нечёткий поиск (fuzzy search) исправляет опечатки и возвращает релевантные товары. За время работы мы реализовали более 30 проектов с fuzzy-поиском для e-commerce и каталогов. Выбираем движок под ваш стек и нагрузку: pg_trgm, Meilisearch или Elasticsearch. При правильной настройке конверсия растёт на 15–25%, а затраты на поддержку снижаются — это подтверждают наши кейсы.

Например, для интернет-магазина бытовой техники мы снизили процент пустых результатов с 25% до 3% за счёт внедрения Meilisearch. Конверсия выросла на 22%. Время ответа сократилось с 200 мс до 4 мс. Закажите пилотный проект — мы бесплатно протестируем на ваших данных.

Какие алгоритмы расстояний используются?

Расстояние Левенштейна — минимальное количество вставок, удалений, замен для превращения одной строки в другую, описано в Wikipedia. Расстояние Дамерау-Левенштейна добавляет транспозицию (перестановку соседних символов). Для русского языка он предпочтительнее: «наушники» → «наушинки» — это одна транспозиция, а не две операции. На практике используем Damerau-Levenshtein. Выбор алгоритма влияет на качество: Damerau-Levenshtein даёт на 10% меньше пропусков для русскоязычных запросов.

PostgreSQL: pg_trgm

Расширение pg_trgm работает на основе триграмм и не требует внешних сервисов. Это самое простое решение, если ваш стек уже включает PostgreSQL.

CREATE EXTENSION IF NOT EXISTS pg_trgm; CREATE INDEX idx_products_title_trgm ON products USING GIN (title gin_trgm_ops); CREATE INDEX idx_products_description_trgm ON products USING GIN (description gin_trgm_ops); SET pg_trgm.similarity_threshold = 0.3; SELECT id, title, similarity(title, 'наушниик') AS sim FROM products WHERE title % 'наушниик' ORDER BY sim DESC LIMIT 10; -- Комбинируем fuzzy с полнотекстовым поиском SELECT p.id, p.title, p.price, greatest(similarity(p.title, 'беспродные наушники'), ts_rank(p.search_vector, plainto_tsquery('russian', 'беспродные наушники'))) AS relevance FROM products p WHERE p.title % 'беспродные наушники' OR p.search_vector @@ plainto_tsquery('russian', 'беспродные') ORDER BY relevance DESC LIMIT 20; 

Оператор % использует GIN-индекс. Порог similarity_threshold 0.3 — либеральный, 0.5 — строгий. Для коротких запросов выбирайте нижнюю границу. На практике мы рекомендуем начинать с 0.3 и корректировать по A/B-тестам: увеличение порога до 0.5 снижает количество ложных срабатываний, но может пропустить часть релевантных результатов. Экономия на инфраструктуре при использовании pg_trgm составляет до 40% по сравнению с внешними движками.

Meilisearch — выделенный fuzzy-движок

Meilisearch написан на Rust, поддерживает typo tolerance из коробки. Он специально спроектирован для быстрого нечёткого поиска и не требует сложной настройки.

import meilisearch client = meilisearch.Client('http://localhost:7700', 'your-master-key') index = client.index('products') # Настройки индекса index.update_settings({ 'searchableAttributes': ['title', 'brand', 'description', 'tags'], 'filterableAttributes': ['category_id', 'status', 'price', 'brand'], 'sortableAttributes': ['price', 'created_at', 'popularity'], 'rankingRules': ['words', 'typo', 'proximity', 'attribute', 'sort', 'exactness'], 'typoTolerance': { 'enabled': True, 'minWordSizeForTypos': { 'oneTypo': 5, 'twoTypos': 9 }, 'disableOnWords': ['iPhone', 'iPad'], 'disableOnAttributes': ['sku', 'barcode'], }, 'pagination': { 'maxTotalHits': 10000 }, }) # Батчевая индексация batch_size = 1000 for i in range(0, len(documents), batch_size): batch = documents[i:i + batch_size] task = index.add_documents(batch) index.wait_for_task(task.task_uid) 
Пример ответа Meilisearch
{ "hits": [ { "id": 1234, "title": "Sony WH-1000XM5 беспроводные наушники", "_formatted": { "title": "Sony WH-1000XM5 беспроводные <mark>наушники</mark>" } } ], "query": "наушниик sony", "processingTimeMs": 4, "totalHits": 38, "page": 1, "hitsPerPage": 20 } 

Meilisearch даёт среднее время ответа менее 10 мс для каталогов до 10 млн записей, что в 10 раз быстрее pg_trgm на больших объёмах.

Elasticsearch: fuzzy-запрос

Если Elasticsearch уже используется, добавьте fuzzy в мультиматч:

{ "query": { "bool": { "should": [ { "multi_match": { "query": "наушниик", "fields": ["title^3", "brand^2", "description"], "fuzziness": "AUTO", "prefix_length": 2, "max_expansions": 50 } }, { "match_phrase": { "title": { "query": "наушниик", "slop": 2 } } } ] } } } 

prefix_length: 2 — точное совпадение первых двух символов снижает ложные срабатывания. Elasticsearch подходит для больших объёмов (10M+) и интеграции с аналитикой, но требует более сложной инфраструктуры.

Какой движок выбрать?

Критерий pg_trgm Meilisearch Elasticsearch
Нагрузка до 100k записей до 10M записей 10M+ записей
Скорость ~100ms <10ms <50ms
Сложность низкая средняя высокая
Фильтры/фасеты только SQL встроенные мощные
Требования к инфра только PostgreSQL отдельный сервер кластер

Для стартапов оптимален pg_trgm — минимальная стоимость развёртывания. Если ожидаете рост, закладывайте миграцию на Meilisearch. Для корпоративных проектов с аналитикой — Elasticsearch.

Почему настройка порога опечаток критична?

Каждый параметр влияет на качество: слишком либеральный порог даёт шум, слишком строгий — пропускает опечатки. На практике мы используем:

Тип запроса Рекомендуемый допуск
1–2 слова 1 опечатка (minWordSizeForTypos: 5)
3–4 слова 2 опечатки (minWordSizeForTypos: 9)
Длинные запросы (5+) 2–3 опечатки

Точная настройка даёт рост конверсии на 15–25% по нашим замерам на 30+ проектах. Экономия на доработках после запуска составляет до 30% времени команды.

Процесс работы

Аналитика — аудит текущего поиска, сбор статистики опечаток. Выбор движка — pg_trgm, Meilisearch или Elasticsearch под ваш стек. Интеграция — настройка индексов, конфигураций, API. Тестирование — A/B-тест с реальными запросами, корректировка порогов. Деплой — мониторинг и поддержка.

Сроки

pg_trgm (расширение, индексы, запросы, tuning threshold): 1 день. Meilisearch (деплой, настройка, синхронизация, API): 2–3 дня. Fuzzy в существующем Elasticsearch: 1 день.

Что входит в работу

Конфигурация индексов и типов опечаток. Интеграция через REST API или SDK. Документация по эксплуатации. Гарантия — исправим баги в течение 2 недель.

Оценим реализацию fuzzy search под ваши задачи. Получите консультацию — свяжитесь с нами. Мы поможем подобрать оптимальное решение и настроить его под ваш стек.