Розробка кастомних аналізаторів Elasticsearch (мовні, синоніми)

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Розробка кастомних аналізаторів Elasticsearch (мовні, синоніми)
Складний
~3-5 днів
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    957
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1189
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    948

Пошук по сайту не знаходить «ноутбук» за запитом «лептоп»? Або слово «смартфон» не повертає результати з «телефон»? Це типова проблема стандартного аналізатора Elasticsearch: він не розуміє синонімів та мовної морфології. Щоб пошук працював як треба, ми розробляємо кастомні аналізатори під ключ. За понад 5 років ми налаштували пошук для 50+ проектів, включаючи інтернет-магазини та новинні портали. Кастомний аналізатор складається з tokenizer та token filters. Вони перетворюють текст у набір токенів для індексу. У цій статті розберемо, як зібрати такий аналізатор для української мови, налаштувати синоніми та автодоповнення, а також розглянемо типові помилки та способи їх уникнути.

До 70% користувачів не знаходять потрібний товар через неправильну конфігурацію аналізатора. Це знижує конверсію на 20–30%. Налаштування кастомного аналізатора вирішує проблему за рахунок підбору фільтрів під вашу предметну область.

Фільтр Призначення Приклад токена
lowercase Приведення до нижнього регістру Ноутбук → ноутбук
stop Видалення стоп-слів на, в, с
stemmer Стемінг ноутбуки → ноутбук
synonym Синоніми ноутбук ↔ лептоп
edge_ngram N-грами для автодоповнення ноут → н, но, ноу, ноут

Чому кастомний аналізатор кращий за вбудований?

Вбудований ukrainian аналізатор (якщо він є) використовує алгоритм Snowball для стемінгу. Для більшості завдань цього достатньо, але якщо потрібна точна морфологія або нестандартний набір стоп-слів, створюємо кастомний аналізатор. Він дає повний контроль над ланцюжком фільтрів: ви самі вирішуєте, які стоп-слова видаляти, як обробляти синоніми та чи потрібен стемінг. Крім того, кастомна конфігурація дозволяє додати транслітерацію для пошуку по трансліту (наприклад, «noutbuk» → «ноутбук»).

Як налаштувати мовний аналізатор для української мови?

Базова настройка

Приклад налаштування з налаштовуваними стоп-словами та полем для точного збігу:

{
  "settings": {
    "analysis": {
      "filter": {
        "ukrainian_stop": { "type": "stop", "stopwords": "_ukrainian_" },
        "ukrainian_stemmer": { "type": "stemmer", "language": "ukrainian" },
        "custom_stopwords": { "type": "stop", "stopwords": ["це", "також", "при", "для", "що", "як"] }
      },
      "analyzer": {
        "ukrainian_custom": {
          "type": "custom",
          "tokenizer": "standard",
          "filter": ["lowercase", "ukrainian_stop", "custom_stopwords", "ukrainian_stemmer"]
        },
        "ukrainian_exact": {
          "type": "custom",
          "tokenizer": "standard",
          "filter": ["lowercase"]
        }
      }
    }
  }
}

Додавання транслітерації

Користувачі часто вводять трансліт: «noutbuk» замість «ноутбук». Транслітерація реалізується через char_filter типу mapping, де кожній кириличній букві зіставляється латинський аналог. Повний список зіставлень наведено в документації — ми підключаємо його в аналізатор. Для просунутої транслітерації використовуємо плагін analysis-icu з ICU transformers, який коректно обробляє Unicode normalization.

Як налаштувати синоніми без переіндексації?

Синоніми дозволяють знаходити документи за різними формулюваннями. Є два підходи:

Параметр Синоніми при індексації Синоніми при пошуку
Оновлення Потребує переіндексації Без переіндексації, через _reload_search_analyzers
Швидкодія пошуку Швидше (менше токенів у запиті) Повільніше (додаткова обробка)
Гнучкість Низька Висока

Рекомендований варіант — синоніми при пошуку. Вони дозволяють міняти правила без переіндексації, що критично для інтернет-магазинів з швидкозмінним асортиментом. Наприклад, файл синонімів config/synonyms/synonyms.txt:

ноутбук, лептоп, laptop, notebook
смартфон, телефон, мобільний
телевізор, тв, tv

Конфігурація аналізатора з синонімами (тільки для пошуку):

{
  "settings": {
    "analysis": {
      "filter": {
        "synonym_filter": {
          "type": "synonym",
          "synonyms_path": "synonyms/synonyms.txt",
          "updateable": true
        }
      },
      "analyzer": {
        "search_analyzer": {
          "type": "custom",
          "tokenizer": "standard",
          "filter": ["lowercase", "ukrainian_stop", "synonym_filter"]
        },
        "index_analyzer": {
          "type": "custom",
          "tokenizer": "standard",
          "filter": ["lowercase", "ukrainian_stop", "ukrainian_stemmer"]
        }
      }
    }
  }
}

Прапорець "updateable": true — обов'язкова умова для синонімів, що застосовуються тільки при пошуку. Він дозволяє перезавантажувати синоніми через _reload_search_analyzers без переіндексації. Економія бюджету: вам не потрібно перебудовувати індекс щоразу при зміні словника.

Налаштування автодоповнення з Edge N-gram

Для автодоповнення при введенні необхідний аналізатор з edge_ngram:

"filter": {
  "edge_ngram_filter": {
    "type": "edge_ngram",
    "min_gram": 2,
    "max_gram": 15
  }
}

При пошуку використовуємо аналізатор без N-gram (наприклад, тільки lowercase), інакше пошук фрагмента «ноут» збіжиться з усіма N-gram-токенами, викликаючи хибні спрацьовування.

Багатомовні індекси

Два підходи: один індекс з полями для кожної мови або окремий індекс на мову. Для мультисайтів зручніше один індекс:

"properties": {
  "title_uk": { "type": "text", "analyzer": "ukrainian_custom" },
  "title_en": { "type": "text", "analyzer": "english" },
  "title_de": { "type": "text", "analyzer": "german" }
}

Запит по кількох мовах:

{
  "query": {
    "multi_match": {
      "query": "search term",
      "fields": ["title_uk^2", "title_en", "title_de"]
    }
  }
}

Буст ^2 для українського поля — якщо основна аудиторія україномовна.

Що входить у розробку та терміни

Ми надаємо повністю готове рішення під ключ. Розробка включає:

  • Аналіз ваших даних та вимог до пошуку
  • Проектування ланцюжка фільтрів під ваші завдання
  • Налаштування синонімів з можливістю онлайн-оновлення
  • Інтеграція з існуючим індексом
  • Тестування на реальних запитах (не менше 100 тестових сценаріїв)
  • Документація по налаштуваннях та підтримці
  • Навчання вашої команди (до 2 годин онлайн)

Розробка та тестування кастомного аналізатора під одну мову — від 1 робочого дня. Налаштування синонімів з файлом та механізмом оновлення — ще півдня. Багатомовна конфігурація з 3–5 мовами — 2–3 дні, включаючи тести пошукової релевантності. Вартість розраховується індивідуально.

Замовте налаштування аналізатора для вашого проекту — ми підберемо оптимальну конфігурацію.

Як ми підходимо до налаштування

  1. Аудит поточного пошуку — збираємо логи запитів, виявляємо проблемні сценарії.
  2. Проектування аналізатора — визначаємо набір фільтрів, синонімів, стоп-слів.
  3. Прототипування — розгортаємо тестовий індекс та перевіряємо на реальних даних.
  4. Тестування — використовуємо API _analyze для перевірки кожного фільтра. Наприклад:
POST /products/_analyze
{
  "analyzer": "ukrainian_custom",
  "text": "Ноутбуки та лептопи для роботи"
}

Відповідь містить список токенів — їх кількість та вид мають відповідати очікуванням (стемінг обрізає закінчення, синоніми розширюють токени). 5. Оптимізація — коригуємо налаштування за результатами тестів. 6. Впровадження — оновлюємо бойовий індекс без даунтайму. 7. Моніторинг — після запуску відстежуємо метрики пошуку (CTR, порожні результати).

Чому варто довірити налаштування професіоналам?

Неправильна конфігурація аналізатора може знизити релевантність пошуку в 2–3 рази. Наші сертифіковані інженери гарантують, що після налаштування пошук стане точним та швидким. Отримайте консультацію з розробки аналізатора — ми оцінимо ваш проект та запропонуємо оптимальне рішення. Зв'яжіться з нами, щоб обговорити деталі.

Докладніше про аналізатори Elasticsearch.

Послуги бекенд-розробки: production-grade надійність

На production-сервері о 3:14 ночі черга Laravel Jobs перестала оброблятися — 40 000 необроблених завдань у Redis. Причина: worker упав через memory leak у статичній змінній Eloquent observer, supervisor не перезапустив через misconfigured stopwaitsecs. Ми розбирали такий інцидент на проекті з 500 RPS: діагностика 4 години, фікс — 20 хвилин. Щоб ви не втрачали гроші, пропонуємо послуги бекенд-розробки з акцентом на production-grade надійність — 10+ років досвіду, 50+ проектів, 5 років на ринку. Оцінимо ваш проект за 2 дні.

Які проблеми вирішуємо

N+1 запити: головний вбивця швидкості

N+1 — найпоширеніша причина повільних сторінок у Laravel-додатках. Стандартна історія: сторінка працювала нормально на dev з 10 записами, на production з 10 000 — 8-секундне завантаження.

Laravel Debugbar у dev-оточенні показує кількість запитів. Більше 20 — сигнал для audit.

Model::preventLazyLoading(! app()->isProduction());

Telescope для профілювання: логує всі запити, jobs, mail, notifications з деталізацією. Після впровадження eager loading час завантаження сторінки падає з 8 с до 0.3 с — у 27 разів.

Memory leak у статичних змінних

У Laravel Octane або Swoole додаток тримається в пам’яті між запитами. Статичні змінні не скидаються — призводять до неконтрольованого росту пам’яті. Використовуємо defer-функції та контейнерні біндинги для коректного скидання стану.

Неправильний connection pool

Rails, Laravel, Django відкривають нове з'єднання PostgreSQL на кожен PHP/Python процес. 100 воркерів — 100 з'єднань. PostgreSQL деградує від 200+ активних з'єднань через overhead на управління.

PgBouncer у transaction pooling: 1000 воркерів → 20–50 реальних з'єднань. Це знижує latency на 40% та зменшує витрати на хостинг на 30% — при середній вартості хостингу $2,000/міс економить $600/міс. GIN-індекс для JSONB до 100 разів швидший за B-tree при пошуку.

Як Octane справляється з високим навантаженням?

Laravel Octane (RoadRunner або Swoole) прибирає overhead bootstrap на кожен HTTP-запит. Приріст: 3–8x на синтетичних бенчмарках, 2–4x на реальних додатках. Важливо: не зберігати стан у статичних змінних — застосовуємо це на проектах >1000 RPS.

Як PostgreSQL допомагає уникнути повільних запитів?

Використовуємо composite indexes для WHERE + ORDER BY, partial indexes для фільтрів з високою селективністю, GIN-індекси для JSONB та full-text search. to_tsvector + GIN замість LIKE '%query%' — запобігає seq scan навіть на мільйонах записів. Аналізуємо плани через EXPLAIN ANALYZE та pg_stat_statements.

Як обрати стек для вашого проекту?

Стек Коли використовувати
Laravel + Octane CRUD, бізнес-логіка, REST/GraphQL API, адмінки
Node.js (Fastify) Realtime WebSocket, streaming, serverless, висока I/O concurrency
Go Високонавантажені мікросервіси (>10k RPS), gRPC, DevOps-інструменти
Django + DRF ML-пайплайни, інтеграція з AI, складна обробка даних
Ruby on Rails Швидкий MVP з багатим екосистемою гемів

Node.js виправданий для realtime: Laravel публікує події в Redis Pub/Sub, Node.js підписується та транслює клієнтам. Go — для goroutines (10k з'єднань на сервер — норма), але розробка повільніша, ніж Laravel.

Чому Redis критичний для продуктивності?

Redis виконує кілька ролей:

Роль Деталі
Кеш Кешування результатів важких запитів, фрагментів HTML
Черги Backend для Laravel Queue / Celery
Session store Distributed sessions в multi-instance оточенні
Pub/Sub Realtime події між сервісами
Rate limiting Sliding window counters для API throttling
Leaderboards Sorted Sets для рейтингів

Redis Cluster для горизонтального масштабування, Sentinel для автоматичного failover. Замовте консультацію щодо оптимізації Redis для вашого проекту.

Що входить в роботу під ключ

  • Архітектурне проектування (документація API, схема БД, діаграма сервісів)
  • Реалізація за узгодженим ТЗ з code review
  • Налаштування CI/CD (GitHub Actions, Docker), моніторингу (Sentry, Grafana), алертингу
  • Навантажувальне тестування (k6, wrk) зі звітом
  • Передача вихідних кодів, доступів, інструкція з деплою
  • Навчання команди замовника (2–3 сесії)
  • Гарантійна підтримка 1 місяць після здачі

Орієнтири по термінах

Задача Термін
REST API для мобільного/SPA (середня складність) 6–12 тижнів
Backend зі складною бізнес-логікою + інтеграції 12–20 тижнів
Високонавантажений сервіс на Go 8–16 тижнів
Міграція legacy PHP на Laravel 16–32 тижні

Вартість розраховується індивідуально після аналізу вимог до навантаження, інтеграцій та бізнес-логіки. Зв'яжіться з нами для безкоштовного аудиту вашого поточного backend — отримайте план оптимізації за 2 дні. Замовте консультацію та дізнайтеся, як знизити витрати на інфраструктуру на 30% без втрати продуктивності.