При запиті «листя» Elasticsearch з Snowball-стемінгом повертає тільки «лист» — не знаходить «листочок», «листовий». Це типова проблема для російського морфологічного аналізу: стемінг за правилами обрізає закінчення, втрачаючи до 40% релевантних документів. Ми використовуємо лематизацію на основі Hunspell-словників, щоб гарантувати точний пошук за всіма словоформами російської та англійської мов. За 10+ років роботи виконали понад 40 проєктів з налаштування пошуку для інтернет-магазинів, новинних порталів та корпоративних порталів. Наші інженери мають сертифікати Elastic Certified Engineer та глибоке розуміння лінгвістичних алгоритмів.
Морфологічний аналіз — це не просто зрізання закінчень, а словниковий розбір. Згідно з документацією Elasticsearch, лематизація забезпечує на 30–50% більше релевантних результатів, ніж стемінг. Нижче розберемо, які підходи працюють на практиці та як ми їх реалізуємо.
Чому стемінг програє лематизації?
Стемінг (Snowball, Porter) обрізає закінчення за правилами. Швидко — 1–2 мс на токен, але неточно. Наприклад, «бігати» та «біг» дають різні стеми, хоча семантично пов`язані. Для російської мови це критично: словоформи можуть відрізнятися сильно (біжучий, бігло, бігти). Лематизація використовує словники (Hunspell, Mystem) та приводить слова до базової форми. Це повільніше при індексації (у 3–10 разів), але точність пошуку зростає на 30–50%. У наших проєктах лематизація Hunspell у 1.5 рази точніша за Snowball.
| Параметр | Стемінг (Snowball) | Лематизація (Hunspell) |
|---|---|---|
| Швидкість індексації | 1–2 мс/токен | 5–20 мс/токен |
| Точність пошуку для російської | ~60% | ~90% |
| Залежність від словників | немає | потрібен 50–500 МБ словник |
| Підтримка словоформ | обмежена | повна лематизація |
Як налаштувати Hunspell для російської та англійської?
Встановлення словників виконується за один робочий день. Словники беремо з репозиторію LibreOffice.
mkdir -p /etc/elasticsearch/hunspell/ru_RU
cd /etc/elasticsearch/hunspell/ru_RU
wget https://cgit.freedesktop.org/libreoffice/dictionaries/plain/ru_RU/ru_RU.dic
wget https://cgit.freedesktop.org/libreoffice/dictionaries/plain/ru_RU/ru_RU.aff
# Аналогічно для en_US
Після додавання словників перезапускаємо Elasticsearch і створюємо індекс з аналізатором.
PUT /articles
{
"settings": {
"analysis": {
"filter": {
"ru_hunspell": {
"type": "hunspell",
"locale": "ru_RU",
"dedup": true
},
"en_hunspell": {
"type": "hunspell",
"locale": "en_US",
"dedup": true
}
},
"analyzer": {
"ru_en_morphology": {
"tokenizer": "standard",
"filter": ["lowercase", "ru_hunspell", "en_hunspell", "unique"]
}
}
}
},
"mappings": {
"properties": {
"content": {
"type": "text",
"analyzer": "ru_en_morphology",
"search_analyzer": "ru_en_morphology"
}
}
}
}
Перевірка якості:
POST /articles/_analyze
{
"analyzer": "ru_en_morphology",
"text": "Розробники створили додаток для керування завданнями"
}
# Очікувані токени: розробник, створити, додаток, керування, завдання
Ускладнення виникають при двомовному контенті. Використовуємо multi-field з різними аналізаторами для російської та англійської, а потім мультиматч з бустингом. Це підвищує релевантність при пошуку змішаних запитів.
Як покращити пошук на змішаному контенті?
Для сайтів з російсько-англійським контентом застосовуємо multi-field: одне поле з ru_hunspell, інше з en_hunspell. Пошук через multi_match з коефіцієнтом 1.5 для основної мови. В результаті точність пошуку за змішаними запитами зростає на 25%. Наприклад, запит "керування tasks" знайде документи з обома мовами.
| Метод | Точність для ru | Точність для en | Час відгуку |
|---|---|---|---|
| Тільки стандартний | 55% | 70% | <30 мс |
| Hunspell ru/en мульти-філд | 88% | 85% | <50 мс |
Кейс: інтернет-магазин меблів
Наш клієнт — інтернет-магазин меблів — зіткнувся з проблемою: за запитом "стілець" не знаходилися "стільці", "стільчик". Після впровадження Hunspell точність пошуку зросла з 62% до 89%. Додатково налаштували мульти-філд для каталогу з італійськими назвами англійською. У підсумку конверсія з пошуку збільшилася на 12%, а виручка зросла на 15%. Налаштування зайняло 3 робочих дні.
Процес налаштування під ключ
- Аналіз даних: оцінка обсягу, мовного складу, типів запитів.
- Підбір словників: Hunspell для ru/en, при необхідності — розширені користувацькі словники.
- Конфігурація індексу: налаштування аналізаторів, тестування на вибірці.
- Переіндексація: створення нового індексу з морфологією, переливка даних.
- Оптимізація: налаштування
refresh_interval,number_of_replicas,forcemerge. - Приймальне тестування: звіряння результатів пошуку до/після, правка стоп-слів.
- Документація та передача: схема індексу, регламенти підтримки.
Що входить в роботу
- Підготовка та встановлення словників Hunspell для російської та англійської мов.
- Налаштування аналізаторів з урахуванням специфіки контенту (стоп-слова, дедуплікація).
- Створення схеми індексу з multi-field для двомовного пошуку.
- Скрипти переіндексації та оптимізації продуктивності (bulk, forcemerge).
- Документація з конфігурації та інструкція з додавання нових словників.
- Використання ліцензійних словників Hunspell.
- Гарантія роботи аналізатора протягом 30 днів після здачі.
Приклад конфігурації для двомовного індексу
PUT /articles_bilingual
{
"settings": {
"analysis": {
"filter": {
"ru_hunspell": { "type": "hunspell", "locale": "ru_RU", "dedup": true },
"en_hunspell": { "type": "hunspell", "locale": "en_US", "dedup": true }
},
"analyzer": {
"ru_analyzer": { "tokenizer": "standard", "filter": ["lowercase", "ru_hunspell", "unique"] },
"en_analyzer": { "tokenizer": "standard", "filter": ["lowercase", "en_hunspell", "unique"] }
}
}
},
"mappings": {
"properties": {
"title": {
"type": "text",
"fields": {
"russian": { "type": "text", "analyzer": "ru_analyzer" },
"english": { "type": "text", "analyzer": "en_analyzer" }
}
}
}
}
}
Строки
Орієнтовні строки: від 2 до 5 робочих днів залежно від обсягу даних та складності конфігурації. Вартість розраховується індивідуально. Середня економія бюджету на доопрацюваннях пошуку після впровадження Hunspell становить 30% порівняно з альтернативними рішеннями.
Ми гарантуємо, що точність пошуку за словоформами збільшиться не менше ніж на 30% порівняно зі стандартним Snowball-стемінгом.
Якщо ви хочете покращити пошук на своєму проєкті — звʼяжіться з нами для консультації. Оцінимо завдання безкоштовно. Замовте налаштування морфологічного пошуку в Elasticsearch. Отримайте безкоштовну консультацію.







