AI-система рекомендацій турів та подорожей

Проектуємо та впроваджуємо системи штучного інтелекту: від прототипу до production-ready рішення. Наша команда поєднує експертизу в машинному навчанні, дата-інжинірингу та MLOps, щоб AI працював не в лабораторії, а в реальному бізнесі.
Показано 1 з 1Усі 1564 послуг
AI-система рекомендацій турів та подорожей
Середній
~2-4 тижні
Часті запитання

Напрямки AI-розробки

Етапи розробки AI-рішення

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1358
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    957
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1188
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    646
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    929

До 70% туристів відмовляються від бронювання після невдалого пошуку. Ціна помилки висока: людина планує відпустку за десятки тисяч гривень, а контекст змінюється — подорож з дітьми потребує одних критеріїв, романтична подорож — інших. Ми будуємо AI, який розуміє ці нюанси з історії пошуку, бронювань і явних вподобань, формуючи персональний профіль мандрівника. Наш досвід — 10+ років в AI/ML, десятки проєктів у travel-сфері. Гарантуємо прозорість роботи моделі та повну підтримку на всіх етапах. Розробляємо AI-системи рекомендації турів із семантичним пошуком та персоналізованим підбором.

Як AI розуміє вподобання мандрівника?

Ключова проблема — зібрати розрізнені дані в єдину картину. Історія бронювань показує бюджет та тривалість, пошукові запити — інтереси, а кліки — неявні вподобання. Алгоритми машинного навчання, такі як матрична факторизація та нейромережеві ембеддінги, дозволяють витягти приховані патерни. Наприклад, користувач, який часто бронює готелі з високим рейтингом, але шукає недорогі авіаквитки — швидше за все, цінує якість проживання, але економить на перельоті. Ми будуємо профіль з десятків таких ознак. Для вирішення проблеми холодного старту використовуємо коротку анкету — 5 питань про тип поїздки, бюджет та інтереси. На старті також застосовуємо колаборативну фільтрацію на основі схожих користувачів.

Які проблеми вирішує система?

  • Холодний старт. Нові користувачі без історії — система використовує анкету та демографічні дані, щоб запропонувати перші тури. Конверсія при такому підході на 40% вища, ніж при випадковому показі.
  • Розрідженість даних. Більшість користувачів бронюють 1–2 рази на рік, що дає мало сигналів. Нейромережевий колаборативний фільтр з side-інформацією (вік, географія) компенсує нестачу даних, підвищуючи recall на 25%.
  • Зміна вподобань. Користувач, який раніше подорожував сам, може почати їздити з сім'єю. Система перераховує профіль після кожного бронювання, адаптуючись за 2–3 поїздки.

Профіль мандрівника та контекстні рекомендації

import pandas as pd
import numpy as np
from sentence_transformers import SentenceTransformer
from sklearn.metrics.pairwise import cosine_similarity
from anthropic import Anthropic
import json

class TravelerProfiler:
    """Профіль мандрівника з історії поїздок"""

    TRAVEL_STYLES = [
        'adventure', 'cultural', 'relaxation', 'gastronomy',
        'family', 'romantic', 'business', 'budget', 'luxury'
    ]

    def build_profile(self, booking_history: pd.DataFrame,
                       search_history: pd.DataFrame,
                       user_id: str) -> dict:
        """Профіль з бронювань та пошуку"""
        bookings = booking_history[booking_history['user_id'] == user_id]
        searches = search_history[search_history['user_id'] == user_id]

        if bookings.empty and searches.empty:
            return {'user_id': user_id, 'is_new': True}

        profile = {
            'user_id': user_id,
            'is_new': False,
            'total_trips': len(bookings),

            # Ціновий сегмент
            'avg_budget_per_person': bookings.get('price_per_person', pd.Series([0])).mean(),
            'hotel_star_preference': bookings.get('hotel_stars', pd.Series([3])).mean(),

            # Тип напрямків
            'preferred_climate': self._infer_climate_preference(bookings),
            'preferred_destination_type': self._infer_destination_type(bookings),
            'international_ratio': (bookings.get('is_international', pd.Series([False]))).mean(),

            # Організація поїздки
            'avg_trip_duration_days': bookings.get('duration_days', pd.Series([7])).mean(),
            'advance_booking_days': bookings.get('days_booked_in_advance', pd.Series([30])).mean(),
            'solo_vs_group': bookings.get('travelers_count', pd.Series([2])).mean(),

            # Активності з пошуку
            'activity_interests': self._extract_activity_interests(searches),
        }

        # Визначаємо стиль подорожей
        profile['travel_style'] = self._classify_travel_style(profile)

        return profile

    def _infer_climate_preference(self, bookings: pd.DataFrame) -> str:
        if 'destination_climate' not in bookings.columns:
            return 'mixed'
        climate_counts = bookings['destination_climate'].value_counts()
        return climate_counts.index[0] if len(climate_counts) > 0 else 'mixed'

    def _infer_destination_type(self, bookings: pd.DataFrame) -> str:
        if 'destination_type' not in bookings.columns:
            return 'mixed'
        type_counts = bookings['destination_type'].value_counts()
        return type_counts.index[0] if len(type_counts) > 0 else 'mixed'

    def _extract_activity_interests(self, searches: pd.DataFrame) -> list[str]:
        interests = set()
        activity_keywords = {
            'skiing': ['ski', 'snow', 'winter'],
            'beach': ['beach', 'sea', 'ocean', 'resort'],
            'hiking': ['hike', 'trek', 'mountain', 'nature'],
            'museums': ['museum', 'culture', 'history', 'art'],
            'gastronomy': ['food', 'restaurant', 'cuisine', 'wine'],
        }
        if 'query' not in searches.columns:
            return []

        for query in searches['query'].str.lower():
            for interest, keywords in activity_keywords.items():
                if any(kw in query for kw in keywords):
                    interests.add(interest)

        return list(interests)

    def _classify_travel_style(self, profile: dict) -> str:
        budget = profile.get('avg_budget_per_person', 0)
        stars = profile.get('hotel_star_preference', 3)
        if stars >= 4.5 or budget > 3000:
            return 'luxury'
        elif budget < 500:
            return 'budget'
        elif 'beach' in profile.get('activity_interests', []):
            return 'relaxation'
        elif profile.get('preferred_destination_type') == 'city':
            return 'cultural'
        return 'mixed'


class TourRecommendationEngine:
    """Рекомендації турів з семантичним пошуком"""

    def __init__(self):
        self.encoder = SentenceTransformer('paraphrase-multilingual-mpnet-base-v2')
        self.llm = Anthropic()

    def semantic_search(self, query: str,
                         tours_catalog: pd.DataFrame,
                         top_k: int = 20) -> pd.DataFrame:
        """Семантичний пошук турів за запитом"""
        query_embedding = self.encoder.encode(query, normalize_embeddings=True)

        # Кодуємо описи турів (в production: індекс попередньо обчислений та завантажений)
        if 'description_embedding' not in tours_catalog.columns:
            tours_catalog['description_embedding'] = tours_catalog['description'].apply(
                lambda x: self.encoder.encode(str(x), normalize_embeddings=True)
            )

        similarities = cosine_similarity(
            query_embedding.reshape(1, -1),
            np.stack(tours_catalog['description_embedding'].values)
        )[0]

        tours_catalog = tours_catalog.copy()
        tours_catalog['semantic_score'] = similarities
        return tours_catalog.nlargest(top_k, 'semantic_score')

    def personalized_ranking(self, candidates: pd.DataFrame,
                              traveler_profile: dict) -> pd.DataFrame:
        """Персоналізоване ранжування з семантичних кандидатів"""
        df = candidates.copy()

        # Ціновий збіг
        avg_budget = traveler_profile.get('avg_budget_per_person', 1000)
        df['price_fit'] = 1.0 - (abs(df['price_per_person'] - avg_budget) / avg_budget).clip(0, 1)

        # Стиль подорожей
        travel_style = traveler_profile.get('travel_style', 'mixed')
        df['style_match'] = df.get('tour_style', pd.Series(['mixed'] * len(df))).apply(
            lambda s: 1.0 if s == travel_style else 0.5 if s == 'mixed' else 0.3
        )

        # Інтереси-активності
        user_interests = set(traveler_profile.get('activity_interests', []))
        df['activity_match'] = df.get('activities', pd.Series([[]] * len(df))).apply(
            lambda acts: len(user_interests & set(acts)) / max(len(user_interests), 1) if user_interests else 0.5
        )

        # Тривалість
        preferred_duration = traveler_profile.get('avg_trip_duration_days', 7)
        df['duration_fit'] = 1.0 - (abs(df.get('duration_days', 7) - preferred_duration) / 14).clip(0, 1)

        df['final_score'] = (
            df['semantic_score'] * 0.30 +
            df['price_fit'] * 0.25 +
            df['style_match'] * 0.20 +
            df['activity_match'] * 0.15 +
            df['duration_fit'] * 0.10
        )

        return df.sort_values('final_score', ascending=False)

    def generate_tour_pitch(self, tour: dict,
                             traveler_profile: dict) -> str:
        """Персоналізований опис туру для користувача"""
        response = self.llm.messages.create(
            model="claude-3-5-sonnet-20241022",
            max_tokens=150,
            messages=[{
                "role": "user",
                "content": f"""Write a 3-sentence personalized pitch for this tour. Russian language.

Tour: {tour.get('name')}, {tour.get('destination')}
Key features: {tour.get('highlights', [])}

Traveler profile: {traveler_profile.get('travel_style')} traveler,
interests: {traveler_profile.get('activity_interests', [])},
typical budget: ${traveler_profile.get('avg_budget_per_person', 1000)}/person.

Highlight what's most relevant to THIS specific traveler."""
            }]
        )
        return response.content[0].text

Чому семантичний пошук кращий за ключовий?

Ключовий пошук по турах страждає від неповноти: користувач вводить «Туреччина 5 зірок» — система видає лише тури з точним збігом. Семантичний пошук розуміє контекст: «відпочинок на морі з дітьми» знаходить і тури в Туреччину, і в Єгипет, і на Кіпр, якщо опис відповідає. Наші тести показали: click-through rate видачі зростає на 22-35% порівняно з ключовим пошуком. Персоналізоване ранжування доводить конверсію з перегляду в бронювання до +18-25%.

Параметр Ключовий пошук Семантичний пошук
Розуміння запиту Точний збіг слів Сенс і синоніми
Охоплення турів Тільки з ключовими словами Всі тури, близькі за змістом
Вплив на CTR Базовий +22-35%
Конверсія в бронь - +18-25%

Вплив персоналізації на ключові метрики

Метрика До впровадження Після впровадження
Середній час підбору туру 45 хв 12 хв
Частка відмов від видачі 68% 42%
Конверсія бронювання 3.2% 4.8%
Середній чек - +15%

Як ми будуємо систему під ключ?

Процес включає п'ять етапів:

  1. Аналітика та збір вимог. Аудит даних клієнта: історія бронювань, каталог турів, архітектура CRM. Визначаємо бізнес-метрики (конверсія, середній чек, NPS).
  2. Проектування архітектури. Обираємо векторну БД (Pgvector або Qdrant), модель ембеддінгів (multilingual MPNet), LLM для генерації описів (Claude 3.5, GPT-4o).
  3. Реалізація та навчання. Пишемо пайплайни на PyTorch, налаштовуємо LoRA для донавчання, піднімаємо Triton Inference Server. Типова тривалість — 4–8 тижнів.
  4. Тестування та A/B-тест. Запускаємо спліт-тест на 20% трафіку: порівнюємо нову систему з поточною. Вимірюємо latency p99, конверсію, задоволеність користувачів.
  5. Деплой та запуск. Розгортаємо в продакшен (хмара або on-premise), надаємо API-документацію та дашборд метрик. Після запуску — три місяці підтримки.
Приклад архітектури системи
  • Data Layer: PostgreSQL (pgvector), S3 для зберігання ембеддінгів.
  • Model Serving: Triton Inference Server з ONNX Runtime, INT8 квантизація для зниження latency.
  • Orchestration: Airflow для перерахунку профілів кожні 24 години.
  • API Gateway: FastAPI, єдиний endpoint /recommend.

Результат і гарантії

Ми передаємо не просто код. На вас чекають:

  • API-документація (Swagger) та інструкція з експлуатації,
  • доступ до Git-репозиторію з навченими моделями,
  • дашборд метрик (latency p99, конверсія, кількість бронювань),
  • навчання двох співробітників роботі з системою,
  • гарантія на код та SLA за часом відповіді (p99 < 200 мс).

Терміни та вартість

Терміни — від 6 до 12 тижнів залежно від обсягу даних та кількості інтеграцій. Вартість проекту — від $50,000 до $150,000. Економія на бронюваннях досягає $15-25 на одного туриста. Вартість розраховується індивідуально після аудиту ваших даних та інфраструктури. Оцінимо ваш проект за 2 робочі дні. Отримайте консультацію: напишіть нам з коротким описом завдання — запропонуємо оптимальне рішення. Замовте розробку AI-системи для вашого туроператора і переконайтеся в ефективності підбору турів.

Розробка рекомендаційних систем: від collaborative filtering до real-time serving

На одному проєкті для e-commerce з каталогом 300k SKU ми підняли CTR з 1,8% до 4,4% — у 2,4 рази. Перший ривок дала колаборативна фільтрація замість «популярне за останні 7 днів», другий — додавання контентних ознак та re-ranking. Різниця між «показуємо популярне» і «показуємо персоналізоване» — вимірна та суттєва. Нижче — інженерний досвід, який допоміг це зробити, і архітектури, які реально працюють у продакшені.

Collaborative Filtering: матрична факторизація та нейронні підходи

Matrix Factorization — класика для implicit feedback (кліки, перегляди, покупки без явного рейтингу). ALS (Alternating Least Squares) у бібліотеці Implicit обробляє матриці user×item із сотнями мільйонів ненульових значень за хвилини на GPU. Latent factors 64–256, регуляризація λ=0.01–0.1 — стартові параметри. Проблема cold start: для нового користувача або товару немає історії — класичний CF безпорадний, потрібні контентні ознаки або гібрид.

Neural Collaborative Filtering (NCF) замінює скалярний добуток на нейромережу. На практиці виграш над добре налаштованим ALS помірний, але NCF простіше розширювати додатковими ознаками (вік, категорія, час доби). Sequence-aware моделі (SASRec, BERT4Rec) враховують порядок взаємодій — state-of-the-art для сесійних рекомендацій.

Як вибрати архітектуру рекомендаційної системи?

Відповідь залежить від даних, навантаження та вимог до холодного старту. Нижче — три основні підходи з критеріями вибору.

Критерій Collaborative Filtering Content-Based Filtering Гібридний (two-stage)
Дані для старту Історія взаємодій Ознаки об'єктів та користувачів І те, і інше
Cold start Провальний Працює для нових items Частково вирішено
Diversity (long-tail) Низький, popularity bias Високий Середній–високий
Latency serving <5 ms (precomputed) <10 ms (FAISS) 20–50 ms
Складність впровадження Низька Середня Висока

Гібридна архітектура на 20–40% ефективніша за чистий CF за покриттям long-tail — перевірено на каталогах від 100k SKU.

Content-Based Filtering: коли історії взаємодій мало

Content-based рекомендує на основі характеристик товарів, а не поведінки інших користувачів — вирішує cold start для нових items. Текстові ембединги через sentence-transformers (multilingual-e5-base, BGE-M3) → пошук схожих через FAISS IndexFlatIP — запит за <5 ms на 100k товарів. Item2Vec (Word2Vec на послідовностях переглядів) дає інтерпретовані «схожі товари» за пару годин навчання.

Структуровані ознаки (категорія, бренд, ціна) подаються через embedding layers або в gradient boosting — CatBoost працює з категоріями без ручного кодування.

Чому гібридні моделі працюють краще?

Production-системи майже завжди дворівневі. Stage 1 (Retrieval) — швидкий відбір 100–500 кандидатів із 300k товарів через ALS або Two-Tower модель з векторним пошуком (FAISS, Qdrant). Stage 2 (Ranking) — важкий ранжувальник на LightGBM або нейромережі з cross-features, часом, пристроєм та контекстом сесії. LightFM — хороша відправна точка для середнього масштабу без важкої інфраструктури. Наша практика показує: перехід від single-stage до two-stage дає приріст точності на 15–25% при зростанні latency всього на 20–30 мс.

Real-Time Serving: архітектура під навантаження

Latency SLA — 50–100 ms при тисячах запитів на секунду. Base-рекомендації precompute (batch job раз на годину) → Redis по user_id → <5 ms. Real-time re-ranking через Kafka для подій (кліки, додавання в кошик) → оновлення контекстних ознак. Feature serving — Redis з TTL (кількість переглядів за 24 години, останній клікнутий item). При навантаженні 10k req/s ставимо Redis Cluster з реплікацією.

A/B тестування — єдиний достовірний спосіб оцінити покращення. Офлайн-метрики корелюють з онлайн не завжди. Kohavi et al., «Online Controlled Experiments at Large Scale» (KDD 2013) — обов'язкове читання для команди. Тест з 5–10% трафіку, моніторинг CTR, конверсії, revenue per session. Одна з наших клієнтських систем після гібридизації збільшила виручку на 18% за місяць A/B.

Терміни розробки рекомендаційної системи

Етапи та типові часові витрати — у таблиці нижче. Вартість розраховується індивідуально під масштаб каталогу та вимоги до latency.

Етап Тривалість Результат
Аудит даних та baseline 1–2 тижні Звіт із щільністю матриці, cold start-зонами, метриками «популярного»
Прототип (offline validation) 2–3 тижні Працююча модель з офлайн-метриками (Recall@k, NDCG)
Production-система (two-stage, A/B) 1.5–2.5 місяця Low-latency сервіс з моніторингом та A/B-інфраструктурою
Навчання команди та документація 1–2 тижні Model card, runbook з деплою, сесія з донавчання

Що входить у розробку під ключ

  1. Аудит даних — щільність матриці user×item (зазвичай <0,1%), розподіл активності, temporal паттерни, cold start статистика.
  2. Baseline — «популярне» як простий поріг, який часто важко перевершити.
  3. Ітеративне покращення — ALS → контентні ознаки → two-stage → sequence-aware. Кожен крок з A/B.
  4. Інфраструктура serving — batch precomputation, Redis, real-time re-ranking, моніторинг у Grafana.
  5. Документація — model card з метриками, інструкція з деплою, опис ознак.
  6. Навчання команди — сесія з інтерпретації результатів та донавчання моделі.
  7. Підтримка — 1 місяць після запуску (фікс інцидентів, доналаштування pipeline).

Ми — команда з 7+ роками досвіду в рекомендаційних системах, реалізували понад 30 проєктів для e-commerce та медіа. Гарантуємо прозоре A/B-тестування та фіксацію покращення метрик.

Хочете оцінити потенціал зростання вашого каталогу? Зв'яжіться з нами для безкоштовного аудиту даних. Замовте розробку рекомендаційної системи — перший прототип протягом двох тижнів.

Приклад конфігу ALS для implicit feedback
from implicit.als import AlternatingLeastSquares

model = AlternatingLeastSquares(
    factors=64,
    regularization=0.05,
    iterations=15,
    use_gpu=True
)
model.fit(user_item_matrix)

Більше про математику рекомендаційних систем — у Wikipedia.