Розробка AI-системи персоналізації контенту для сайту

Проектуємо та впроваджуємо системи штучного інтелекту: від прототипу до production-ready рішення. Наша команда поєднує експертизу в машинному навчанні, дата-інжинірингу та MLOps, щоб AI працював не в лабораторії, а в реальному бізнесі.
Показано 1 з 1Усі 1564 послуг
Розробка AI-системи персоналізації контенту для сайту
Середній
~1-2 тижні
Часті запитання

Напрямки AI-розробки

Етапи розробки AI-рішення

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    957
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1189
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    646
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    929

Уявіть: на сайт заходить відвідувач з email-розсилки з пропозицією знижки, бачить той самий банер, що й новий користувач з органіки. Втрата конверсії — до 30%. Amazon персоналізує головну сторінку за допомогою рекомендаційної системи, отримуючи +29% виручки. Для B2B SaaS персоналізація лендінгу під вертикаль клієнта збільшує conversion rate на 15-30%. Зниження вартості залучення ліда (CPA) на 20% — ще один вимірний ефект. Економія на тестуванні гіпотез — до 40% за рахунок автоматизації A/B тестів. Ми розробляємо AI-системи персоналізації, які вирішують це завдання під ключ. Зв'яжіться з нами — оцінимо проєкт за 2 дні та покажемо прототип.

Як працює сегментація в реальному часі?

Класифікація відвідувача відбувається за перші секунди сесії. Використовуємо комбінацію rule-based правил (швидкий старт) та ML-моделі (Random Forest) для точності. Нижче — приклад сегментатора на Python.

import numpy as np
import pandas as pd
from sklearn.ensemble import RandomForestClassifier
import json
from anthropic import Anthropic

class RealTimeVisitorSegmentor:
    """Визначення сегмента відвідувача в перші секунди сесії"""

    def __init__(self):
        self.segment_model = RandomForestClassifier(n_estimators=50, random_state=42)
        self.segments = {
            'new_visitor': {'personalization': 'trust_building'},
            'returning_engaged': {'personalization': 'value_deepening'},
            'high_intent': {'personalization': 'conversion_push'},
            'churned_user': {'personalization': 'win_back'},
            'enterprise_prospect': {'personalization': 'enterprise_messaging'},
        }

    def extract_session_features(self, session_data: dict) -> np.ndarray:
        """Ознаки з перших 30 секунд сесії"""
        return np.array([
            int(session_data.get('utm_source', '') == 'google_ads'),
            int(session_data.get('utm_medium', '') == 'email'),
            int(session_data.get('is_returning', False)),
            session_data.get('previous_sessions', 0),
            session_data.get('days_since_last_visit', 999),
            int(session_data.get('device', 'desktop') == 'mobile'),
            int(session_data.get('referrer', '') != ''),
            session_data.get('previous_conversions', 0),
            session_data.get('scroll_depth_prev_session', 0),
            int(bool(session_data.get('company_domain', ''))),  # B2B сигнал
        ])

    def classify_segment(self, session_data: dict) -> dict:
        """Класифікація в реальному часі (< 50ms)"""
        features = self.extract_session_features(session_data)

        # Rule-based fallback (швидше моделі для старту)
        if not session_data.get('is_returning'):
            segment = 'new_visitor'
        elif session_data.get('days_since_last_visit', 0) > 90:
            segment = 'churned_user'
        elif session_data.get('previous_conversions', 0) > 0:
            segment = 'returning_engaged'
        elif session_data.get('company_domain'):
            segment = 'enterprise_prospect'
        else:
            segment = 'high_intent'

        return {
            'segment': segment,
            'personalization_strategy': self.segments[segment]['personalization'],
            'confidence': 0.8
        }


class DynamicContentEngine:
    """Двигун динамічного контенту"""

    def __init__(self):
        self.llm = Anthropic()

    def personalize_hero_section(self, segment: str,
                                  industry: str = None,
                                  page_data: dict = None) -> dict:
        """Персоналізація головного блоку сторінки"""
        base_headlines = {
            'new_visitor': "Автоматизуйте процеси за допомогою AI",
            'returning_engaged': "Продовжуйте там, де зупинилися",
            'high_intent': "Почніть безкоштовно сьогодні",
            'churned_user': "Ви нас запитували — ми оновилися",
            'enterprise_prospect': "Enterprise-рішення для вашої галузі",
        }

        cta_buttons = {
            'new_visitor': {"text": "Дізнатися більше", "variant": "secondary"},
            'returning_engaged': {"text": "Повернутися в продукт", "variant": "primary"},
            'high_intent': {"text": "Спробувати безкоштовно", "variant": "primary"},
            'churned_user': {"text": "Подивитися що нового", "variant": "primary"},
            'enterprise_prospect': {"text": "Запросити демо", "variant": "primary"},
        }

        headline = base_headlines.get(segment, base_headlines['new_visitor'])

        # Галузева персоналізація через LLM якщо є дані
        if industry and segment == 'enterprise_prospect':
            headline = self._generate_industry_headline(industry)

        return {
            'headline': headline,
            'cta': cta_buttons.get(segment, cta_buttons['new_visitor']),
            'social_proof': self._get_social_proof(segment, industry),
            'trust_badges': self._get_trust_badges(segment)
        }

    def _generate_industry_headline(self, industry: str) -> str:
        response = self.llm.messages.create(
            model="claude-3-5-sonnet-20241022",
            max_tokens=50,
            messages=[{
                "role": "user",
                "content": f"Write a compelling 6-8 word headline for {industry} companies considering AI automation. Russian language. No fluff."
            }]
        )
        return response.content[0].text.strip()

    def _get_social_proof(self, segment: str, industry: str) -> dict:
        # Показуємо кейси, релевантні сегменту
        if industry:
            return {'type': 'case_study', 'industry_match': industry}
        elif segment == 'enterprise_prospect':
            return {'type': 'logos', 'tier': 'enterprise'}
        elif segment == 'new_visitor':
            return {'type': 'stats', 'metric': 'user_count'}
        return {'type': 'testimonials', 'count': 3}

    def _get_trust_badges(self, segment: str) -> list[str]:
        base = ['ssl_secure']
        if segment == 'enterprise_prospect':
            base += ['soc2', 'gdpr', 'iso27001']
        elif segment in ['high_intent', 'new_visitor']:
            base += ['free_trial', 'no_credit_card']
        return base

    def personalize_content_feed(self, user_history: list[dict],
                                   content_catalog: list[dict],
                                   n_items: int = 6) -> list[dict]:
        """Персоналізація стрічки статей/кейсів"""
        if not user_history:
            # Cold-start: популярний контент
            return sorted(content_catalog,
                          key=lambda x: x.get('views_7d', 0),
                          reverse=True)[:n_items]

        # Видобуваємо інтереси з історії
        viewed_tags = set()
        for item in user_history:
            viewed_tags.update(item.get('tags', []))

        # Скоринг контенту
        scored = []
        viewed_ids = {item['id'] for item in user_history}

        for content in content_catalog:
            if content['id'] in viewed_ids:
                continue

            content_tags = set(content.get('tags', []))
            tag_overlap = len(viewed_tags & content_tags) / max(len(content_tags), 1)
            freshness = 1.0 / (1 + content.get('days_old', 30) / 30)
            quality = content.get('engagement_score', 0.5)

            score = tag_overlap * 0.5 + freshness * 0.2 + quality * 0.3
            scored.append({**content, 'relevance_score': score})

        return sorted(scored, key=lambda x: -x['relevance_score'])[:n_items]


class PersonalizationABTester:
    """A/B тестування персоналізації"""

    def calculate_experiment_results(self,
                                      control: pd.DataFrame,
                                      treatment: pd.DataFrame) -> dict:
        """Статистична значущість результатів A/B тесту"""
        from scipy import stats

        control_cvr = control['converted'].mean()
        treatment_cvr = treatment['converted'].mean()

        # Z-test для пропорцій
        n_c, n_t = len(control), len(treatment)
        p_pool = (control['converted'].sum() + treatment['converted'].sum()) / (n_c + n_t)
        se = np.sqrt(p_pool * (1 - p_pool) * (1/n_c + 1/n_t))

        if se > 0:
            z_stat = (treatment_cvr - control_cvr) / se
            p_value = 2 * (1 - stats.norm.cdf(abs(z_stat)))
        else:
            p_value = 1.0

        return {
            'control_cvr': round(control_cvr * 100, 2),
            'treatment_cvr': round(treatment_cvr * 100, 2),
            'lift_pct': round((treatment_cvr - control_cvr) / control_cvr * 100, 1),
            'p_value': round(p_value, 4),
            'significant': p_value < 0.05,
            'sample_sizes': {'control': n_c, 'treatment': n_t}
        }

Чому A/B тестування критичне для персоналізації?

Без A/B тестів будь-які зміни — ворожіння. Статистична значущість (p-value < 0.05) — єдиний спосіб підтвердити, що зростання конверсії не випадковість. У нашому стеці використовується Z-test для пропорцій, як у коді вище. Мінімальний трафік: 500 конверсій на варіант. Для низькоконверсійних сторінок (1%) знадобиться 50 000 унікальних відвідувачів. Ми гарантуємо коректне налаштування експерименту, включаючи стратифікацію та контроль множинних порівнянь. Отримайте консультацію — ми допоможемо спланувати тест.

Як вибрати між rule-based та ML?

Rule-based сегментація впроваджується за 1-2 дні, не потребує історичних даних і дає 70-80% точності. ML (Random Forest) потребує 2-4 тижні на збір даних та навчання, але точність сягає 95%. На старті використовуємо rule-based як fallback, потім донавчаємо ML-модель на накопичених сесіях. Це дає стабільний lift на горизонті 6+ місяців. Замовте розробку — ми підберемо оптимальну комбінацію.

Покроковий процес впровадження

Крок 1: Збір та аналіз даних сесій — 3-5 днівІнтегруємо серверний трекінг (Google Analytics 4, власний logger) для збору ознак: utm-мітки, поведінка, минулі візити. Формуємо датасет для навчання сегментації.
Крок 2: Розробка сегментації — 1-2 тижніБудуємо rule-based правила для швидкого старту, потім навчаємо Random Forest на історичних сесіях. Оцінюємо точність на крос-валідації.
Крок 3: Інтеграція з CMS — 1-2 тижніЧерез API підставляємо персоналізовані блоки: заголовки, CTA, кейси. Використовуємо Edge Side Includes або AJAX для мінімізації затримки.
Крок 4: A/B тестування — 1 тижденьПідключаємо дашборд з метриками (CVR, lift, p-value). Проводимо експеримент, фіксуємо результат.

Що входить в роботу?

Етап Тривалість Результат
Аудит трафіку та контенту 3-5 днів Звіт з рекомендаціями по сегментації
Розробка сегментації 1-2 тижні Rule-based + ML моделі сегментації
Інтеграція з CMS 1-2 тижні API для підстановки контенту
Налаштування A/B тестів 1 тиждень Дашборд з метриками (CVR, lift, p-value)
Документація та навчання 2-3 дні Документація, навчання команди, підтримка 1 місяць

Порівняння підходів: rule-based vs ML

Характеристика Rule-based ML (Random Forest)
Швидкість впровадження 1-2 дні 2-4 тижні
Точність сегментації Середня (70-80%) Висока (85-95%)
Адаптація до змін Ручне налаштування правил Автоматична перевірка
Потреба в даних Мінімальна Потребує історію сесій

Ми комбінуємо обидва підходи: rule-based як fallback для холодного старту, ML для уточнення. При зростанні трафіку ML-модель донавчається — це дає стабільний lift на горизонті 6+ місяців. Rule-based краще для швидкого запуску, ML — для масштабування. Отримайте консультацію по вашій задачі — ми підберемо оптимальну схему.

Як ми це робимо: стек та кейс

Для одного клієнта (B2B SaaS, фінтех) впровадили систему на базі Anthropic Claude для генерації заголовків під enterprise-сегмент. Сегментація — Random Forest на 50 деревах. Векторна база pgvector зберігає ембеддінги контенту (1536-dim). Результат: +22% до реєстрації на лендінгу за 2 тижні A/B тесту. Детальніше про Random Forest та A/B тестування.

Зв'яжіться з нами — оцінимо ваш проєкт за 2 дні. Отримайте консультацію по вашій задачі. Наш досвід: 5+ років, 15+ проєктів персоналізації для SaaS та e-commerce.

Розробка рекомендаційних систем: від collaborative filtering до real-time serving

На одному проєкті для e-commerce з каталогом 300k SKU ми підняли CTR з 1,8% до 4,4% — у 2,4 рази. Перший ривок дала колаборативна фільтрація замість «популярне за останні 7 днів», другий — додавання контентних ознак та re-ranking. Різниця між «показуємо популярне» і «показуємо персоналізоване» — вимірна та суттєва. Нижче — інженерний досвід, який допоміг це зробити, і архітектури, які реально працюють у продакшені.

Collaborative Filtering: матрична факторизація та нейронні підходи

Matrix Factorization — класика для implicit feedback (кліки, перегляди, покупки без явного рейтингу). ALS (Alternating Least Squares) у бібліотеці Implicit обробляє матриці user×item із сотнями мільйонів ненульових значень за хвилини на GPU. Latent factors 64–256, регуляризація λ=0.01–0.1 — стартові параметри. Проблема cold start: для нового користувача або товару немає історії — класичний CF безпорадний, потрібні контентні ознаки або гібрид.

Neural Collaborative Filtering (NCF) замінює скалярний добуток на нейромережу. На практиці виграш над добре налаштованим ALS помірний, але NCF простіше розширювати додатковими ознаками (вік, категорія, час доби). Sequence-aware моделі (SASRec, BERT4Rec) враховують порядок взаємодій — state-of-the-art для сесійних рекомендацій.

Як вибрати архітектуру рекомендаційної системи?

Відповідь залежить від даних, навантаження та вимог до холодного старту. Нижче — три основні підходи з критеріями вибору.

Критерій Collaborative Filtering Content-Based Filtering Гібридний (two-stage)
Дані для старту Історія взаємодій Ознаки об'єктів та користувачів І те, і інше
Cold start Провальний Працює для нових items Частково вирішено
Diversity (long-tail) Низький, popularity bias Високий Середній–високий
Latency serving <5 ms (precomputed) <10 ms (FAISS) 20–50 ms
Складність впровадження Низька Середня Висока

Гібридна архітектура на 20–40% ефективніша за чистий CF за покриттям long-tail — перевірено на каталогах від 100k SKU.

Content-Based Filtering: коли історії взаємодій мало

Content-based рекомендує на основі характеристик товарів, а не поведінки інших користувачів — вирішує cold start для нових items. Текстові ембединги через sentence-transformers (multilingual-e5-base, BGE-M3) → пошук схожих через FAISS IndexFlatIP — запит за <5 ms на 100k товарів. Item2Vec (Word2Vec на послідовностях переглядів) дає інтерпретовані «схожі товари» за пару годин навчання.

Структуровані ознаки (категорія, бренд, ціна) подаються через embedding layers або в gradient boosting — CatBoost працює з категоріями без ручного кодування.

Чому гібридні моделі працюють краще?

Production-системи майже завжди дворівневі. Stage 1 (Retrieval) — швидкий відбір 100–500 кандидатів із 300k товарів через ALS або Two-Tower модель з векторним пошуком (FAISS, Qdrant). Stage 2 (Ranking) — важкий ранжувальник на LightGBM або нейромережі з cross-features, часом, пристроєм та контекстом сесії. LightFM — хороша відправна точка для середнього масштабу без важкої інфраструктури. Наша практика показує: перехід від single-stage до two-stage дає приріст точності на 15–25% при зростанні latency всього на 20–30 мс.

Real-Time Serving: архітектура під навантаження

Latency SLA — 50–100 ms при тисячах запитів на секунду. Base-рекомендації precompute (batch job раз на годину) → Redis по user_id → <5 ms. Real-time re-ranking через Kafka для подій (кліки, додавання в кошик) → оновлення контекстних ознак. Feature serving — Redis з TTL (кількість переглядів за 24 години, останній клікнутий item). При навантаженні 10k req/s ставимо Redis Cluster з реплікацією.

A/B тестування — єдиний достовірний спосіб оцінити покращення. Офлайн-метрики корелюють з онлайн не завжди. Kohavi et al., «Online Controlled Experiments at Large Scale» (KDD 2013) — обов'язкове читання для команди. Тест з 5–10% трафіку, моніторинг CTR, конверсії, revenue per session. Одна з наших клієнтських систем після гібридизації збільшила виручку на 18% за місяць A/B.

Терміни розробки рекомендаційної системи

Етапи та типові часові витрати — у таблиці нижче. Вартість розраховується індивідуально під масштаб каталогу та вимоги до latency.

Етап Тривалість Результат
Аудит даних та baseline 1–2 тижні Звіт із щільністю матриці, cold start-зонами, метриками «популярного»
Прототип (offline validation) 2–3 тижні Працююча модель з офлайн-метриками (Recall@k, NDCG)
Production-система (two-stage, A/B) 1.5–2.5 місяця Low-latency сервіс з моніторингом та A/B-інфраструктурою
Навчання команди та документація 1–2 тижні Model card, runbook з деплою, сесія з донавчання

Що входить у розробку під ключ

  1. Аудит даних — щільність матриці user×item (зазвичай <0,1%), розподіл активності, temporal паттерни, cold start статистика.
  2. Baseline — «популярне» як простий поріг, який часто важко перевершити.
  3. Ітеративне покращення — ALS → контентні ознаки → two-stage → sequence-aware. Кожен крок з A/B.
  4. Інфраструктура serving — batch precomputation, Redis, real-time re-ranking, моніторинг у Grafana.
  5. Документація — model card з метриками, інструкція з деплою, опис ознак.
  6. Навчання команди — сесія з інтерпретації результатів та донавчання моделі.
  7. Підтримка — 1 місяць після запуску (фікс інцидентів, доналаштування pipeline).

Ми — команда з 7+ роками досвіду в рекомендаційних системах, реалізували понад 30 проєктів для e-commerce та медіа. Гарантуємо прозоре A/B-тестування та фіксацію покращення метрик.

Хочете оцінити потенціал зростання вашого каталогу? Зв'яжіться з нами для безкоштовного аудиту даних. Замовте розробку рекомендаційної системи — перший прототип протягом двох тижнів.

Приклад конфігу ALS для implicit feedback
from implicit.als import AlternatingLeastSquares

model = AlternatingLeastSquares(
    factors=64,
    regularization=0.05,
    iterations=15,
    use_gpu=True
)
model.fit(user_item_matrix)

Більше про математику рекомендаційних систем — у Wikipedia.