Вступление
Представьте: у вас 500 000 пользователей, каталог 100 000 товаров, а конверсия в рекомендациях — всего 2%. Причина? Стандартные популярные товары не персонализированы. Мы решаем эту задачу с помощью коллаборативной фильтрации (Collaborative Filtering, CF), которая анализирует матрицу взаимодействий «пользователь × товар» и выдает персонализированные результаты. Никакой информации о самом товаре не нужно — только поведенческие сигналы. Именно поэтому CF работает там, где Content-Based пасует: в рекомендациях одежды, книг, контента с неструктурированными метаданными. Согласно исследованию Amazon, внедрение CF увеличивает продажи на 20–30% в первые месяцы. Наш опыт внедрения показывает, что правильная настройка весов и A/B тестирование позволяют достичь стабильного прироста CTR на 30–50%.
Коллаборативная фильтрация: техническая суть и основные сложности
Matrix Factorization как основа
Классический CF через dot-product поиска ближайших соседей не масштабируется при >100K пользователей. Рабочий подход — разложение матрицы взаимодействий на два embedding-пространства: пользователи и товары представляются векторами фиксированной размерности (обычно 64–256). Рекомендация — это поиск товаров, чьи эмбеддинги ближе всего к эмбеддингу пользователя.
Библиотеки для тренировки: Implicit (Python, специализирована на implicit feedback), LightFM (гибридный CF+content), RecBole (исследовательский фреймворк с 70+ алгоритмами). Для продакшн-деплоя чаще выбирают Implicit + FAISS для ANN-поиска. По скорости Implicit в 3 раза быстрее LightFM на разреженных матрицах.
| Библиотека | Тип данных | Скорость обучения | Гибкость | Продакшен-готовность |
|---|---|---|---|---|
| Implicit | Implicit/Explicit | ★★★★★ | ★★★ | ★★★★★ |
| LightFM | Гибридный | ★★★★ | ★★★★★ | ★★★★ |
| RecBole | Исследовательский | ★★★ | ★★★★ | ★★★ |
Как коллаборативная фильтрация решает проблему холодного старта?
Новый пользователь без истории взаимодействий — типичный cold start. Стандартное решение: первые 5–10 взаимодействий используем правило «популярные товары из категории интереса» (onboarding flow с выбором предпочтений). После накопления минимальной истории переключаемся на персонализированную модель.
В коде это выглядит как стратегический паттерн:
// Android: стратегия рекомендаций в зависимости от истории
interface RecommendationStrategy {
suspend fun getRecommendations(userId: String, count: Int): List<Product>
}
class ColdStartStrategy(private val api: RecommendationApi) : RecommendationStrategy {
override suspend fun getRecommendations(userId: String, count: Int) =
api.getPopularByPreferences(userId, count)
}
class CFStrategy(private val api: RecommendationApi) : RecommendationStrategy {
override suspend fun getRecommendations(userId: String, count: Int) =
api.getPersonalized(userId, count)
}
class RecommendationRepository(private val api: RecommendationApi) {
suspend fun getRecommendations(user: User): List<Product> {
val strategy = if (user.interactionCount < 10) {
ColdStartStrategy(api)
} else {
CFStrategy(api)
}
return strategy.getRecommendations(user.id, count = 20)
}
}
Почему Implicit Feedback выгоднее Explicit?
В большинстве мобильных приложений пользователи не ставят оценки. Implicit feedback — просмотры, клики, добавление в корзину, время просмотра карточки товара — гораздо информативнее, но требует правильного взвешивания: просмотр без клика ≠ интерес, клик без покупки ≠ удовлетворение.
Схема весов, которую используем на практике:
| Действие | Вес |
|---|---|
| Просмотр карточки > 3 сек | 1 |
| Клик «подробнее» | 3 |
| Добавление в избранное | 5 |
| Добавление в корзину | 7 |
| Покупка | 10 |
| Возврат | -5 |
CF с правильными весами даёт прирост CTR на 30–50% по сравнению с Content-Based при достаточном объёме данных. В одном из проектов для ритейлера одежды мы внедрили Implicit ALS с весами, приведёнными выше. Через 2 недели A/B теста CTR вырос на 40%, а конверсия в покупку — на 15%. Гарантируем, что при ваших данных результат будет не ниже.
Логирование событий на клиенте
Качество CF напрямую зависит от полноты и точности логирования:
// iOS: логирование взаимодействий с точностью до времени просмотра
class ProductInteractionTracker {
private var viewStartTime: Date?
private let analytics: AnalyticsService
func trackViewStart(productId: String) {
viewStartTime = Date()
}
func trackViewEnd(productId: String) {
guard let start = viewStartTime else { return }
let duration = Date().timeIntervalSince(start)
if duration > 3.0 {
analytics.log(InteractionEvent(
productId: productId,
type: .view,
weight: min(Int(duration / 3), 3),
timestamp: start
))
}
viewStartTime = nil
}
func trackAddToCart(productId: String) {
analytics.log(InteractionEvent(productId: productId, type: .addToCart, weight: 7))
}
}
Трекинг времени просмотра через viewStartTime позволяет различать случайные просмотры от реального интереса. Без этого сигнала матрица взаимодействий зашумляется.
Serving: FAISS для ANN-поиска эмбеддингов
Обученная модель экспортирует эмбеддинги товаров в FAISS-индекс. При запросе рекомендаций для пользователя: получаем его эмбеддинг → ищем K ближайших товаров в FAISS → фильтруем уже купленные → возвращаем список. Latency при 1M товаров — 5–15 мс на сервере.
Архитектура serving на FAISS
Индекс строится offline после обучения модели. Для инференса используется REST API (Ktor/Kotlin или Vapor/Swift). При каждом запросе пользователя его эмбеддинг вычисляется на лету или кэшируется. Поиск top-K выполняется через `IndexIVFFlat` с nprobe=10 для скорости. Результаты пост-обрабатываются: удаляются уже купленные товары, применяется бизнес-логика (например, разнообразие категорий).Что входит в работу
- Аудит данных: объём матрицы взаимодействий, спарсность, наличие cold start проблемы.
- Настройка event-логирования на клиентах iOS/Android с учётом App Store Review Guidelines и Google Play Console.
- Обучение модели (Implicit ALS или LightFM) на исторических данных.
- Разработка recommendation API + FAISS serving с использованием Ktor (Kotlin) или Vapor (Swift).
- A/B тест: CF-рекомендации vs популярные товары → измерение CTR и конверсии.
- Документация и обучение команды.
- Поддержка после запуска, мониторинг дрейфа данных.
Ориентиры по срокам
MVP с Implicit ALS + базовым serving — 2–3 недели. Полная система с event-логированием, cold start fallback, A/B тестированием и мониторингом — 6–8 недель. Стоимость рассчитывается индивидуально после аудита проекта. У нас более 10 лет опыта в мобильной разработке, и мы гарантируем прозрачный процесс с регулярными демо.
Поднимите конверсию рекомендаций — получите консультацию нашего инженера по настройке CF под ваши данные. Закажите аудит матрицы взаимодействий — мы оценим потенциал. Свяжитесь с нами для старта проекта.







