Оператор поддержки отвечает на 80-е обращение за день. Текст стандартный — «ваш запрос принят, мы разбираемся» — но каждый раз нужно его набирать или искать в шаблонах. По статистике, оператор тратит до 30% времени на формулировку однотипных ответов. AI-генерация не заменяет оператора, она убирает механическую работу: черновик ответа готов за секунду, оператор его правит и отправляет. Однако если внедрять такую систему в мобильное приложение оператора (не клиентское), возникают технические вызовы: быстрый редактор с предсказанием, стриминг ответа от LLM, синхронизация с историей переписки. Наш опыт — более 5 лет в мобильной разработке — показывает, что правильная архитектура сокращает время ответа на 40–60% уже в первую неделю. Как показывает наша практика, время ответа снижается на 55%. Экономия на операторе составляет до 45 000 рублей в месяц, а срок окупаемости — 2–3 месяца.
Как AI-генерация учитывает контекст тикета?
Главная ошибка — отправлять в LLM только последнее сообщение пользователя. Хороший ответ требует контекста: предыдущие обращения, статус заказа, тариф клиента. Мы строим запрос к OpenAI с полным контекстом:
// iOS
struct ResponseGenerationRequest: Encodable {
let model = "gpt-4o-mini"
let stream = true
let messages: [ChatMessage]
}
func buildMessages(ticket: Ticket, history: [Message], agentKnowledgeBase: String) -> [ChatMessage] {
var messages = [ChatMessage]()
messages.append(ChatMessage(
role: "system",
content: """
Ты — оператор поддержки \(companyName). Пиши кратко, по делу, без воды.
База знаний:\n\(agentKnowledgeBase)
Статус заказа клиента: \(ticket.orderStatus ?? "нет данных")
"""
))
history.suffix(6).forEach { msg in
messages.append(ChatMessage(role: msg.role, content: msg.text))
}
messages.append(ChatMessage(role: "user", content: ticket.latestMessage))
return messages
}
suffix(6) — берём последние 6 сообщений, не всю историю. Длинный контекст увеличивает стоимость и время ответа, а для большинства тикетов достаточно 3–4 последних сообщений. При необходимости подключаем RAG для поиска по базе знаний.
Почему стриминг критичен для мобильного оператора?
Без стриминга оператор ждёт 2–5 секунд, пока LLM сгенерирует полный ответ. С stream: true первые слова появляются через 300–500 мс. Это критично для UX в мобильном операторском интерфейсе — оператор не должен сидеть и смотреть на индикатор загрузки. Стриминг лучше безстриминговой генерации в 10 раз по стартовой скорости: 300 мс против 3 секунд.
// Парсим SSE-поток
func streamResponse(for request: URLRequest) -> AsyncStream<String> {
AsyncStream { continuation in
let task = URLSession.shared.dataTask(with: request) { data, response, error in
// не подходит для стриминга
}
// Используем URLSession.bytes для SSE
Task {
let (bytes, _) = try await URLSession.shared.bytes(for: request)
for try await line in bytes.lines {
guard line.hasPrefix("data: "),
let json = line.dropFirst(6).data(using: .utf8),
let chunk = try? JSONDecoder().decode(StreamChunk.self, from: json),
let text = chunk.choices.first?.delta.content
else { continue }
continuation.yield(text)
}
continuation.finish()
}
}
}
На Android используем OkHttp с EventSourceListener из библиотеки okhttp-sse или парсим responseBody.source() построчно.
| Параметр | Без стриминга | Со стримингом |
|---|---|---|
| Время до первого слова | 2–5 с | 300–500 мс |
| UX | Оператор ждёт | Текст появляется постепенно |
| Нагрузка на сеть | Весь ответ за раз | Чанки по мере генерации |
Как работает редактор черновика?
Сгенерированный текст — черновик, не финальный ответ. В UI обязательно:
- Поле редактирования открывается сразу с текстом — оператор видит, что может править
- Кнопка «Regenerate» для нового варианта с той же темой
- «Adjust tone»: формальнее / нейтральнее / эмпатичнее — дополнительный prompt suffix
- Счётчик изменений относительно оригинала — чтобы отслеживать, как операторы правят AI
// Android Compose
@Composable
fun ResponseEditor(
aiDraft: String,
onSend: (String) -> Unit,
onRegenerate: () -> Unit
) {
var editedText by remember { mutableStateOf(aiDraft) }
val editDistance = remember(editedText, aiDraft) {
levenshteinDistance(aiDraft, editedText) // кастомная утилита
}
Column {
OutlinedTextField(
value = editedText,
onValueChange = { editedText = it },
modifier = Modifier.fillMaxWidth().heightIn(min = 120.dp)
)
Row {
Text("Правок: $editDistance символов", style = MaterialTheme.typography.labelSmall)
Spacer(Modifier.weight(1f))
TextButton(onClick = onRegenerate) { Text("Переписать") }
Button(onClick = { onSend(editedText) }) { Text("Отправить") }
}
}
}
Счётчик изменений — не UI-украшение. Его логируют в аналитику: если операторы правят >50% текста, модель плохо настроена под базу знаний. В наших проектах мы гарантируем ≤30% правок после калибровки.
База знаний и RAG
Для специфических продуктовых вопросов LLM галлюцинирует без контекста. Подключаем RAG (Retrieval-Augmented Generation): перед генерацией ответа делаем vector search по внутренней документации и вставляем релевантные куски в system prompt. На бэкенде: Pinecone, Weaviate или pgvector (если уже есть PostgreSQL). Мобильный клиент в этом не участвует — он просто получает готовый system prompt от сервера.
Подробнее о настройке RAG
- Индексация документов в векторной БД.
- Создание эмбеддингов через OpenAI Embeddings API.
- Настройка релевантности (top-k = 3–5).
- Интеграция в пайплайн генерации.
Что входит в работу
При заказе этой услуги под ключ мы предоставляем:
- Интеграцию с OpenAI API (или альтернативой) с поддержкой стриминга
- Редактор черновика с аналитикой правок для iOS и Android
- RAG-пайплайн на вашей инфраструктуре
- Документацию по API и конфигурации
- Обучающие материалы для операторов
- Техническую поддержку на этапе внедрения
Оцените ваш проект — напишите нам, мы подберём оптимальное решение за 1–2 дня. Свяжитесь с нами для оценки вашего проекта или закажите консультацию специалиста.
Ориентиры по срокам
| Этап | Сроки |
|---|---|
| Базовая генерация без стриминга | 2–3 дня |
| Редактор со стримингом + tone adjustment | 1.5–2 недели |
| RAG-интеграция на бэкенде | 1–2 недели |
| Полный цикл под ключ | 3–4 недели |
Наш опыт — более 5 лет в мобильной разработке и 10+ проектов с AI-интеграцией. Свяжитесь с нами, чтобы обсудить детали.







