Реалізація бота з генерацією зображень (AI) у мобільному застосунку
Ми розробляємо ботів з генерацією зображень на мобільних платформах. Інтегруємо серверні рішення DALL-E 3, Stable Diffusion, Ideogram — підбираємо оптимальну модель під завдання вашого проєкту. Маємо 5 років досвіду в мобільній розробці та 20+ реалізованих AI-проєктів. Генерація зображень на мобільному — це завжди серверне завдання. Stable Diffusion на пристрої технічно можлива на сучасних iPhone (Core ML) і флагманських Android, але час генерації 30–60 секунд і перегрів роблять це непридатним для продакшн-застосунку. Тому ми працюємо через хмарні API, забезпечуючи стабільність і швидкість. Клієнти часто стикаються з проблемою вибору моделі: DALL-E 3 вимагає підписки, Stable Diffusion — складний у налаштуванні. Ми допомагаємо підібрати оптимальний варіант під конкретні завдання.
Як вибрати модель для генерації?
| Модель | Провайдер | Особливості |
|---|---|---|
| DALL-E 3 | OpenAI | Найкраще розуміння складних промптів, сувора модерація |
| Stable Diffusion | Replicate / Modal / Runpod | Гнучкість: LoRA, ControlNet, інпейнтинг |
| Ideogram | Ideogram AI | Хороша робота з текстом (логотипи) |
Згідно з документацією OpenAI, DALL-E 3 забезпечує найкраще розуміння складних промптів. DALL-E 3 добре розуміє складні текстові описи, строго слідує промпту. Якість висока, особливо для реалістичних сцен та ілюстрацій. Обмеження: не можна робити портрети реальних людей, сувора модерація. Stable Diffusion через Replicate / Modal / Runpod — open-source модель, що запускається на орендованих GPU. Величезна гнучкість: LoRA-адаптери для стилізації, ControlNet для контролю композиції, інпейнтинг. Моделі: SDXL, Flux.1, SD 3.5. Midjourney API — офіційного немає, тільки unofficial wrapper або Discord-інтеграція. Не рекомендуємо для продакшну через нестабільність. Ideogram / Recraft — хороша робота з текстом на зображеннях (логотипи, постери), у DALL-E і SD з цим традиційно проблеми.
Чому асинхронна генерація обов'язкова?
Генерація займає 3–15 секунд залежно від моделі та складності. Мобільний клієнт не може тримати HTTP-з'єднання відкритим — таймаут мережі або перемикання в фон перерве запит. Правильний паттерн: polling або WebSocket.
Polling
POST /generate → { "task_id": "abc123", "status": "queued" }
GET /tasks/abc123 → { "status": "processing", "progress": 40 }
GET /tasks/abc123 → { "status": "done", "image_url": "..." }
WebSocket / SSE: сервер пушить оновлення по мірі готовності. На Android — WorkManager для фонових запитів з polling, щоб генерація продовжувалася навіть якщо користувач згорнув застосунок. На iOS — URLSession background configuration.
// iOS: фонова завантаження результату
let config = URLSessionConfiguration.background(withIdentifier: "image.generation")
let session = URLSession(configuration: config, delegate: self, delegateQueue: nil)
func pollTaskStatus(taskId: String) {
var components = URLComponents(string: "\(baseURL)/tasks/\(taskId)")!
let task = session.dataTask(with: components.url!) { [weak self] data, _, _ in
guard let result = try? JSONDecoder().decode(GenerationTask.self, from: data!) else { return }
if result.status == "done" {
self?.downloadAndDisplay(url: result.imageUrl!)
} else {
DispatchQueue.main.asyncAfter(deadline: .now() + 2) {
self?.pollTaskStatus(taskId: taskId)
}
}
}
task.resume()
}
Як працює промпт-інжиніринг у мобільному боті?
Користувачі мобільного застосунку пишуть короткі запити: «намалюй кота», «логотип для кав'ярні». Це погані промпти для генерації. Бот повинен збагачувати їх перед відправкою в модель. Два підходи:
LLM-розширення промпта. GPT-4o mini бере користувацький запит і перетворює на розгорнутий промпт з деталями стилю, освітлення, настрою.
PROMPT_ENHANCER = """
Ти допомагаєш покращувати промпти для генерації зображень.
Візьми короткий опис і розшир його до детального промпта.
Додай стиль, освітлення, настрій. Відповідь тільки англійською —
це мова Stable Diffusion.
Максимум 200 слів.
"""
Параметричний UI. Користувач вибирає стиль (реалізм / аніме / олія / акварель) через кнопки, потім пише опис. Стиль додається до промпта програмно. Простіше, передбачуваніше.
Negative prompt і модерація
Для Stable Diffusion negative prompt знижує артефакти. Базовий: blurry, low quality, deformed, extra limbs, watermark. Для дитячих/сімейних застосунків додаємо фільтрацію контенту в negative prompt і safety checker на серверній стороні. Перед відправкою користувацького запиту — OpenAI Moderation API або власний фільтр. Відхилені запити логуються.
UI для генерації
Процес генерації має бути візуально цікавим, а не просто спіннером:
- Анімований placeholder у вигляді progressbar або shimmer ефекту
- Показ етапів: «Аналізую запит → Генерую → Обробляю»
- Після готовності — плавна поява зображення (fade in / reveal animation)
Результат: кнопки «Завантажити», «Поділитися», «Згенерувати ще», «Змінити промпт». Галерея попередніх генерацій в рамках сесії.
Варіації та редагування
DALL-E 3 підтримує inpainting — заміну частини зображення. Stable Diffusion через img2img дозволяє ітерувати по базовому зображенню. Для mobile UI це означає інструмент виділення області (маска) поверх зображення — аналог гумки.
Типові складності при інтеграції
- Вибір провайдера: не всі моделі доступні в регіоні
- Ліміти API та паралельні запити
- Кешування результатів для економії витрат
Процес роботи і що входить
- Аналіз і вибір моделі — підбираємо генеративне API під завдання та стиль застосунку.
- Проектування архітектури — серверна черга завдань, асинхронна генерація, зберігання результатів.
- Реалізація промпт-інжинірингу — LLM-розширення або параметричний UI.
- Розробка мобільного UI — анімація прогресу, галерея, інструменти редагування.
- Тестування і модерація — перевірка з реальними користувацькими запитами, налаштування фільтрів.
- Документація і навчання — передаємо вихідні коди, інструкції з експлуатації, навчаємо вашу команду.
Орієнтовні терміни: базовий бот з DALL-E 3 / Replicate API — від 1 тижня. З варіацією стилів, img2img, промпт-інжинірингом і галереєю — 3–4 тижні. Точні терміни та вартість розраховуємо індивідуально після аналізу вашого проєкту.
Зв'яжіться з нами для оцінки вашого проєкту. Замовте розробку під ключ — наші інженери гарантують стабільну роботу та дотримання App Store Review Guidelines / Google Play політик. Отримайте консультацію з інтеграції AI-генерації у ваш мобільний застосунок.







