Практическая реализация генерации изображений на мобильных устройствах
Пользователь вводит промпт, нажимает «Сгенерировать» и видит спиннер 15 секунд. Затем — 404, если URL устарел. Или получает изображение с водяными знаками от демо-версии. Знакомо? Такие ошибки возникают, когда интеграция ограничивается простым вызовом API без учёта особенностей мобильного окружения: нестабильное соединение, ограниченная память, требования App Store к приватности. Мы решаем эти проблемы комплексно: от настройки параметров API до кэширования и UX. За 7 лет мобильной разработки мы реализовали более 50 проектов с интеграцией генеративных моделей — от стартапов до enterprise. Наш опыт охватывает iOS, Android и Flutter, включая работу с OpenAI, Replicate и локальными моделями через Core ML/TensorFlow Lite.
Как работает интеграция DALL-E 3?
Запрос к OpenAI API — один POST с моделью dall-e-3, промптом, разрешением и стилем. Ответ — URL изображения (живёт 60 минут) и revised_prompt. Но без продуманной архитектуры пользовательский опыт страдает: медленная загрузка, потеря результатов, непонимание процесса. Чтобы избежать этого, мы используем подход с декомпозицией: разделяем генерацию, загрузку и отображение, внедряя асинхронные очереди и обработку ошибок.
struct DALLERequest: Codable {
let model: String
let prompt: String
let n: Int
let size: String
let quality: String
let style: String
let responseFormat: String
enum CodingKeys: String, CodingKey {
case model, prompt, n, size, quality, style
case responseFormat = "response_format"
}
}
func generate(prompt: String) async throws -> URL {
let request = DALLERequest(
model: "dall-e-3",
prompt: prompt,
n: 1,
size: "1024x1024",
quality: "standard",
style: "vivid",
responseFormat: "url"
)
var urlRequest = URLRequest(url: URL(string: "https://api.openai.com/v1/images/generations")!)
urlRequest.httpMethod = "POST"
urlRequest.setValue("Bearer \(apiKey)", forHTTPHeaderField: "Authorization")
urlRequest.setValue("application/json", forHTTPHeaderField: "Content-Type")
urlRequest.httpBody = try JSONEncoder().encode(request)
let (data, _) = try await URLSession.shared.data(for: urlRequest)
let response = try JSONDecoder().decode(ImageGenerationResponse.self, from: data)
return URL(string: response.data[0].url)!
}
Параметры DALL-E 3:
| Параметр | Значения | Комментарий |
|---|---|---|
size |
1024x1024, 1792x1024, 1024x1792 |
Квадрат, ландшафт, портрет |
quality |
standard, hd |
hd детализированнее, но дольше |
style |
vivid, natural |
Яркий или фотореалистичный |
response_format |
url, b64_json |
url живёт 60 минут |
DALL-E 3 не поддерживает n > 1 — только одно изображение за запрос. Стоимость одного вызова невысока, что значительно дешевле аренды GPU для подобных задач. Для стартапов это означает существенную экономию на инфраструктуре.
Как выбрать параметры генерации для мобильного приложения?
Разработчику доступны следующие настройки: size, quality, style. Для портретного режима используйте 1024x1792 — это даёт вертикальное изображение 9:16. Если важна скорость, выбирайте standard; для презентабельных результатов — hd. Стиль vivid подходит для иллюстраций, natural — для фотореализма. Промпт дополняйте обёрткой с указанием стиля и запретом на текст — это повышает стабильность генерации.
Какой UX выбрать во время генерации?
5–15 секунд без фидбека — плохой UX. Наши решения:
- Animated placeholder — skeleton или анимированный градиент на месте будущего изображения.
- Псевдо-прогресс — показываем шаги: «Анализируем запрос → Генерируем → Финализируем».
- Prompt preview — отображаем
revised_prompt, который возвращает API. Пользователь видит, как модель поняла его запрос.
// revised_prompt приходит в ответе
let revisedPrompt = response.data[0].revisedPrompt
promptLabel.text = revisedPrompt
Такой подход снижает отток пользователей на этапе ожидания и даёт прозрачность процесса.
Почему кэширование критично для пользовательского опыта?
URL из OpenAI действителен 60 минут — потом 404. Загружаем и кэшируем на устройстве сразу после генерации.
// Android: загрузка и сохранение через Coil
suspend fun downloadAndCache(imageUrl: String, localKey: String): File {
val request = ImageRequest.Builder(context)
.data(imageUrl)
.diskCacheKey(localKey)
.build()
val result = imageLoader.execute(request)
return File(context.cacheDir, "dalle_${localKey}.jpg")
}
Для долгосрочного хранения — сохраняем в MediaStore (Android) или Photos (iOS) по запросу пользователя. Автосохранение без явного действия нарушает App Store guidelines. Кэширование также ускоряет повторный просмотр истории: изображение из кэша загружается мгновенно.
Prompt engineering для мобильного UI
Качество DALL-E 3 сильно зависит от промпта. Мы используем обёртку:
let enhancedPrompt = """
\(userPrompt)
Style: high quality, detailed, professional photography or illustration.
Avoid text, watermarks, blurry elements.
"""
DALL-E 3 сам переписывает промпт (revised_prompt), но задание стиля помогает избежать случайных вариаций. Content policy: отклонённые промпты (насилие, обнажёнка) возвращают 400 с code: content_policy_violation. Показываем пользователю понятное сообщение, а не технический код. Это повышает доверие и соответствует требованиям магазинов приложений.
Вариации и редактирование: что выбрать?
| Модель | Поддержка вариаций | Редактирование с маской | Скорость (1 изображение) |
|---|---|---|---|
| DALL-E 3 | Нет | Нет | 5–15 сек |
| DALL-E 2 | Да | Да | 10–20 сек |
| Stable Diffusion (Replicate) | Да | Да | 30–60 сек (локально быстрее) |
DALL-E 3 не поддерживает /v1/images/variations и /v1/images/edits. Для этих задач используем DALL-E 2 или Stable Diffusion (через Replicate/FAL). Выбираем инструмент под конкретную задачу.
Сравнение: DALL-E 3 генерирует изображение в 2–4 раза быстрее, чем локальный Stable Diffusion, что критично для мобильного UX. Стабильность API OpenAI и низкая стоимость делают его лучшим выбором для большинства проектов. Экономия на серверной инфраструктуре — весомый аргумент для стартапов.
Что входит в работу
- Документация по интеграции (API‑контракты, схемы кэширования).
- Доступ к демо‑проекту на Swift/Kotlin.
- Обучение команды работе с промптами и моделями.
- Поддержка на этапе публикации в App Store и Google Play.
Процесс интеграции
- Аналитика — изучаем требования и техническое задание.
- Прототипирование — быстрый MVP за 2–3 дня.
- Разработка — реализация на Swift/Kotlin с учётом best practices.
- Тестирование — проверка на реальных устройствах и сценариях.
- Деплой — публикация в App Store и Google Play.
Сроки: базовая интеграция занимает от 2 до 3 дней, полноценное решение с галереей и историей — 8–12 дней. Стоимость рассчитывается индивидуально. Свяжитесь с нами для оценки вашего проекта. Получите консультацию по интеграции DALL-E 3 в мобильное приложение.







