Реалізація пакетної обробки файлів (Batch Processing) на сервері

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Реалізація пакетної обробки файлів (Batch Processing) на сервері
Складний
~3-5 днів
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1358
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    957
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1188
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    947

Ми регулярно стикаємося з ситуацією, коли клієнту потрібно імпортувати 50 000 рядків з CSV за розумний час, не обрушивши сервер. Без чіткої стратегії batch-обробки такі завдання призводять до OOM і нескінченних таймаутів. Наш досвід показує: правильна архітектура скорочує час обробки в 10 разів і виключає втрату даних. При цьому не має значення, чи працюєте ви з десятками або сотнями тисяч записів — паттерни залишаються тими ж.

Ключові проблеми batch-обробки

Пам'ять. Завантажувати весь CSV у масив — вірний шлях до вичерпання пам'яті. Правильний паттерн — потокове читання чанками. Ми використовуємо LazyCollection Laravel, який читає файл рядково без завантаження в пам'ять.

Часткові помилки. Якщо з 10 000 рядків 50 невалідні — зупиняти весь процес неправильно. Наша логіка: пропускаємо погані рядки, пишемо в лог з контекстом (наприклад, email помилкового запису), і продовжуємо.

Відтворюваність. Якщо процес впав на 7000-му рядку — ми не починаємо заново. Laravel Batch дозволяє продовжити з місця зупинки, зберігаючи вже оброблені чанки.

Паралелізм. Послідовна обробка 50 000 записів по 100 мс кожен займе майже 1,5 години. Розбивка на паралельні Job'и (оптимальний чанк — 500 записів) скорочує це до 5–10 хвилин на 4 воркерах.

Типова проблема Рішення в нашій практиці
OOM при завантаженні Потокове читання LazyCollection + чанки
Зупинка при першій помилці allowFailures() + логування контексту
Неможливість відновлення Збереження стану в job_batches
Повільна послідовна обробка Паралельні Job'и з чанками по 500

Як уникнути витоку пам'яті при імпорті великих CSV?

Ми застосовуємо паттерн «Batch → Chunks → Jobs». Після завантаження файлу майстер-завдання розбиває дані на чанки, кожен чанк обробляється окремим Job'ом паралельно. Після завершення всіх Job'ів запускається завдання агрегації результатів.

namespace App\Services;

use Illuminate\Bus\Batch;
use Illuminate\Support\Facades\Bus;
use Illuminate\Support\LazyCollection;

class CsvImportService
{
    private const CHUNK_SIZE = 500;

    public function startImport(string $filePath, int $importId): string
    {
        $jobs = [];

        LazyCollection::make(function () use ($filePath) {
            $handle = fopen($filePath, 'r');
            $header = fgetcsv($handle);
            while (($row = fgetcsv($handle)) !== false) {
                yield array_combine($header, $row);
            }
            fclose($handle);
        })
        ->chunk(self::CHUNK_SIZE)
        ->each(function ($chunk, $index) use (&$jobs, $importId) {
            $jobs[] = new ProcessCsvChunkJob(
                importId: $importId,
                chunkIndex: $index,
                rows: $chunk->values()->toArray()
            );
        });

        $batch = Bus::batch($jobs)
            ->name("csv-import-{$importId}")
            ->allowFailures()
            ->then(function (Batch $batch) use ($importId) {
                Import::find($importId)?->update(['status' => 'completed']);
                ImportCompletedEvent::dispatch($importId);
            })
            ->catch(function (Batch $batch, \Throwable $e) use ($importId) {
                Import::find($importId)?->update([
                    'status' => 'partially_failed',
                    'error_message' => $e->getMessage(),
                ]);
            })
            ->finally(function (Batch $batch) use ($importId) {
                $import = Import::find($importId);
                $import?->update([
                    'total_jobs' => $batch->totalJobs,
                    'failed_jobs' => $batch->failedJobs,
                    'finished_at' => now(),
                ]);
            })
            ->onQueue('batch-processing')
            ->dispatch();

        Import::find($importId)?->update(['batch_id' => $batch->id]);
        return $batch->id;
    }
}

Job обробки чанка

class ProcessCsvChunkJob implements ShouldQueue
{
    use Batchable, Dispatchable, InteractsWithQueue, Queueable, SerializesModels;

    public int $tries = 3;
    public int $timeout = 120;
    public int $backoff = 10;

    public function __construct(
        private int $importId,
        private int $chunkIndex,
        private array $rows
    ) {}

    public function handle(): void
    {
        if ($this->batch()?->cancelled()) {
            return;
        }

        $successCount = 0;
        $errors = [];

        foreach ($this->rows as $lineNum => $row) {
            try {
                $this->processRow($row);
                $successCount++;
            } catch (\Throwable $e) {
                $errors[] = [
                    'chunk' => $this->chunkIndex,
                    'line' => $lineNum,
                    'data' => array_slice($row, 0, 3),
                    'error' => $e->getMessage(),
                ];
            }
        }

        ImportChunkResult::create([
            'import_id' => $this->importId,
            'chunk_index' => $this->chunkIndex,
            'processed' => count($this->rows),
            'succeeded' => $successCount,
            'failed' => count($errors),
            'errors' => $errors,
        ]);

        Import::where('id', $this->importId)->increment('processed_rows', count($this->rows));
        Import::where('id', $this->importId)->increment('success_rows', $successCount);
    }

    private function processRow(array $row): void
    {
        $validated = validator($row, [
            'email' => 'required|email',
            'name' => 'required|string|max:255',
        ])->validate();

        User::updateOrCreate(
            ['email' => $validated['email']],
            ['name' => $validated['name']]
        );
    }
}

Що робити, якщо процес перервався?

Laravel Batch зберігає стан у таблиці job_batches. Завершені чанки позначені як виконані, незавершені відновлюються автоматично після перезапуску воркера. Для примусового рестарту можна запросити незавершені індекси з ImportChunkResult і повторно диспатчити Job'и.

Прогрес у реальному часі виводиться через endpoint:

public function progress(int $importId): JsonResponse
{
    $import = Import::findOrFail($importId);
    $batch = $import->batch_id ? Bus::findBatch($import->batch_id) : null;

    return response()->json([
        'status' => $import->status,
        'processed_rows' => $import->processed_rows,
        'success_rows' => $import->success_rows,
        'total_rows' => $import->total_rows,
        'percentage' => $import->total_rows > 0
            ? round($import->processed_rows / $import->total_rows * 100, 1)
            : 0,
        'batch' => $batch ? [
            'total_jobs' => $batch->totalJobs,
            'pending_jobs' => $batch->pendingJobs,
            'failed_jobs' => $batch->failedJobs,
            'progress' => $batch->progress(),
        ] : null,
    ]);
}

Обмеження навантаження

Для batch-черги потрібен окремий пул воркерів з обмеженим паралелізмом, щоб не забити всю БД або CPU:

[program:batch-worker]
command=php artisan queue:work --queue=batch-processing --max-jobs=50 --sleep=3 --timeout=120
numprocs=4
autostart=true
autorestart=true

numprocs=4 — чотири воркери, кожен обробляє чанки послідовно. --max-jobs=50 — після 50 завдань воркер перезапускається, звільняючи пам'ять.

Розмір чанка Час обробки 50 000 записів Ризик витоку пам'яті
100 ~20 хвилин Низький
500 ~10 хвилин Низький
1000 ~8 хвилин Середній
5000 ~6 хвилин Високий

Вибір 500 як оптимального компромісу між швидкістю та стабільністю.

Процес роботи

  1. Аналітика: вивчаємо формат файлів, об'єм даних, вимоги до швидкості.
  2. Проектування: обираємо розмір чанка, конфігуруємо черги.
  3. Реалізація: пишемо код з чанками, обробкою помилок, прогресом та відновленням.
  4. Тестування: проганяємо на тестових даних з емуляцією збоїв.
  5. Деплой: налаштовуємо воркери, моніторинг, передаємо документацію.

Що входить у реалізацію під ключ

  • Архітектура batch-обробки з чанками та паралельними Job'ами.
  • Endpoint прогресу та відновлення після збоїв.
  • Детальне логування помилок для аналізу.
  • Документація з розгортання та експлуатації.
  • Навчання команди роботі з системою.
  • Підтримка протягом місяця після запуску.

Строки та вартість

Базова реалізація імпорту CSV з чанками та прогресом — від 1 робочого дня. Додавання відновлення, детального логу та підтримки XLSX/JSON — ще від 1–2 днів. Вартість розраховується індивідуально — пишіть, ми оцінимо ваш проект. Більше 5 років ми займаємося веб-розробкою, реалізували понад 50 проектів з batch-обробкою — гарантуємо стабільність та масштабованість рішення.

Параметр Послідовна обробка Пакетна (наша реалізація)
50 000 записів ~1,5 години ~5–10 хвилин
Витоки пам'яті Імовірні при великому об'ємі Виключені (чанки по 500)
Обробка помилок Зупинка всього процесу Пропуск проблемних рядків
Відновлення Тільки з початку З місця зупинки

Чому Bus::batch()?

Laravel Bus::batch() надає вбудовану підтримку групових завдань: відстеження статусу, часткові помилки, ланцюжки колбеків. Це позбавляє від написання власного планувальника та знижує ризик помилок.

Отримайте консультацію — напишіть нам, і ми протягом дня підготуємо архітектуру для вашого сценарію. Замовте аудит вашого batch-процесу — ми знайдемо вузькі місця та запропонуємо оптимізацію.

Послуги бекенд-розробки: production-grade надійність

На production-сервері о 3:14 ночі черга Laravel Jobs перестала оброблятися — 40 000 необроблених завдань у Redis. Причина: worker упав через memory leak у статичній змінній Eloquent observer, supervisor не перезапустив через misconfigured stopwaitsecs. Ми розбирали такий інцидент на проекті з 500 RPS: діагностика 4 години, фікс — 20 хвилин. Щоб ви не втрачали гроші, пропонуємо послуги бекенд-розробки з акцентом на production-grade надійність — 10+ років досвіду, 50+ проектів, 5 років на ринку. Оцінимо ваш проект за 2 дні.

Які проблеми вирішуємо

N+1 запити: головний вбивця швидкості

N+1 — найпоширеніша причина повільних сторінок у Laravel-додатках. Стандартна історія: сторінка працювала нормально на dev з 10 записами, на production з 10 000 — 8-секундне завантаження.

Laravel Debugbar у dev-оточенні показує кількість запитів. Більше 20 — сигнал для audit.

Model::preventLazyLoading(! app()->isProduction());

Telescope для профілювання: логує всі запити, jobs, mail, notifications з деталізацією. Після впровадження eager loading час завантаження сторінки падає з 8 с до 0.3 с — у 27 разів.

Memory leak у статичних змінних

У Laravel Octane або Swoole додаток тримається в пам’яті між запитами. Статичні змінні не скидаються — призводять до неконтрольованого росту пам’яті. Використовуємо defer-функції та контейнерні біндинги для коректного скидання стану.

Неправильний connection pool

Rails, Laravel, Django відкривають нове з'єднання PostgreSQL на кожен PHP/Python процес. 100 воркерів — 100 з'єднань. PostgreSQL деградує від 200+ активних з'єднань через overhead на управління.

PgBouncer у transaction pooling: 1000 воркерів → 20–50 реальних з'єднань. Це знижує latency на 40% та зменшує витрати на хостинг на 30% — при середній вартості хостингу $2,000/міс економить $600/міс. GIN-індекс для JSONB до 100 разів швидший за B-tree при пошуку.

Як Octane справляється з високим навантаженням?

Laravel Octane (RoadRunner або Swoole) прибирає overhead bootstrap на кожен HTTP-запит. Приріст: 3–8x на синтетичних бенчмарках, 2–4x на реальних додатках. Важливо: не зберігати стан у статичних змінних — застосовуємо це на проектах >1000 RPS.

Як PostgreSQL допомагає уникнути повільних запитів?

Використовуємо composite indexes для WHERE + ORDER BY, partial indexes для фільтрів з високою селективністю, GIN-індекси для JSONB та full-text search. to_tsvector + GIN замість LIKE '%query%' — запобігає seq scan навіть на мільйонах записів. Аналізуємо плани через EXPLAIN ANALYZE та pg_stat_statements.

Як обрати стек для вашого проекту?

Стек Коли використовувати
Laravel + Octane CRUD, бізнес-логіка, REST/GraphQL API, адмінки
Node.js (Fastify) Realtime WebSocket, streaming, serverless, висока I/O concurrency
Go Високонавантажені мікросервіси (>10k RPS), gRPC, DevOps-інструменти
Django + DRF ML-пайплайни, інтеграція з AI, складна обробка даних
Ruby on Rails Швидкий MVP з багатим екосистемою гемів

Node.js виправданий для realtime: Laravel публікує події в Redis Pub/Sub, Node.js підписується та транслює клієнтам. Go — для goroutines (10k з'єднань на сервер — норма), але розробка повільніша, ніж Laravel.

Чому Redis критичний для продуктивності?

Redis виконує кілька ролей:

Роль Деталі
Кеш Кешування результатів важких запитів, фрагментів HTML
Черги Backend для Laravel Queue / Celery
Session store Distributed sessions в multi-instance оточенні
Pub/Sub Realtime події між сервісами
Rate limiting Sliding window counters для API throttling
Leaderboards Sorted Sets для рейтингів

Redis Cluster для горизонтального масштабування, Sentinel для автоматичного failover. Замовте консультацію щодо оптимізації Redis для вашого проекту.

Що входить в роботу під ключ

  • Архітектурне проектування (документація API, схема БД, діаграма сервісів)
  • Реалізація за узгодженим ТЗ з code review
  • Налаштування CI/CD (GitHub Actions, Docker), моніторингу (Sentry, Grafana), алертингу
  • Навантажувальне тестування (k6, wrk) зі звітом
  • Передача вихідних кодів, доступів, інструкція з деплою
  • Навчання команди замовника (2–3 сесії)
  • Гарантійна підтримка 1 місяць після здачі

Орієнтири по термінах

Задача Термін
REST API для мобільного/SPA (середня складність) 6–12 тижнів
Backend зі складною бізнес-логікою + інтеграції 12–20 тижнів
Високонавантажений сервіс на Go 8–16 тижнів
Міграція legacy PHP на Laravel 16–32 тижні

Вартість розраховується індивідуально після аналізу вимог до навантаження, інтеграцій та бізнес-логіки. Зв'яжіться з нами для безкоштовного аудиту вашого поточного backend — отримайте план оптимізації за 2 дні. Замовте консультацію та дізнайтеся, як знизити витрати на інфраструктуру на 30% без втрати продуктивності.