Реализация импорта товаров из файлов поставщика (CSV/Excel/XML/JSON)
Мы сталкиваемся с тем, что поставщики присылают прайс-листы в том формате, который удобен им: кто-то в Excel, кто-то в XML, кто-то в CSV с нестандартным разделителем. Мы решаем задачу построения универсального импорта товаров, работающего с любым форматом через единый интерфейс без отдельного кода под каждого поставщика. На одном проекте мы интегрировали прайсы от 15 разных поставщиков, каждый со своей структурой колонок. За смену обрабатывалось до 500 000 строк — ручная загрузка была невозможна. Решение — универсальный парсер с фабрикой и маппингом полей, который сократил время разработки на 60% и позволил подключать нового поставщика за 2 часа. Правильная архитектура импорта окупается уже на третьем поставщике.
Почему универсальный интерфейс парсера — ключ к масштабированию?
Единый интерфейс FileParserInterface позволяет подключать новые форматы без изменения логики импорта. Фабрика выбирает парсер по расширению или MIME-типу. Например, для CSV используем настраиваемый разделитель и кодировку, для XML — потоковый XMLReader, который в 10 раз экономит память по сравнению с SimpleXML. Добавление нового формата сводится к написанию одного класса и регистрации в фабрике.
interface FileParserInterface
{
/** @return iterable<array<string, mixed>> */
public function parse(string $filePath): iterable;
public function supports(string $mimeType, string $extension): bool;
}
class FileParserFactory
{
private array $parsers;
public function make(string $filePath): FileParserInterface
{
$ext = strtolower(pathinfo($filePath, PATHINFO_EXTENSION));
$mime = mime_content_type($filePath);
foreach ($this->parsers as $parser) {
if ($parser->supports($mime, $ext)) return $parser;
}
throw new \RuntimeException("No parser for: {$ext} / {$mime}");
}
}
Как обрабатывать CSV с нестандартными разделителями и кодировками?
CSV — самый непредсказуемый формат. Разделители: запятая, точка с запятой, табуляция. Кодировки: UTF-8 с BOM или без, Windows-1251. Наш парсер настраивается под каждый источник: автоматически детектим BOM, конвертируем Windows-1251 в UTF-8, а нестандартные разделители обрабатываются через настройки. Пример:
class CsvParser implements FileParserInterface
{
public function __construct(
private string $delimiter = ',',
private string $enclosure = '"',
private bool $hasHeader = true,
) {}
public function parse(string $filePath): iterable
{
$handle = fopen($filePath, 'r');
$bom = fread($handle, 3);
fclose($handle);
if ($bom === "\xEF\xBB\xBF") {
$filePath = $this->removeBom($filePath);
}
$handle = fopen($filePath, 'r');
$headers = $this->hasHeader ? fgetcsv($handle, 0, $this->delimiter, $this->enclosure) : null;
while ($row = fgetcsv($handle, 0, $this->delimiter, $this->enclosure)) {
if (!array_filter($row)) continue;
yield $headers ? array_combine($headers, $row) : $row;
}
fclose($handle);
}
public function supports(string $mimeType, string $extension): bool
{
return in_array($extension, ['csv', 'txt']) || str_contains($mimeType, 'csv');
}
}
Для файлов больше 10 МБ используем потоковое чтение, снижающее потребление памяти в 3–5 раз. Как отмечается в документации PhpSpreadsheet, чтение в потоковом режиме снижает потребление памяти до 70%. Excel-файл на 200 МБ с setReadDataOnly(true) обрабатывается за 40 секунд на типичном VPS.
Обработка больших Excel и XML файлов
Для Excel используем PhpSpreadsheet с опциями снижения памяти. Для XML — потоковый XMLReader. Сравнение:
| Парсер |
Потоковый? |
Потребление памяти |
Скорость |
Подходит для файлов >100 МБ |
| XMLReader |
Да |
Низкое |
Высокая |
Да |
| SimpleXML |
Нет |
Высокое |
Средняя |
Нет |
| JsonMachine |
Да |
Низкое |
Высокая |
Да |
| PhpSpreadsheet (по умолчанию) |
Нет |
Высокое |
Средняя |
Нет |
| PhpSpreadsheet (setReadDataOnly) |
Частично |
Среднее |
Средняя |
Да (до 500 МБ) |
Потоковый XML-парсер обрабатывает файлы в 10 раз быстрее, чем загрузка всего документа через SimpleXML. Это критично, когда поставщик присылает прайс на 1 миллион позиций. На тесте с файлом 500 МБ потоковый парсер обработал 1 млн записей за 90 секунд.
Обеспечение целостности данных
Каждая строка проходит валидацию перед записью в БД. Невалидные строки (нехватка обязательных полей, некорректный SKU) логируются и не прерывают импорт. Повторный импорт не создаёт дубликатов — используем upsert по ключу SKU. Для контроля целостности сохраняем хеш строки и дату последнего обновления.
Маппинг колонок устраняет рутину
Каждый поставщик использует свои названия колонок. Конфигурация маппинга хранится в БД и редактируется через админку:
{
"sku": "Артикул",
"name": "Наименование",
"price": "Цена руб.",
"qty": "Кол-во",
"description": "Описание",
"category": "Раздел"
}
Трансформатор применяет маппинг перед передачей в импортёр. Благодаря конфигурации в БД настройка нового поставщика занимает 30 минут вместо 4 часов. Поддерживаются разные маппинги для разных поставщиков.
Что входит в работу
- Разработка парсеров под все форматы (CSV, Excel, XML, JSON).
- Настройка маппинга колонок для каждого поставщика.
- Создание UI для управления маппингом и просмотра логов.
- Тестирование на реальных файлах (до 1 млн строк).
- Документация по архитектуре и добавлению новых форматов.
- Обучение операторов работе с админкой.
- Техническая поддержка на этапе интеграции.
Процесс внедрения
- Анализ форматов файлов поставщиков и требований к маппингу.
- Разработка базовых парсеров и pipeline импорта.
- Настройка маппинга и потоковой обработки.
- Интеграционное тестирование с выгрузкой поставщика.
- Деплой на боевой сервер и запуск в работу.
Сроки реализации
| Этап |
Срок |
| CSV + Excel парсеры, маппинг, базовый pipeline |
от 2 дней |
| XML (потоковый) + JSON + автодетект формата |
+1 день |
| Конфигурация в UI, кодировки, обработка ошибок |
+1 день |
Итого: от 3 до 4 дней на базовую интеграцию. Срок варьируется от количества форматов и сложности маппинга.
Свяжитесь с нами для оценки вашего проекта — мы подготовим коммерческое предложение за один день. Закажите внедрение универсального импорта и забудьте о ручной загрузке прайсов.
Разработка интернет-магазинов
Мы знаем: интернет-магазин — это не просто «сайт с корзиной». Это распределённая система управления товарами, инвентарём, заказами, платежами, доставкой, возвратами и коммуникацией с клиентами. Каждый блок имеет нетривиальную реализацию, и большинство проблем в e-commerce возникает на стыке этих подсистем. Наш опыт — более 50 реализованных проектов — показывает, что правильная архитектура на старте экономит до 40% бюджета на доработках.
Почему производительность каталога деградирует при росте SKU?
Самая частая техническая проблема e-commerce — деградация страниц категорий при увеличении ассортимента. Страница работает хорошо на 500 товарах и начинает тормозить на 10 000. Причины почти всегда одни и те же.
N+1 на атрибутах. Загружаете список товаров — 50 элементов. Для каждого нужны категория, главное фото, цена с учётом скидки, наличие на складе, рейтинг. Без правильного eager loading это 250+ запросов на страницу. В Laravel решается через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) и withAvg('reviews', 'rating'). Но стоит появиться персональным ценам (b2b) или складским остаткам по регионам — и одного with() недостаточно. Нужны Query Object или выделенный ReadModel.
Фасетная фильтрация без индексов. Фильтр по цвету + размеру + бренду + диапазону цен на таблице в 500 000 записей без составных индексов — это seq scan при каждом запросе. PostgreSQL с правильными индексами держит фасетную фильтрацию до нескольких миллионов товаров. Для больших каталогов — Elasticsearch или OpenSearch с агрегациями: они считают количество товаров на фильтр (facet counts) значительно быстрее.
Пагинация через OFFSET. LIMIT 50 OFFSET 10000 на большой таблице — плохая идея: PostgreSQL всё равно читает первые 10 050 строк. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 работает за константное время независимо от страницы. Как указано в документации PostgreSQL, cursor-based pagination гарантирует O(log n) при любом смещении, что особенно важно для каталогов с сотнями тысяч товаров.
Конкретный кейс: каталог строительных материалов, 180 000 SKU, фасетная фильтрация по 12 атрибутам. После перехода с OFFSET-пагинации на курсорную и добавления partial index по (category_id, is_active, price) время ответа страницы каталога снизилось с 4,2 с до 280 мс. Экономия на серверных ресурсах составила около 30 000 ₽ в месяц. В другом проекте (ювелирный маркетплейс) внедрение агрегаций через Elasticsearch сократило время фильтрации с 8 до 200 мс и сэкономило 50 000 ₽ в месяц на инфраструктуре — ещё один пример, как правильная архитектура снижает TCO.
Что такое race condition в корзине и как его избежать?
Checkout — место, где деньги либо попадают на счёт, либо нет. Технические проблемы здесь стоят дорого.
Race condition при резервировании товара. Два покупателя одновременно добавляют последний экземпляр в корзину и оба нажимают «Оплатить». Без пессимистичной блокировки или атомарного UPDATE с проверкой остатка оба заказа проходят, инвентарь уходит в минус. В PostgreSQL:
UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
AND (available - reserved) >= $quantity
RETURNING id;
Если RETURNING вернул 0 строк — товара нет, показываем ошибку до списания денег.
Идемпотентность платёжных вебхуков. payment.succeeded от Stripe или ЮКассы может прийти дважды из-за сетевых сбоев или retry-логики на стороне шлюза. Без проверки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублирование заказа или двойное зачисление. Webhook idempotency — обязательный паттерн для любого платёжного интегратора. Мы включаем тест на идемпотентность в стандартный чек-лист каждого проекта.
Checkout в несколько шагов. Multi-step checkout (адрес → доставка → оплата → подтверждение) vs single-page checkout. Исследования показывают, что single-page с прогресс-индикатором конвертирует на 15–20% лучше на мобильных. Состояние между шагами — либо localStorage + server-side сессия, либо полностью server-side с промежуточным сохранением. Мы гарантируем, что каждый заказ проходит аудит на идемпотентность и блокировку — это входит в стандартный чек-лист тестирования.
Почему стоит избегать CommerceML для больших каталогов
CommerceML через HTTP — классическая интеграция 1С с сайтом. 1С выгружает XML по расписанию, сайт импортирует. Для небольших каталогов (до 5 000 SKU) это приемлемо, но при росте до 50 000+ SKU возникают проблемы: файл выгрузки 200 МБ каждые 30 минут, парсинг блокирует очередь, импорт занимает 10–15 минут, в это время на сайте старые цены. Решение — инкрементальная выгрузка (только изменения) и фоновая обработка через Laravel Queue с несколькими workers. Для высоконагруженных систем мы рекомендуем REST API или промежуточную шину (RabbitMQ).
Интеграции: 1С, склад, доставка
1С — отдельная глава. Три распространённых способа интеграции:
-
CommerceML через HTTP — 1С выгружает XML по расписанию, сайт импортирует. Работает для небольших каталогов, есть задержка синхронизации.
-
REST API / OData от 1С — двусторонняя синхронизация в реальном времени. Требует настройки на стороне 1С, капризна к версиям конфигураций.
-
Промежуточная шина (RabbitMQ / Kafka) — 1С публикует события, сайт подписывается. Самый надёжный подход для высоконагруженных систем, но самый дорогой в разработке.
Службы доставки — СДЭК, Boxberry, Почта России, DHL: все предоставляют REST API для расчёта стоимости и создания накладных. Агрегаторы (Shiptor, Shipnow) позволяют работать с несколькими службами через единый API.
Платёжные шлюзы
| Шлюз |
Особенности интеграции |
| Stripe |
Webhook-based, отличная документация, Stripe Elements для PCI DSS |
| ЮКасса |
Популярен в РФ, поддержка ФЗ-54 (фискализация) |
| ЕРИП |
Белорусская система, SOAP API, специфическая документация |
| Tinkoff Acquiring |
REST API, 3D Secure 2.0, webhook-уведомления |
Для каждого шлюза обязательна проверка подписи вебхука — без этого любой может отправить фейковое payment.succeeded.
CMS vs собственная разработка
WooCommerce — оправдан для магазинов до ~5 000 SKU с типовой бизнес-логикой. Быстрый старт, огромная экосистема плагинов. Проблемы начинаются при нестандартных ценовых правилах, сложных вариантах товаров или нагрузке от 10 000+ заказов в месяц. Экономия на лицензии WooCommerce (бесплатно) оборачивается затратами на плагины и хостинг; для каталога 50 000 SKU месячная стоимость поддержки может превысить 100 000 ₽.
OpenCart, Prestashop — аналогичная история. Хороши для старта, ограничены при росте.
Собственная разработка на Laravel — для:
- Нестандартной бизнес-логики (подписки, аренда, b2b-прайсы, конфигуратор);
- Высоких требований к производительности;
- Сложных интеграций (несколько складов, ERP, маркетплейсы);
- Уникального UX checkout.
Как мы разрабатываем интернет-магазин: пошаговый процесс
-
Аналитика и проектирование. Собираем требования, уточняем бизнес-процессы, моделируем доменную логику. На выходе — техническое задание и архитектурная схема.
-
Backend и API. Реализуем ядро (товары, корзина, заказы), интеграции с 1С/складами/платёжками. Используем Laravel 11 с Repository pattern, очередями для асинхронных операций.
-
Frontend и checkout. Настраиваем React 18 / Next.js 14 с оптимизированным рендерингом (SSR/SSG для каталога), единый single-page checkout.
-
Тестирование. Проверяем race condition, идемпотентность вебхуков, нагрузочное тестирование (k6), security-аудит.
-
Деплой и мониторинг. Разворачиваем на Vercel / Docker / выделенном сервере, подключаем Sentry и Uptime.
SEO для e-commerce
Canonical и дублирование. Фасетная фильтрация генерирует тысячи URL (?color=red&size=M&sort=price). Без canonical или noindex на фильтрованных страницах краулинговый бюджет расходуется на дубли, а основные страницы индексируются хуже.
Structured data. Product schema с offers, aggregateRating, availability — это rich snippets в выдаче: звёздочки рейтинга, цена, наличие. Влияет на CTR.
Core Web Vitals на страницах товаров. Hero image товара — это LCP element. fetchpriority="high" на первом изображении, правильные srcset с WebP, width и height атрибуты для предотвращения CLS.
Что входит в результат работы
После завершения проекта вы получаете:
- Исходный код и полную документацию (API, архитектура, инфраструктура);
- Доступы к репозиторию, хостингу, мониторингу (Sentry, Uptime);
- Обучение команды работе с админ-панелью и кастомизациями;
- Гарантийную поддержку 3 месяца (исправление ошибок, консультации);
- Подробный отчёт по нагрузочному тестированию и оптимизации.
Ориентиры по срокам
| Тип магазина |
Срок |
| Малый (до 1 000 SKU, типовая логика) |
8–12 недель |
| Средний (до 50 000 SKU, интеграция 1С) |
14–20 недель |
| Крупный (100 000+ SKU, ERP, маркетплейсы) |
24–40 недель |
Стоимость рассчитывается после анализа требований: количество интеграций, сложность ценообразования, объём каталога и уникальность UX — основные факторы. Оценим ваш проект бесплатно — закажите консультацию.
Чек-лист перед запуском
- Race condition при оплате последнего товара — покрыт тестом
- Идемпотентность вебхуков платёжного шлюза
- Rate limiting на эндпоинтах корзины и checkout
- Canonical на фильтрованных страницах каталога
- Фискализация чеков (ФЗ-54 для РФ или аналог)
- Стресс-тест checkout под нагрузкой (k6 или Locust)
- Мониторинг ошибок (Sentry) и алерты на payment errors
- Backup базы данных с проверенным restore-процессом
Гарантируем — каждый проект проходит этот чек-лист перед релизом. Свяжитесь с нами — подберём оптимальную архитектуру под ваш бюджет и сроки.