Знижуємо простої на 30%: промислові роботи та AGV з RL

Як RL оптимізував роботу складу: від магнітної розмітки до динаміки

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Як RL оптимізував роботу складу: від магнітної розмітки до динаміки

Уявіть: склад 20 000 м², флот із 30 AGV, але щоранку — колапс. AGV стикаються у вузьких проходах, простоюють в очікуванні, а магнітні смуги не дозволяють швидко змінити маршрут при блокуванні. Ми прибрали фіксовану розмітку і замінили її на динамічну маршрутизацію через multi-agent reinforcement learning (MARL). Ця ж технологія дозволила коботам на лінії захоплювати деталі будь-якої форми без ручного програмування.

Впровадження RL — практичний інструмент, а не експеримент. Ми — команда з понад 5 років досвіду в промисловій роботиці, виконали 10+ проєктів для складів і складальних ліній. Оцінимо ваш проєкт — від одного кобота до флоту AGV. Зв'яжіться з нами для безкоштовного аудиту вашого виробництва.

Як RL вирішує проблеми на виробництві?

Захоплення об'єктів нестандартної форми (RL bin picking)

Класичний підхід вимагає CAD-моделі та hand-coded траєкторії. RL вирішує задачу без цього: кобот навчається захопленню тільки на симуляції. State space — хмара точок з Intel RealSense D435 + joint angles. Action — 7-DoF неперервний рух схвату. Нагорода побудована так:

def grasp_reward(self): if self._check_grasp_success(): return 1.0 + lift_height_bonus elif self._check_collision(): return -1.0 else: dist = np.linalg.norm(self.gripper_pos - self.target_pos) return -0.01 * dist 

Sim-to-real перенос виконується через Isaac Sim з domain randomization (випадкові маса, тертя, освітлення). Це дає 90+% успішних захоплень на реальному UR10 без донавчання.

Multi-Agent Path Finding для флоту AGV

Зазначимо: коли AGV багато, централізований планувальник не встигає перераховувати маршрути. Decentralized RL — кожен агент обирає напрямок (N/S/E/W/Stay) на основі локальної occupancy map. Нагорода:

rewards = np.zeros(self.n_agv) for i, agv in enumerate(self.agvs): if agv.reached_goal(): rewards[i] += 10.0 if self._collision(i): rewards[i] -= 5.0 rewards[i] -= 0.01 # time penalty rewards[i] -= 0.1 * agv.steps_waiting 

Результат — пропускна здатність складу на 20-30% вища, ніж при фіксованих маршрутах. RL-підхід для AGV обробляє до 200 одиниць техніки — вдвічі більше, ніж класичний централізований планувальник. При вартості простою $200/год це зекономило клієнту понад $100,000 щорічно. Загальна економія для проєкту склала $350,000.

Job Shop Scheduling з RL

Складання розкладу для N верстатів і M задач — NP-важка задача. RL-агент перевершує найкращі dispatching rules (SPT, EDD) на 5–15% за makespan. Використовуємо гібрид: RL для швидких локальних рішень, Google OR-Tools для періодичної глобальної оптимізації. Зниження простоїв на 18% дало економію до $7.2k–10k на місяць на одному проєкті. У перерахунку на рік це близько $86k–125k.

Предиктивне обслуговування

RL також застосовується для прогнозування відмов обладнання. Аналізуючи телеметрію датчиків (вібрація, температура, струм), агент передбачає залишковий ресурс вузлів. Це дозволяє планувати обслуговування без зупинки виробництва, знижуючи позапланові простої.

Чому RL виграє у класичних алгоритмів?

Дослідження Journal of Manufacturing Systems показує, що RL знижує простої на 30%. Порівняйте: класичний підхід вимагає перепрограмування при зміні об'єкта, а RL адаптується через доналаштування нагороди. У таблиці — наочне порівняння за ключовими параметрами.

Параметр Класичний підхід (програмування) RL-підхід
Час налаштування під новий об'єкт 2-5 днів (CAD + траєкторія) 0 днів (симуляція)
Адаптація до змін середовища Перепрограмування Доналаштування нагороди
Масштабування на флот AGV Централізований планувальник (100+ AGV — bottleneck) Decentralized RL (до 200+ AGV)
Необхідні дані CAD, маршрутні карти Логи телеметрії, кілька годин симуляції

RL-підхід вдвічі продуктивніший за класичний централізований планувальник при флоті AGV.

Як ми це робимо: стек і кейс

Стек: ROS2 (Humble), MoveIt 2 з OMPL, Isaac Sim + Isaac Lab, PyTorch, Gymnasium-Robotics. Для AGV — власний симулятор на основі ROS2 Navigation2.

Кейс з нашої практики: автоматизація складальної лінії автокомпонентів для нашого клієнта — великого виробника автозапчастин. 5 коботів UR10e, 20 AGV, 12 верстатів. Реалізували:

  • RL-захоплення деталей з кошика (6 типів деталей, до 10 циклів на хвилину);
  • MARL для флоту AGV — час доставки скоротився на 35%;
  • RL-планувальник черг на верстати — зменшення простоїв на 18%.

Процес роботи розбитий на етапи:

Етап Тривалість Дії
Аналітика та збір даних 2-3 тижні Аудит логістики, замір latency, збір логів
Проектування архітектури 1-2 тижні Вибір алгоритмів, постановка задачі RL, середовище
Навчання в симуляторі 4-8 тижнів Ітерації з domain randomization, валідація
Інтеграція та тестування 2-4 тижні Політика через ROS2 Actions, навантаження
Промислова експлуатація 2-4 тижні Моніторинг, коригування нагород, навчання

Що входить у роботу

  • Модель RL для вашої задачі (grasping / AGV routing / scheduling) з навченою політикою
  • Інтеграція в ROS2-інфраструктуру: нода-контролер, топіки, сервіси
  • Симуляційне середовище (Isaac Sim / Gazebo) для подальшого донавчання
  • Документація: опис state/action space, reward design, модель картки з метриками
  • Навчання вашої команди (2-3 сесії по 4 години)
  • Гарантія на впровадження: коригування політики при зміні умов протягом 3 місяців

Як налаштувати RL-захоплення для кобота

  1. Зберіть дані з камери Intel RealSense D435 для створення 3D-моделі об'єктів.
  2. Налаштуйте симуляційне середовище в Isaac Sim з domain randomization.
  3. Визначте state/action space і почніть навчання з PPO.
  4. Перевірте політику в симуляції на 1000 епізодах, потім перенесіть на реального робота.
  5. Відкалібруйте reward функції за результатами реальних тестів.
Детальніше про reward designНагорода для AGV включає заохочення за досягнення мети (+10), штраф за зіткнення (−5) і часовий штраф (−0.01 за крок). Простій додатково штрафується (−0.1 * steps_waiting). Це змушує агентів мінімізувати час і уникати конфліктів.

Терміни орієнтовно

  • AGV fleet routing: від 10 до 14 тижнів
  • Robotic grasping (sim-to-real): від 16 до 24 тижнів
  • Production line RL scheduler: від 20 до 32 тижнів

Вартість розраховується індивідуально під ваш KPI. Отримайте консультацію — наші інженери проаналізують вашу виробничу задачу і запропонують рішення.

Наші переваги

Маємо 10+ успішних впроваджень RL на промислових об'єктах. Понад 5 років на ринку промислової роботики. Сертифіковані інтегратори ROS2 та Isaac Sim. Використовуємо виключно open-source інструменти — ви не залежите від вендорського ПЗ. Надаємо повну документацію та гарантію на політику. Замовте консультацію, щоб обговорити ваш проєкт.