Вы запустили YOLOv8 на Jetson Nano — и получили 5 FPS вместо ожидаемых 30. Типичная ситуация: модель без адаптации под edge-железо жрёт ресурсы впустую. Оптимизация через TensorRT даёт прирост 3-10x, а DeepStream выжимает максимум из видеопотока. Мы разворачивали CV-модели и LLM на Jetson AGX для промышленных роботов — расскажу, как это делаем.
Проблема не в самом железе: Jetson Orin — мощный edge-компьютер, но без правильной оптимизации вы упираетесь в bandwidth памяти и неэффективные kernel-вызовы. Например, YOLOv8n на PyTorch с FP32 потребляет 8 GB RAM и выдаёт 12 ms на кадр — при этом TensorRT с INT8 сокращает latency до 3 ms, а RAM падает до 2 GB. Результат: 30 FPS на той же камере.
Модельный ряд Jetson (актуальный)
| Модель | AI Performance | RAM | Применение |
|---|---|---|---|
| Orin Nano 4GB | 20 TOPS | 4 GB | Базовые edge AI задачи |
| Orin Nano 8GB | 40 TOPS | 8 GB | Computer vision, ROS |
| Orin NX 8GB | 70 TOPS | 8 GB | Multi-camera, inference server |
| Orin NX 16GB | 100 TOPS | 16 GB | Complex CV, LLM inference |
| Orin AGX | 275 TOPS | 64 GB | Autonomous vehicles, robots |
Как TensorRT ускоряет модели под Jetson?
TensorRT компилирует ONNX/PyTorch модели под конкретный Jetson GPU. Процесс конвертации:
- Экспорт в ONNX с фиксацией динамических осей (batch, height, width).
- Сборка engine через trtexec с выбором precision (FP16 по умолчанию, INT8 для максимума).
- Калибровка INT8 на репрезентативном датасете (минимум 500 изображений) для сохранения mAP.
- Интеграция через C++ API или Python bindings.
import tensorrt as trt # или через trtexec: # trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 Типичное ускорение: 3-10x vs. PyTorch. Для ResNet-50 на Orin AGX мы получили 7x, для YOLOv8 — 5x. Гарантируем p99 latency в рамках спецификации: например, YOLOv8 на Orin NX в INT8 — 12 ms на кадр.
DeepStream для видеоаналитики
NVIDIA DeepStream SDK — оптимизированный pipeline для multi-camera аналитики. GStreamer-based pipeline обеспечивает batch inference, scaling, tracker и вывод на RTSP или Kafka. Типичная производительность Orin AGX: 30+ Full HD камер с YOLOv8 детекцией. Настраиваем также первичную обработку (NvStreamMux, nvdrmvideosink) и интеграцию с ROS2.
Почему стоит выбирать Orin AGX для сложных задач?
Orin AGX даёт 275 TOPS и 64 GB RAM — этого хватает для запуска Llama 3 8B (4-bit) с context window 8192, RAG с ChromaDB и параллельного инференса 8 моделей CV. Сравнение с Orin Nano: AGX в 14x быстрее по FLOPS, но для простого детектора на 1 камере Nano — budget-решение. Наш опыт: для автономных роботов всегда берём AGX, для стационарного контроля — NX.
RAG на Jetson
Используем ollama или llama.cpp для инференса LLM, ChromaDB для векторного поиска — всё умещается в 16 GB Orin NX. Типичный pipeline: sentence-transformers для эмбеддингов 768-dim, faiss для индексации, langchain для цепочки вызова. Latency ответа: 500 ms на запрос с контекстом 2k токенов на Orin AGX.
ROS2 + Jetson
Robotics: ROS2 Humble нативно поддерживается на JetPack 5/6. Isaac ROS — NVIDIA оптимизированные ROS2 пакеты для computer vision. Мы интегрировали Isaac ROS с кастомным детектором — частота кадров 60 FPS на Orin NX для двух камер.
Что входит в работу
- Конвертация модели в TensorRT/ONNX Runtime
- Настройка DeepStream или Triton Inference Server
- Интеграция с периферией: камеры (GMSL/USB), сенсоры, GPIO
- Тестирование производительности: latency, throughput, power
- CI/CD pipeline для обновления модели
- Документация и обучение команды
- Гарантия на заданные метрики (p99, FPS)
Сроки ориентировочно: от 2 до 8 недель
Стоимость рассчитывается индивидуально — зависит от сложности модели, количества камер и требований к latency. Оценим ваш проект за 1 день. Получите консультацию — наши инженеры покажут кейсы и подберут оптимальное решение.
Наш опыт: 5 лет на рынке edge AI, 40+ проектов для промышленности и логистики. Сертифицированные инженеры NVIDIA — гарантируем результат.







