Zavod.devсоздан инженерами для инженеров
Решение

Edge-инференс нейросети на производстве

Запуск нейросети прямо на производственной линии — без передачи данных в облако и без задержек по сети — стал рабочей практикой для задач контроля качества, детектирования дефектов и предсказательного обслуживания. Edge-инференс позволяет получать результат за единицы миллисекунд и сохранять работоспособность при отсутствии интернета. Ключевое ограничение — вычислительные ресурсы встроенного узла, поэтому выбор аппаратной платформы определяет, какие модели можно запустить и с какой пропускной способностью.

Задача

Выполнять инференс обученной нейросети локально на оборудовании цеха: обрабатывать поток изображений или сенсорных данных, выдавать результат классификации или детектирования в реальном времени и при необходимости сигнализировать в SCADA или ПЛК.

Состав решения

Edge-вычислитель — основной узел, на котором развёртывается модель и среда исполнения. Принимает данные с камер или датчиков, возвращает предсказание. AI-ускоритель или NPU — специализированная матрица для матричных вычислений. Снимает нагрузку с CPU, обеспечивает нужный fps без перегрева при непрерывной работе. Может быть интегрирован в SoC или подключаться как отдельный модуль расширения. AI-модуль SoC — компактное решение, где процессор, NPU и память объединены на одной плате. Упрощает интеграцию в корпус с ограниченным пространством. Накопитель — хранит веса модели, логи инференса и буфер кадров. От скорости чтения зависит время первой загрузки и возможность ротации нескольких моделей без перезапуска.

Как собрать и на что обратить внимание

Начать с профилирования модели: замерить требуемый fps, размер входного тензора и допустимую латентность. Затем подобрать ускоритель с запасом по TOPS не менее 30 % от расчётного пика — производительность в реальных условиях ниже паспортной из-за пропускной способности шины и накладных расходов среды исполнения. Убедиться, что фреймворк (ONNX Runtime, TensorRT, OpenVINO) поддерживает целевое железо. Проверить тепловой пакет: в закрытом корпусе без принудительного охлаждения ускоритель может троттлить уже через несколько минут нагрузки.

Типовые ошибки

— Выбор платформы по пиковым TOPS без учёта поддержки нужных операторов нейросети: часть слоёв падает на CPU и сводит прирост к нулю. — Использование накопителя с низким IOPS: модель грузится секунды, а не миллисекунды, что критично при горячей замене весов. — Игнорирование версионности прошивки NPU: обновление драйвера может изменить поведение квантованной модели.

Оборудование в каталоге

Частые вопросы

Нужен ли отдельный ускоритель, если edge-вычислитель уже имеет встроенный NPU?

Зависит от нагрузки. Встроенный NPU достаточен для одной лёгкой модели. При параллельном инференсе нескольких сетей или обработке нескольких потоков видео внешний ускоритель снимает ограничение по пропускной способности.

Какой объём накопителя нужен для хранения моделей?

Квантованная модель для детектирования занимает от десятков до сотен мегабайт. Закладывайте место с расчётом на несколько версий весов и буфер логов — минимум кратный объём относительно одной модели.

Можно ли обновлять модель на работающем устройстве без остановки линии?

Да, если среда исполнения поддерживает горячую замену весов. Реализуется через загрузку новой версии в отдельный слот накопителя с последующим атомарным переключением — без прерывания потока инференса.