NPU — нейросетевой процессор
NPU (нейропроцессор, Neural Processing Unit) — специализированная интегральная схема для аппаратного ускорения матричных и тензорных операций нейронных сетей. В отличие от CPU и GPU, NPU содержит фиксированные блоки умножения-накопления (MAC), ориентированные на операции свёртки и матричного перемножения. Нейросетевой ускоритель применяется в задачах, где необходим локальный инференс при жёстких ограничениях по потребляемой мощности и допустимой задержке.
Инженеры Zavod.dev · обновлено 20 июля 2026
Принцип работы
NPU загружает граф нейронной сети и выполняет послойное умножение тензоров через массив MAC-блоков. Данные подаются по конвейеру: пока один слой обрабатывается на умножительных блоках, следующая порция переносится из внешней памяти. Это снижает задержку относительно CPU. Производительность нейросетевого ускорителя выражается в TOPS (Trillion Operations Per Second) при заданной разрядности — INT8, FP16 или BF16.
Ключевые характеристики при выборе
- Производительность: TOPS при конкретной разрядности операций - Энергоэффективность: мВт на TOPS — критичный показатель для edge-инференса - Поддерживаемые форматы моделей (ONNX, TFLite) и наличие SDK-компилятора - Объём и пропускная способность локальной SRAM
Где применяется
NPU входит в состав AI-ускорителей и Edge AI модулей каталога Zavod.dev. Типовые задачи: промышленное техническое зрение для контроля качества на линии, предиктивное обслуживание оборудования, роботизированные манипуляторы, интеллектуальные датчики с локальной обработкой без передачи данных в облако.
Частые ошибки при подборе
Сравнение TOPS без учёта разрядности: INT8-TOPS и FP32-TOPS несопоставимы напрямую. Игнорирование пропускной способности памяти — узкое место по памяти нивелирует высокое пиковое значение TOPS. Недооценка требований SDK: NPU без компилятора под целевой фреймворк потребует значительной доработки перед применением.