TTadnaLa conoscenza dietro ogni prodotto
Italiano
EspañolES EnglishEN FrançaisFR ItalianoIT DeutschDE PortuguêsPT
Tecnologia

NPU (Unità di elaborazione neurale): cos’è, come funziona e a cosa serve

Una NPU (Neural Processing Unit) è un componente hardware dedicato ad accelerare l'inferenza delle reti neurali e i carichi di lavoro di elaborazione avanzata. La sua presenza in un dispositivo indica che il produttore ha integrato un acceleratore specifico per i task di elaborazione avanzata, separandoli dalla CPU o dalla GPU generaliste.

Contenuto supportato da prove 3 fonti 15/09/2026

Definizione

Una NPU (Neural Processing Unit, unità di elaborazione neurale) è un blocco hardware progettato per eseguire in modo efficiente le operazioni matematiche proprie delle reti neurali, in particolare l'inferenza (predizione) di modelli di elaborazione avanzata. A differenza di una CPU o di una GPU, che sono processori generalisti, la NPU ottimizza la propria architettura per i pattern di calcolo ricorrenti nell'elaborazione avanzata, come le moltiplicazioni matriciali e le operazioni di convoluzione.

Principi di funzionamento

La NPU riduce il costo energetico e il tempo di risposta dei task di elaborazione avanzata:

  • Organizzando le unità di calcolo attorno alle operazioni di matrice (MAC, multiply-accumulate), nucleo delle couche dense e convolutive.
  • Includendo una memoria di lavoro locale per minimizzare gli accessi alla memoria principale durante l'inferenza.
  • Supportando formati di dati a bassa precisione (ad esempio INT8 o FP16) che riducono la banda passante e il consumo senza degradare significativamente la precisione del modello.

Architettura e posizione nel sistema

In un SoC (sistema su chip) moderno, la NPU coesiste con la CPU, la GPU e, in alcuni casi, un DSP. Il sistema operativo o il framework di elaborazione avanzata indirizza i carichi di lavoro verso l'acceleratore più adatto. La NPU non sostituisce gli altri processori; ne completa la funzione per i task in cui la sua topologia di calcolo è più efficiente.

Applicazioni tipiche

  • Riconoscimento e miglioramento dell'immagine in tempo reale (fotocamere di smartphone).
  • Assistenti vocali e elaborazione del linguaggio naturale sul dispositivo.
  • Segmentazione video, rilevamento di oggetti e stabilizzazione dell'immagine.
  • Inferenza di modelli di elaborazione avanzata leggeri direttamente sul terminale, senza dipendenza dal cloud.

Esempio concreto

Un esempio documentato è la MediaTek NPU 655, un acceleratore neurale integrato nella piattaforma mobile di MediaTek. La sua presenza nelle specifiche tecniche di un prodotto indica che il produttore ha dotato il chip di un blocco dedicato all'inferenza di elaborazione avanzata, differenziandolo dalle soluzioni che delegano tutti i task di elaborazione avanzata alla GPU o a server remoti.

Come interpretare la sua presenza in un prodotto

Quando si incontra un riferimento a una NPU nelle specifiche di un dispositivo, è opportuno considerare:

  1. Integrazione locale dell'elaborazione avanzata: il dispositivo può eseguire modelli di elaborazione avanzata offline, migliorando la privacy e riducendo la latenza.
  2. Consumo energetico: per carichi di elaborazione avanzata sostenuti, la NPU è tipicamente più efficiente della GPU, prolungando l'autonomia della batteria.
  3. Capacità limitata: la NPU è ottimizzata per modelli di dimensioni moderate; i task di addestramento o i modelli molto grandi richiedono ancora infrastruttura server.

Portata e limitazioni

La NPU non è un processore universale: le sue prestazioni dipendono dalla dimensione e dall'architettura del modello eseguito su di essa. Non sostituisce la CPU per la logica di controllo né la GPU per il rendering grafico. Inoltre, la compatibilità con framework di elaborazione avanzata specifici (TensorFlow Lite, ONNX Runtime, ecc.) varia in base al produttore del SoC e al supporto software fornito.

La NPU rappresenta la specializzazione dell'hardware per l'era dell'elaborazione avanzata al bordo: consente di risolvere localmente task che in precedenza richiedevano il cloud, con latenza e consumo ridotti.

Alias e denominazioni alternative

  • Unità di elaborazione neurale
  • Acceleratore neurale
  • elaborazione avanzata Engine / elaborazione avanzata Processor (a seconda del produttore)
  • Neural Engine (terminologia usata da alcuni produttori)