AI PC:NPU,市场仍在寻找方向的标志

PC IA : le NPU, emblème d’un marché qui se cherche encore

Silicon.fr by Clément Bohic 2026-07-06 10:49 Original
摘要
AI PC市场仍处探索阶段,AMD、英特尔、高通围绕NPU算力(TOPS)展开竞争,以满足微软Copilot+ PC的40 TOPS门槛,但工具链散乱、批处理性能不佳等问题制约了普及。英伟达将于2026年秋季携RTX Spark入局,推动本地智能体发展,而各大PC厂商已陆续集成NPU加速的实时应用,生态正在缓慢成型。

即便AI PC概念已诞生近两年,在近期的Viva Tech行业展会上,仍有许多专业人士表示“不知道那是什么”,折射出市场依然处于摸索阶段。

自2023年CES上AMD发布Ryzen AI、微软2024年推出“Copilot+ PC”认证后,专用于神经网络计算、衡量标准为TOPS(每秒万亿次int8运算)的NPU(神经处理单元)成为焦点。该认证要求NPU至少达到40 TOPS,最初仅有高通的骁龙X系列符合条件,AMD和Intel随后携Strix Point与Lunar Lake-V平台跟进。

当前主流移动平台的NPU性能如下:AMD Ryzen AI 300系列为50 TOPS,Ryzen AI 400系列升至60 TOPS;Intel Core Ultra 200V(Lunar Lake-V)为45 TOPS,但其Arrow Lake系列NPU仅12~36 TOPS;高通骁龙X系列为45 TOPS,骁龙X2 Plus/Elite分别达到80和85 TOPS。

内存架构同样关键。为提升带宽,高通骁龙X全系、Intel Lunar Lake-V及AMD Strix Halo(但非Strix Point)采用了类似Apple Silicon的统一内存设计,将RAM封装在SoC上。典型理论带宽为:骁龙X约135 GB/s(LPDDR5X-8448),骁龙X2则达到152 GB/s(LPDDR5X-9523),最高端的X2 Elite Extreme通过192位总线可达228 GB/s;相比之下,苹果M5 Max已达614 GB/s。最大内存容量方面,AMD Ryzen AI 300/400支持256 GB,Intel Lunar Lake-V仅32 GB,高通从X Plus的32 GB到X2 Plus/Elite的128 GB不等。

编程生态高度碎片化:Intel提供OpenVINO工具套件及NPU预优化模型(Gemma、Llama-3.2、Phi等),并提供Linux驱动;AMD的Ryzen AI软件栈基于ONNX Runtime、Lemonade SDK与FastFlowLLM后端;高通则延续其DSP技术,推出QAIRT(高通AI运行时),支持C++到Neural Processing SDK的多层接口。微软尝试通过Foundry on Windows(前身为Copilot Runtime)统一本地AI体验,它提供约10个API、数十个可微调或直接使用的开放模型(以Phi、Qwen、DeepSeek为主),以及支持自动硬件选择的Windows ML推理框架。不过,NPU优化目前仍主要限于特定功能与模型,如微软的Phi Silica。

性能研究表明,NPU的优势在于矩阵-向量乘法、点积等计算模式固定的任务,以及低延迟的实时推理(如视频分类、语言解码),但在大矩阵乘法、批处理及不规则内存访问(如LSTM网络)中,GPU往往更具优势。最新的Hexagon NPU与Ada GPU对比显示,处理可变长度输入时NPU吞吐量下降41%,而GPU仅降12%;批处理大小增至16时,NPU吞吐量降至顺序处理的34%,GPU却能保持78%。文本生成实测(Ryzen AI 350)显示,1k上下文窗口下,LLaMA 3 1B可达64.5 tokens/s,而9B模型仅9.3 tokens/s;随着上下文窗口拉长,速度显著下降。

软件层面,NPU的能效优势使其被用于诸多可预测负载:诺顿用于音频深度伪造检测、Adobe Premiere Pro进行音频内容分类、Moises实现人声分离、CapCut完成字幕与背景移除等。微软的Windows Studio Effects也针对不同代NPU区分功能(背景模糊等基础效果仅需10 TOPS,高级滤镜则依赖Copilot+ PC)。各大PC厂商亦推出自有服务:宏碁利用NPU实现人体感应与自动锁屏,华硕的StoryCube图像生成工具则仍需GeForce RTX 4050以上独显;戴尔发布Pro AI Studio,提供兼容OpenAI的API及NPU优化模型;惠普的AI Companion在32 GB RAM的Copilot+ PC上可本地运行Phi 3.5模型;联想AI Now则要求至少16 GB VRAM的GPU。

英伟达预计于2026年秋季以RTX Spark芯片入局,集成Grace CPU与Blackwell GPU,无独立NPU,但凭借4-bit精度下1 petaflops的理论算力,瞄准本地“智能体式AI”。与此同时,微软正逐步弱化Copilot的独占地位,不仅开始将部分API开放给CPU/GPU,还允许企业通过策略卸载助手,并承诺让用户重新映射Copilot硬件按键。

种种迹象表明,NPU正在为AI PC铺设一条高能效、低延迟的路径,但其性能瓶颈、碎片化生态以及终端用户认知不足,意味着这场转型仍远未尘埃落定。

Summary
AMD, Intel, and Qualcomm are pushing NPU performance (up to 85 TOPS) to qualify for Microsoft’s Copilot+ PC label, but adoption is hampered by fragmented software toolkits and inconsistent memory architectures. Nvidia plans to enter the AI PC space in 2026 with its RTX Spark chip, potentially reshaping the market by bypassing dedicated NPUs in favor of a unified GPU-CPU design.

The AI PC market is still finding its footing, with the neural processing unit (NPU) at its core yet far from standardized. The concept gained momentum at CES 2023 with AMD’s Ryzen AI, then accelerated when Microsoft introduced the “Copilot+ PC” label in 2024, mandating a minimum of 40 TOPS (trillions of 8-bit integer operations per second). NPUs excel at the vector and matrix multiplications underpinning neural networks—more efficiently than GPUs, but less flexible and with far less mature software ecosystems.

The race to meet the 40 TOPS threshold has spawned a fragmented landscape. Qualcomm’s Snapdragon X initially led at 45 TOPS; its X2 generation now reaches 80 and 85 TOPS. AMD’s Ryzen AI 300 (Strix Point) delivers 50 TOPS, with the forthcoming Ryzen AI 400 (Gorgon Point) hitting 60 TOPS. Intel’s Core Ultra 200V (Lunar Lake-V) matches the 45 TOPS mark, while its other Arrow Lake variants remain at 12–36 TOPS. Beyond raw TOPS, unified memory architectures—placing RAM on the SoC and sharing it across processors—are critical for AI model execution. Qualcomm integrates unified memory across all Snapdragon X chips, reaching up to 135 GB/s bandwidth on the X series and 228 GB/s on the X2 Elite Extreme. AMD’s Strix Halo and Gorgon Halo use unified memory (up to 192 GB), but its mainstream Strix Point does not. Intel only bakes it into Lunar Lake-V, capping capacity at 32 GB. Apple’s M5 chips still command the bandwidth lead at up to 614 GB/s.

Software support remains highly siloed. Intel offers the OpenVINO toolkit with generative model extensions and a catalog of pre-optimized models; AMD relies on its Ryzen AI Software stack with the ONNX runtime, the Lemonade SDK, and the FastFlowLLM backend; Qualcomm’s Hexagon NPUs are programmed via the QAIRT toolkit, descending from its DSP heritage. Microsoft tries to unify the ecosystem with Foundry on Windows (formerly Copilot Runtime), providing local AI through APIs, a curated set of LLMs (including Phi Silica, which now also runs on GPU and CPU), and the Windows ML inference framework—though generative model support remains in preview.

Performance analyses underscore NPUs’ narrow sweet spot. A 2024 USC study showed NPUs outperform GPUs on matrix-vector products and small-scale sequential tasks like dot products and TinyLlama decoding, but GPUs dominate large matrix multiplications and batched workloads. A more recent 2026 comparison on a Hexagon NPU and Ada GPU found that while NPUs consume 60% less energy at constant throughput for fixed-length inputs, their throughput collapses by 41% when inputs vary in length, versus only a 12% drop for GPUs. Batching magnifies the penalty: at batch size 16, the NPU retains just 34% of its sequential throughput. Text generation speeds on a Ryzen AI 350 with 50% memory accessible to the NPU show, for instance, LLaMA 3 8B yielding 12.8 tokens per second at a 1k context window, falling to 8.5 tokens/s at 32k.

Software makers have gravitated toward predictable workloads. Norton uses NPUs for deepfake audio detection, Adobe Premiere Pro for audio categorization, and Capture One for facial retouching. Microsoft’s Windows Studio Effects offload real-time communication tasks like background blur and voice focus to the NPU. PC vendors add their own layers: Acer’s User Sensing leverages the NPU’s energy efficiency for continuous presence detection, while AI assistants from HP (the Copilot+ PC–exclusive AI Companion with local Phi 3.5) and Lenovo (AI Now, requiring a GPU) often mix NPU and cloud resources.

NVIDIA’s anticipated entry this autumn with the RTX Spark chip—a Grace CPU and Blackwell GPU on unified memory, no NPU, promising a petaflop of 4-bit local agentic AI—deepens the fragmentation. Meanwhile, Microsoft is subtly decentering Copilot: it has removed some Copilot entry points in Windows, provided a GPO to uninstall the assistant, and promised native key remapping. Foundry on Windows opens the door to non-Copilot+ PCs and third‑party models, signaling that the AI PC market, still groping for a coherent identity, may coalesce around multiple accelerators rather than a single NPU standard.

Résumé
Au salon Viva Tech, le marché des PC IA reste flou malgré la course aux NPU entre AMD (jusqu'à 60 TOPS), Intel (45 TOPS) et Qualcomm (jusqu'à 85 TOPS), qui misent aussi sur la mémoire unifiée. Microsoft tente de fédérer l'écosystème avec Foundry on Windows et assouplit sa stratégie Copilot, tandis que NVIDIA prépare son entrée avec la puce RTX Spark à l’automne 2026. Les éditeurs comme Adobe ou HP intègrent ces NPU pour des tâches ciblées, mais les performances variables et la fragmentation logicielle montrent un concept encore immature.

« PC IA ? Non, je ne sais pas ce que c’est. »

On l’aura – très – souvent entendu aux journées B2B du salon Viva Tech. Nous avions choisi l’événement pour « prendre la température » sur ce concept vieux comme ChatGPT ou presque.

Quelques semaines après le lancement du chatbot, le CES 2023 avait effectivement donné un premier élan. Par exemple avec l’annonce de Ryzen AI. Le mouvement s’était accéléré en 2024, lorsque Microsoft avait lancé le label « Copilot+ PC ». Pour en bénéficier, une machine doit, en particulier, embarquer un NPU suffisamment puissant.

AMD, Intel, Qualcomm : la bataille des TOPS

Les NPU (Neural Processing Units) sont des processeurs spécialisés dans les multiplications de vecteurs et de matrices, opérations fondamentales au sein des réseaux de neurones. Ils les traitent plus efficacement que les GPU, en contrepartie d’une moindre flexibilité et surtout d’un outillage encore bien moins mature.

Leurs performances sont traditionnellement communiquées en TOPS. C’est-à-dire en milliers de milliards d’opérations par seconde… en simple précision (entiers 8 bits), alors que les GPU travaillent généralement en virgule flottante. Le label « Copilot+ PC » impose un seuil à 40 TOPS. Au départ, seul Qualcomm l’atteignait, avec ses puces Snapdragon X. AMD et Intel s’aligneraient quelques mois plus tard avec, respectivement, Strix Point et Lunar Lake-V.

AMD à 60 TOPS avec les Ryzen AI 400

La famille Strix Point fut annoncée en juillet 2024. Elle comprend essentiellement la gamme Ryzen AI 300, destinée aux notebooks, avec un TDP de base de 28 W. AMD y a intégré la deuxième génération de ses NPU XDNA, basés sur la technologie de Xilinx (acquis en 2022). Il les annonce à 50 TOPS. Avec les Ryzen AI 400 (Gorgon Point, 28 W également), annoncés en janvier 2026, le seuil a été relevé à 60 TOPS.

© AMD

Intel à 45 TOPS avec les Core Ultra 200V

La famille Lunar Lake-V, lancée en septembre 2024, cible aussi les notebooks (17-30 W), sous la marque commerciale Core Ultra 200V. Intel y a intégré un NPU à 45 TOPS également fruit d’une acquisition (Movidius, 2016). C’est pour le moment une exception à son catalogue. Ses autres processeurs Core Ultra Série 2 en restent à :

12 TOPS NPU pour Arrow Lake-U (15 W)

13 TOPS NPU pour Arrow Lake-H (28-45 W)

13 à 36 TOPS NPU pour Arrow Lake-S (35-125 W)

© Intel

Qualcomm à 45 TOPS avec les Snapdragon X… et 85 avec les X2

Avec les Snapdragon X (Elite annoncés en octobre 2023, puis Plus en avril 2024), Qualcomm est aussi à 45 TOPS, pour des TDP de base entre 23 et 35 W. Depuis, il est passé à 80 avec les Snapdragon X2 Plus (janvier 2026) et 85 avec les X2 Elite (septembre 2025).

© Qualcomm

Récapitulatif sur les dernières générations de processeurs mobiles :

Plate-forme

Puissance NPU maximale

Ryzen AI 300

50 TOPS

Ryzen AI 400

60 TOPS

Core Ultra 200V

45 TOPS

Snapdragon X

45 TOPS

Snapdragon X2

85 TOPS

La mémoire unifiée, adoptée mais pas systématisée sur les PC IA

Au-delà de la puissance pure du NPU, l’exécution des modèles d’IA est tributaire de la quantité de mémoire. Mais aussi de sa bande passante. Pour accroître cette dernière, des architectures unifiées ont émergé : à l’instar de ce qui se fait sur Apple Silicon, la RAM est placée sur le SoC et partagée entre tous les processeurs. AMD l’a implémenté dans les puces Halo ; pas dans les Point. Intel ne l’a intégré que dans les Lunar Lake-V… en attendant peut-être Razor Lake, destiné à concurrencer les Halo.

En bande passante mémoire, Apple garde une longueur avec ses dernières puces (153 Go/s sur la M5 ; 307 Go/s sur la M5 Pro ; 614 Go/s sur la M5 Max). © Apple

Chez Qualcomm, tous les Snapdragon X ont de la mémoire unifiée. Au fil des générations, la bande passante théorique croît en conséquence de l’intégration de mémoire plus rapide. Les X Plus et Elite, avec leur LPDDR5X-8448, atteignent 135 Go/s sur le papier. La génération X2 passe à 152 Go/s avec sa LPDDR5X-9523. Les X2 Elite Extreme font même mieux (228 Go/s) grâce à un bus 192 bits.

En termes de capacité mémoire maximale, AMD a mis la barre à 128 Go sur Strix Halo, 192 Go sur Gorgon Halo et 256 Go sur Strix Point / Gorgon Point. Chez Intel, c’est 32 Go pour Lunar Lake-V et 96 Go sur les Arrow Lake. Qualcomm est à 32 Go pour le X Plus, 64 Go pour le X Elite et 128 Go pour les autres.

Pour l’ensemble de ces plates-formes, la quantité de mémoire exploitable en tant que VRAM varie en fonction des BIOS et des systèmes d’exploitation.

Récapitulatif :

Plate-forme

Capacité mémoire maximale

Ryzen AI 300 / 400

256 Go

Lunar Lake-V

32 Go

Snapdragon X / X2

32 Go (X Plus)

64 Go (X Elite)

128 Go (X2 Plus et Elite)

OpenVINO, Ryzen AI, QAIRT… Autant de toolkits que de NPU

Ce qui varie aussi beaucoup, c’est le modèle de programmation des différents NPU : à chacun sa boîte à outils, là ou « GPU » est largement synonyme de « CUDA ».

Chez Intel, les NPU sont inclus aux côtés des CPU, des GPU et des FPGA dans le toolkit OpenVINO. Celui-ci a été doté d’extensions spécifiques aux modèles génératifs (quantification, encapsulation du cache clé-valeur, exécution spéculative…). Intel lui a adjoint un catalogue de modèles prêts à l’emploi sur ses NPU. On y trouve du ML classique (MobileNet pour détecter des objets, AlexNet pour classer des images…) et des LLM (généralement moins de 10B : Gemma 7B, Llama-3.2-1B, Phi 2…). En plus de la compatibilité Windows, un pilote Linux est disponible à partir du noyau 6.6.

Chez AMD, la pile Ryzen AI Software (pour Windows et Linux) s’appuie sur le runtime ONNX, là aussi doté d’extensions GenAI. Le SDK Lemonade offre une couche d’abstraction, avec une API Python et une interface serveur (API REST). À plus bas niveau, il y a une API C++ qui permet notamment l’exécution hybride des modèles génératifs (utilisation du NPU pour la phase de préremplissage et du GPU pour le décodage). AMD a également un catalogue de modèles prêts à l’emploi. Certains optimisés pour la longueur de contexte (fenêtre de 16k), d’autres pour la performance (en échange d’une fenêtre réduite à 4k). Au serveur Lemonade peut se greffer un back-end spécifique aux NPU XDNA : FastFlowLLM. Il gère Linux depuis peu.

© AMD

Qualcomm développe ses NPU sous la marque Hexagon, qu’il utilisait déjà depuis 2007 pour ses DSP (processeurs de traitement des signaux). Un choix pas anodin : pour lui, les premiers descendent des seconds. C’est simplement « l’architecture qui a changé » (fusion des unités de calcul scalaire, vectoriel et matriciel, avec mémoire partagée). Le toolkit pour les programmer s’appelle QAIRT (Qualcomm AI Runtime). Il comprend, au plus bas niveau de la pile, des interfaces C et C++. Au plus haut niveau, un SDK Neural Processing. Entre les deux, un autre SDK, plus granulaire avec par exemple des bibliothèques par accélérateur, mais qui abstrait des éléments comme le partitionnement réseau. Une passerelle avec Amazon SageMaker existe pour le fine-tuning avant déploiement local.

Foundry on Windows, promesse d’un socle commun pour l’IA locale

Microsoft tente d’unifier les choses avec Foundry on Windows (ex-Copilot Runtime). Sous cette bannière, il pousse trois options pour l’IA locale* : des API, des LLM prêts à l’emploi et le framework d’inférence Windows ML.

Les API – une dizaine – permettent la reconnaissance vocale, l’OCR, le traitement d’images (description, segmentation, upscaling…) et l’accès au LLM Phi Silica de Microsoft – avec des optimisations pour les NPU, comme la compression des requêtes. Principalement réservées aux Copilot+ PC, elles ont d’abord ciblé exclusivement les NPU. Elle commencent à s’ouvrir aux CPU (speech-to-text et upscaling vidéo) et aux GPU (Phi Silica). Les modèles correspondants sont téléchargés à l’exécution et ensuite partagés entre les applications. Lesquelles ne sont, par ailleurs, pas obligées de packager de runtimes ou de pilotes.

La deuxième option, dite Foundry Local, permet de surentraîner Phi Silica avec la méthode LoRA. Elle donne aussi accès, y compris sur les PC Windows 10, à quelques dizaines de LLM ouverts (pesant de 100 Mo à environ 10 Go) préoptimisés. Seuls quelques-uns le sont pour les NPU. Il s’agit essentiellement de modèles Phi (3 Mini, 4 Mini, 4), Qwen (Coder, Instruct) et DeepSeek (R1-Distill-Qwen-7B). Les autres s’exécutent sur (Web)GPU et éventuellement sur CPU (Ministral, Nemotron, Olmo…).

Windows ML est une distribution du runtime ONNX. Succédant à l’API DirectML, il automatise la sélection de la puce adéquate pour l’inférence, la récupération des fournisseurs d’exécution (abstractions des back-ends) et le maintien à jour de l’ensemble via Windows Update. L’exécution des modèles génératifs y est officiellement encore en preview.

Forces et faiblesses des NPU

En 2024, peu après le lancement des premiers Copilot+ PC, une étude de l’université de Californie du Sud sur un SoC Intel avait mis en lumière les points forts et les points faibles des NPU. Elle les avait comparés aux CPU et aux GPU sur deux disciplines. D’un côté, l’algèbre linéaire (produit matriciel, produit scalaire et produit matrice-vecteur). De l’autre, les réseaux de neurones, avec classification de vidéos (MobileNetV2), analyse de séries chronologiques (réseau LTSM non spécifié) et traitement du langage naturel (TinyLlama).

L’accès direct à la mémoire a des avantages…

L’accès direct à la mémoire a donné au NPU une belle longueur d’avance dans le calcul des produits matrice-vecteur, la réutilisation de données étant minimale. Même situation pour les produits scalaires, a fortiori vu le poids de la synchronisation finale.

© Rakshith Jayanth, Neelesh Gupta, Viktor Prasanna

En revanche, sur les produits matriciels, le GPU a pris l’avantage au-delà d’une certaine taille de matrice, l’opération devenant de plus en plus dépendante de la capacité de calcul.

© Jayant et al.

… et des inconvénients

Pour la classification vidéo, en précision simple ou double (INT8 ou FP16), le NPU a l’avantage lorsqu’on est sur du traitement séquentiel. Par lots, le rapport s’inverse à partir d’un batch size de 8.

Avec le LTSM, le GPU est nettement meilleur. L’irrégularité des accès mémoire handicape le NPU, qui doit rafraîchir à chaque fois son mapping DMA.

© Jayanth et al.

Le NPU reprend l’avantage avec TinyLlama. Il n’est pas à son aise sur la phase de préremplissage, dominée par des multiplications matricielles. Mais le gros des opérations se trouve sur la phase de décodage, quant à elle riche en produits matrice-vecteur.

Les NPU, pas fans du traitement par lots

Le problème des accès mémoire irréguliers se retrouve dans un comparatif plus récent (juin 2026). Support de test : un système embarqué avec NPU Hexagon et GPU Ada. On y a fait tourner Qwen-2.5-7B et Llama-3-8B (ainsi qu’une variante 3B distillée).

Tant qu’on traite des inputs fixes, le NPU est plus performant. Ou plus économique, selon le point de vue (- 60 % d’énergie par rapport au GPU à débit égal). Les choses changent quand on passe sur des entrées de longueur variable (32 à 2048). En INT8, la performance du GPU baisse de 12 %… contre 41 % pour le NPU. Un effet accentué quand on ajoute l’aspect traitement par lots : avec un batch size de 16, le GPU conserve 78 % de son débit séquentiel, tandis que le NPU tombe à 34 %. La faute notamment à une mauvaise gestion du padding : face à des tenseurs hétérogènes, l’exécution passe en séquentiel, avec reconfiguration interne entre les requêtes.

Génération de texte sur NPU : combien de tokens par seconde ?

FastFlowLLM a fait ses propres mesures, en génération de texte, sur une APU Ryzen AI 350 à 32 Go de RAM. Les fenêtres de contexte ont été limitées par le fait que le NPU ne pouvait pas accéder à plus de 50 % de la mémoire système. On rappellera qu’un token = ¾ de mot, d’après le décompte d’OpenAI.

Les résultats sur la phase de décodage :

Modèle

Débit maximal (fenêtre de contexte)

Débit minimal (fenêtre de contexte)

LLaMA 3 1B

64,5 tokens/seconde

(1k)

13,6 tokens/seconde

(128k)

LLaMA 3 3B

26,3 tokens/seconde

(1k)

9 tokens/seconde

(64k)

LLaMA 3 8B

12,8 tokens/seconde

(1k)

8,5 tokens/seconde

(32k)

Gemma 4 E2B

22,6 tokens/seconde

(1k)

10,1 tokens/seconde

(32k)

Gemma 4 E4B

12,6 tokens/seconde

(1k)

9 tokens/seconde

(32k)

Qwen-3.5-0.8B

39,2 tokens/seconde

(1k)

21,6 tokens/seconde

(32k)

Qwen-3.5-2B

26,8 tokens/seconde

(1k)

17 tokens/seconde

(32k)

Qwen-3.5-4B

15 tokens/seconde

(1k)

9,6 tokens/seconde

(32k)

Qwen-3.5-9B

9,3 tokens/seconde

(1k)

6,9 tokens/seconde

(32k)

gpt-oss-20b

18,2 tokens/seconde

(1k)

5,7 tokens/seconde

(128k)

Phi-4-mini

21,8 tokens/seconde

(1k)

11,2 tokens/seconde

(32k)

Audio, graphisme, cybersécurité, accessibilité… Les logiciels s’emparent des NPU

Tous ces résultats en témoignent : avec leur pipeline plus rigide que celui des GPU, les NPU se prêtent avant tout aux charges de travail dont les patterns sont prévisibles. Les éditeurs de logiciels ont œuvré dans ce sens. Par exemple :

Norton pour la détection des deepfakes audio

Adobe pour la catégorisation des contenus audio dans Premiere Pro

© Adobe

Moises pour la séparation de voix et d’instruments

© Moises

CapCut pour le sous-titrage, la synthèse vocale et la suppression d’arrière-plan

Blender pour un plug-in de conversion 2D <-> 3D

Capture One pour le détourage, la retouche de visage et l’étalonnage des couleurs

Cephable pour ses technologies d’assistance (contrôle vocal et gestuel)

Microsoft a suivi la même logique, en se concentrant sur des tâches « temps réel », sensibles à la latence. Tout particulièrement pour la communication (« effets Windows Studio »). Certaines fonctionnalités sont réservées aux Copilot+ PC (flou de portrait, focus vocal, filtres créatifs…). D’autres sont disponibles avec les NPU de la « génération 10 TOPS » (floutage d’arrière-plan, cadrage automatique, correction du regard…).

© Microsoft

Les fabricants de PC IA intègrent leurs propres services – parfois à base de NPU

Les principaux fabricants de PC ont leur propre déclinaison de ces fonctionnalités. Illustration chez Acer, qui les propose sous les marques Purified View et Purified Voice. Il tire aussi parti de l’efficacité énergétique des NPU pour effectuer une tâche continue en arrière-plan : la détection de présence (User Sensing). Avec trois usages : verrouiller/déverrouiller automatiquement le PC, rappeler à l’utilisateur de prendre une pause après un certain temps passé devant l’écran et l’avertir s’il n’est pas à bonne distance.

© Acer

Le catalogue « IA locale » d’Acer inclut aussi de la création d’images et un assistant généraliste à base de LLM. Mais ces fonctionnalités exigent un GPU.

© Acer

ASUS a opéré une segmentation similaire. Des fonctionnalités comme la suppression de bruit, la luminosité adaptative se contentent du NPU. Alors que StoryCube (gestion multimédia) et MuseTree (génération d’images) nécessitent au minimum une carte GeForce RTX 4050.

© ASUS

Des studios de développement…

Sur son microsite dédié aux PC IA, ASUS communique d’ailleurs les TOPS GPU en plus de ceux du NPU. Il met aussi en avant son toolkit d’inférence AI SuperBuild, développé avec Intel et validé sur ses NUC. Permettant de convertir, de déployer et d’évaluer des modèles, il inclut la gestion de bases de connaissances et une marketplace de serveurs MCP.

© ASUS

Dell a aussi son toolkit : Dell Pro AI Studio. Il expose des API compatibles OpenAI et donne accès à un catalogue de modèles optimisés. Certains pour les GPU (Devstral Small, Gemma 3, Granite 4…), d’autres pour les NPU (CLIP, Whisper, Phi 4…). S’y ajoignent deux guides de référence pour développer sur NPU. L’un traite de la recherche vocale d’images avec CLIP et Whisper. L’autre, du RAG avec LLaMA, LangChain, Chroma et Nomic.

© Dell

… et des « ChatGPT locaux »

Pas de tel attirail chez HP. Mais, pour l’utilisateur final, un service référent : AI Companion. Il réunit trois briques : chatbot à usage général, gestion de connaissances et optimiseur de performance (accompagné d’une assistance à l’ajustement des paramètres et au dépannage). Réservé aux Copilot+ PC, il a un mode cloud (GPT-4o) et un mode local (Phi 3.5) qui nécessite 32 Go de RAM.

© HP

Depuis cette année se diffuse, sous la marque HP IQ, une approche moins liée aux Copilot+ PC. Elle reprend l’aspect chatbot et analyse de fichiers, y ajoutant une composante de prise de notes, une « mémoire organisée » fondée sur l’historique des interactions… et plus globalement une forme d’orchestration. Celle-ci se manifeste en une UI censée faire remonter les « actions et contrôles pertinents », avec gpt-oss-20b en back-office.

© HP

Chez Lenovo, le « compagnon IA » s’appelle AI Now. Reposant sur LLaMA 3 pour la partie locale, il nécessite un GPU (intégré avec 24 Go de VRAM ou dédié avec 16 Go). Il reprend le triptyque chat / base de connaissances / paramétrage du PC. Plusieurs services IA plus « spécialisés » en dépendent. Par exemple Learning Zone (aide à l’apprentissage : transcription, synthèse, création de quiz…).

© Lenovo

NVIDIA, un quatrième larron attendu à l’automne dans les PC IA

Le serveur d’inférence Llama.cpp gère depuis peu les NPU Intel à travers le back-end OpenVINO. La prise en charge des NPU de Qualcomm reste expérimentale. Elle est au contraire effective sur AnythingLLM, à commencer par le modèle d’embedding utilisé par défaut.

NVIDIA travaille avec llama.cpp pour activer des optimisations spécifiques de type décodage spéculatif (prédiction multitoken)… en vue de son arrivée sur le segment des PC IA. Ce devrait être à l’automne 2026, avec la puce RTX Spark. Issue d’une collaboration avec MediaTek, elle associe CPU Grace, GPU Blackwell RTX et mémoire unifiée (jusqu’à 128 Go). Pas de NPU à proprement parler, donc. Ce mouvement fait écho à celui d’Apple, qui, pour ses puces M5, a intégré un accélérateur neuronal dans chaque cœur GPU.

© NVIDIA

Revendiquant une puissance théorique d’un pétaflops (en précision 4 bits), NVIDIA promet une « IA agentique locale ». Dans cette optique, il a associé des primitives de sécurité à son runtime OpenShell. Et étendu la disponibilité de son blueprint NemoClaw.

Copilot, mais pas que : Microsoft décentre (un peu) sa vision

L’évolution de Copilot Runtime vers Foundry on Windows marque une certaine ouverture, à la fois à d’autres machines que les Copilot+ PC et à d’autres services IA que ceux de Microsoft.

Ce dernier a même commencé à supprimer, sur Windows, des points d’entrée vers Copilot (bloc-notes et outil de capture d’écran, par exemple). Et fourni aux entreprises une GPO pour désinstaller l’assistant.

Il a aussi promis une mise à jour qui permettra de remapper la touche Copilot sans avoir à passer par des outils tiers comme PowerToys ou AutoHotKey.

* Microsoft pousse aussi, avec Intel, l’API WebNN. Elle utilise ONNX Runtime Web ou LiteRT.js. Configuration minimale : un processeur Core de 11e génération (Tiger Lake) et 8 Go de mémoire.

Illustration principale générée par IA

The post PC IA : le NPU, emblème d’un marché qui se cherche encore appeared first on Silicon.fr.

AI Insight
Core Point

AI PC 仍处市场探索期,NPU 虽成标配但生态碎片化、开发者工具链割裂,微软的 Copilot+ PC 标签尚未统一体验。

Key Players
  • AMD — x86 处理器厂商, 美国; 推出 Ryzen AI 300/400 系列, NPU 达 60 TOPS.
  • Intel — x86 处理器厂商, 美国; Core Ultra 200V 集成 45 TOPS NPU, 借 Movidius 技术入场.
  • Qualcomm — Arm 架构 PC 芯片厂商, 美国; Snapdragon X 系列 NPU 达 45 TOPS, X2 升至 85 TOPS.
  • Microsoft — 操作系统/AI 平台厂商, 美国; 推 Copilot+ PC 标签及 Foundry on Windows 统一本地 AI 运行时.
  • NVIDIA — GPU/AI 计算厂商, 美国; 预计 2026 年秋携 RTX Spark 芯片进入 AI PC 市场.
  • Acer / ASUS / HP / Lenovo / Dell — 全球前五大 PC OEM, 台湾/美国; 各自为 AI PC 集成 NPU 特色软件与助手.
Industry Impact
  • ICT: High — NPU 激化半导体厂竞争, PC OEM 被迫重构软件价值.
  • Terminals/Consumer Electronics: High — AI PC 重塑笔记本体验, 但用户认知仍模糊.
  • Computing/AI: High — 本地推理催生 heterogeneous computing 新范式, 但工具链互不兼容.
Tracking

Strongly track — AI PC 仍处硬件先行、软件滞后的阶段,NPU 性能竞赛与生态整合将决定市场爆发节奏。

Related Companies

No companies linked yet

Categories
半导体 人工智能 软件
AI Processing
2026-07-06 11:04
deepseek / deepseek-v4-pro