ROCm.ai,或 AMD 如何将其技术栈灌输给 LLM

ROCm.ai, ou comment AMD inculque sa stack aux LLM

Silicon.fr by Clément Bohic 2026-07-24 11:27 Original
摘要
AMD宣布将于8月推出AI辅助GPU编程工具ROCm.ai,集成技能系统和Hyperloom优化引擎,支持本地Ryzen AI芯片与服务器端Instinct/EPYC处理器,旨在简化ROCm栈并提升AI工作负载效率。该工具利用Claude Code和Codex等AI助手,并与OpenAI合作强化Triton代码生成,有望降低AMD GPU的开发门槛并加速其AI生态建设。

AMD 在 “Advancing AI” 大会上宣布,将于今年八月正式发布 ROCm.ai,目标是借助 AI 实现 GPU 编程辅助,核心抓手是一套被称为 Hyperloom 的智能体系统以及一系列专长技能(skills)。这些技能目前已上架 Claude、Codex 的插件目录以及 Cursor 市场,初期共提供六项。

其中两项技能面向客户端,直接运行在 Ryzen AI 芯片上。“Local AI Use” 通过本地的 Lemonade 服务器处理图像生成、语音合成与识别,当用户提及节省 token、OmniRouter、SD-Turbo 或 NPU 推理时,智能体会被引导调用该技能;“Local AI App Integration” 则为原本依赖云 API 的应用嵌入本地 Lemonade 服务,实现离线、隐私优先的本地 AI 模式,用户在提到相关关键词时即触发。

其余四项面向服务器端。两项分别在 Instinct GPU 和 EPYC CPU 上创建 vLLM 推理端点,AMD 特别强调 Instinct 技能不可用于 NVIDIA GPU。另外两项则分别对接 Magpie(GPU 内核评估框架)和 TraceLens(用于推理与训练工作流分析的 Python 库)。

AMD 还公布了五项路线图技能:跨栈的 “ROCm Doctor” 能根据常见错误配置诊断 ROCm、PyTorch 和 llama.cpp 的失败问题;“Hyperloom Kernel Optimizer” 可自动优化 AMD GPU 推理性能;“vLLM Semantic Router” 用于设置请求路由;“HRR Replay Analysis” 能够在 Instinct、Radeon 和 Ryzen 加速器之间录制、回放并分析 GPU 工作负载;客户端方面还有 “APU Memory Tuner”,让智能体动态调整专用内存与共享内存的划分。

上述技能中,多数都与 Hyperloom 系统直接相关。Hyperloom 是一个智能体驱动的工作负载优化引擎,当前支持 MI300X、MI325X 和 MI355X GPU,可管理 SGLang 和 vLLM 两种服务器,并处理 HIP、Triton、FlyDSL 三种语言。其底层由增加了智能体层的 TraceLens 库构成,消费 Magpie 采集的跟踪数据,而 Magpie 又建立在底层分析工具套件 Intellikit 之上。分析结果送入优化循环,核心组件 GEAK(生成高效 AI 内核)最初仅支持逐内核优化,如今新增的 “系统层” 模式可端到端优化完整工作负载。这一进化得益于多项架构调整:用 Claude Code 及其动态工作流替换了原有的 mini-swe-agent;允许系统层递归复用内核层的优化逻辑,形成 AMD 所称的 “分形设计”;并引入 Arbor 树搜索方法,为智能体提供共享工作记忆,更高效地探索优化空间。

除了将 Claude Code 用于 Hyperloom,AMD 还借助它加速 ROCm 本身的开发,同时与 OpenAI 合作,利用 Codex 辅助编写 Triton 代码,并通过 Gluon 项目持续推进。这套体系有望显著降低开发者面向 AMD GPU 的优化门槛,并推动其在 AI 基础设施领域的生态渗透。

Summary
AMD announced at its Advancing AI conference that ROCm.ai will launch in August, integrating AI-assisted GPU programming skills and the Hyperloom optimization system, with Claude Code at its core to automatically generate and tune kernels for AMD Instinct GPUs. The initial six skills—available for Claude, Codex, and the Cursor marketplace—include client-side local AI execution via a Lemonade server on Ryzen AI chips, and server-side vLLM endpoints, strengthening AMD’s ROCm stack against NVIDIA’s dominance by enabling AI-driven workload optimization. AMD is also collaborating with OpenAI on Codex to accelerate ROCm development and plans additional skills like GPU diagnostics and workload replay analysis.

AMD will launch ROCm.ai in August, bringing AI-assisted GPU programming through a set of agent skills and an optimization system called Hyperloom, built atop its local Lemonade AI server. The move, unveiled at AMD’s Advancing AI conference, aims to streamline development and tuning for AMD’s Instinct, Radeon, and Ryzen hardware.

Six skills are already available across Claude, Codex, and the Cursor marketplace. Two target client-side execution on Ryzen AI chips: Local AI Use routes image generation and speech tasks through a local Lemonade server when the user wants to save tokens or mentions technologies like OmniRouter or SD-Turbo, while Local AI App Integration adds an offline/privacy mode to cloud-API apps via an embedded Lemonade server. The four server-side skills include vLLM endpoint creation for Instinct GPUs (explicitly not to be used with NVIDIA GPUs) and EPYC CPUs, plus connectors to Magpie (GPU kernel evaluation) and TraceLens (a Python library for inference/training workflow analysis).

Five more skills are on the roadmap: ROCm Doctor diagnoses ROCm, PyTorch, and llama.cpp failures on AMD GPUs; Hyperloom Kernel Optimizer automates inference optimization; vLLM Semantic Router configures request routing; HRR Replay Analysis records and replays GPU workloads across Instinct, Radeon, and Ryzen; and the client-side APU Memory Tuner lets AI agents adjust the split between dedicated and shared memory.

At the heart of the stack, Hyperloom is an agentic system that optimizes AI workloads for current and upcoming AMD GPUs (MI300X, MI325X, MI355X). It manages two servers—SGLang and vLLM—and three programming languages: HIP, Triton, and FlyDSL. Beneath it, an agent-enhanced TraceLens consumes traces from Magpie, which relies on the low-level profiling suite Intellikit. The optimization loop centers on GEAK (Generating Efficient AI-Centric Kernels), which now operates at both the per-kernel and whole-workload levels. This shift is enabled by replacing a mini-swe-agent with Claude Code for dynamic workflows, a “fractal design” where the kernel layer is recursively reused by the system layer, and a new tree-search memory system called Arbor that shares optimization state.

AMD is also using Claude Code to accelerate ROCm development and working with OpenAI to improve Codex’s ability to write Triton code, notably via the Gluon project. The initiative signals a deeper integration of LLM-driven tooling into GPU programming, with skills and agentic optimization tightly coupled to AMD’s hardware ecosystem.

Résumé
AMD a dévoilé ROCm.ai, une plateforme de programmation GPU assistée par IA prévue pour août, intégrant des skills et le système agentique Hyperloom. L’initiative, exploitant Claude Code d’Anthropic et Codex d’OpenAI, vise à optimiser les workloads IA sur les GPU AMD (Instinct, Ryzen AI). L’objectif est d’accélérer le développement et l’adoption de la pile logicielle ROCm face à la concurrence.

Rendez-vous en août pour la sortie de ROCm.ai.

AMD a fixé le rendez-vous à l’occasion de sa conférence Advancing AI. La promesse : de la programmation GPU assistée par IA. Avec, comme principaux leviers, des skills et un système appelé Hyperloom.

AMD met à contribution son serveur Lemonade

Six skills sont pour le moment disponibles. On les retrouve dans les catalogues de plug-in de Claude et de Codex, ainsi que sur la marketplace Cursor.

Deux de ces skills ciblent l’exécution côté client, sur les puces Ryzen AI : Local AI Use et Local AI App Integration.

Local AI Use fait passer la génération d’images ainsi que la synthèse et la reconnaissance vocales par un serveur Lemonade local. Les agents sont invités à l’exploiter, entre autres, lorsque l’utilisateur déclare vouloir économiser des tokens ; ou s’il mentionne des éléments comme OmniRouter, SD-Turbo ou l’inférence NPU.

Local AI App Integration ajoute un mode local aux applications qui utilisent des API cloud, grâce à une version embarquée du serveur Lemonade. Les agents sont censés l’exploiter lorsque l’utilisateur évoque l’IA locale, hors ligne, privée, etc.

Les quatre autres skills ciblent l’exécution côté serveur. Deux d’entre elles créent un endpoint vLLM, respectivement sur les GPU Instinct et sur les CPU EPYC. AMD précise aux agents que la skill Instinct… ne doit pas être utilisée avec les GPU NVIDIA.

Les deux skills restantes sont connectées à Magpie (framework d’évaluation de noyaux GPU) et TraceLens (bibliothèque Python pour l’analyse de workflows d’inférence et d’entraînement).

5 autres skills dans les cartons

Quatre skills cross-stack sont en roadmap :

ROCm Doctor

Diagnostic des échecs ROCm, PyTorch et llama.cpp sur les GPU AMD à partir d’une liste de mauvaises configurations

Hyperloom Kernel Optimizer

Optimisation automatique de l’inférence sur les GPU AMD

vLLM Semantic Router

Paramétrage d’un routeur de requêtes

HRR Replay Analysis

Enregistrement, rejeu et analyse des workloads GPU entre accélérateurs Instinct, Radeon et Ryzen

AMD en prépare aussi une sur la partie client : APU Memory Tuner, avec laquelle les agents IA pourront régler la répartition entre mémoire dédiée et mémoire partagée.

Claude Code intégré au cœur du réacteur Hyperloom

On l’aura constaté : plusieurs de ces skills permettent d’exploiter le fameux Hyperloom. Ce système agentique a, sur le papier, un rôle : optimiser les workloads IA pour les GPU AMD (en l’état, MI300X, MI325X et MI355X). Il gère actuellement deux serveurs (SGLang, vLLM) et trois langages (HIP, Triton, FlyDSL).

Au bas de l’édifice se trouve TraceLens. La bibliothèque – agrémentée pour le coup d’une couche agentique – consomme les traces collectées par Magpie, qui s’appuie lui-même sur Intellikit (suite d’outils de profilage à bas niveau).

Cette analyse nourrit la boucle d’optimisation. La brique GEAK (Generating Efficient AI-Centric Kernels) en est le point central, chargée de générer les implémentations. À l’origine, elle optimisait noyau par noyau (« couche kernel ») La dernière version conserve cette option, mais peut aussi optimiser un workload dans son ensemble (« couche système »). Plusieurs modifications architecturales le permettent. En particulier, le remplacement de mini-swe-agent par Claude Code et ses workflows dynamiques. Mais aussi la réutilisation récursive de la couche kernel par la couche système (AMD parle de « conception fractale »). Et l’introduction d’Arbor. Cette méthode favorise l’exploration de l’espace d’optimisation en apportant un système de recherche arborescente qui fait office de mémoire de travail partagée.

Au-delà d’utiliser Claude Code dans le cadre d’Hyperloom, AMD l’exploite pour accélérer le développement de ROCm. Il travaille aussi avec OpenAI autour de Codex, qui « aide déjà à écrire du code Triton » et « progresse » avec Gluon.

À consulter en complément :

LLMD, un serveur d’inférence made in France qui se frotte à vLLM

PC IA : le NPU, emblème d’un marché qui se cherche encore

Jalapeño plutôt que Stargate : OpenAI a revu ses priorités

Meta mise des dizaines de milliards sur les GPU d’AMD

VM cloud : AMD reste dans le match du rapport coût-performance

Illustration principale générée par IA

The post ROCm.ai, ou comment AMD inculque sa stack aux LLM appeared first on Silicon.fr.

AI Insight
Core Point

AMD previews ROCm.ai, an AI-powered GPU programming assistant leveraging agentic LLM skills and the Hyperloom optimization system to streamline ROCm development and workload tuning, set for August release.

Key Players
  • AMD — Semiconductor firm (US) expanding its ROCm software ecosystem with AI-assisted coding and kernel optimization.
  • Anthropic — AI provider (US); its Claude Code is integrated into Hyperloom’s agentic loop.
  • OpenAI — AI provider (US); Codex aids AMD in Triton code generation.
Industry Impact
  • ICT: High — AI-driven tooling could reduce ROCm friction, accelerating datacenter GPU adoption versus NVIDIA’s CUDA.
  • Computing/AI: High — Agentic optimization of GPU kernels and server endpoints advances AI infrastructure automation.
  • Terminals/Consumer Electronics: Medium — Client-side skills for Ryzen AI enable local, private inferencing on NPUs.
Tracking

Strongly track — AMD’s agentic AI push directly challenges NVIDIA’s software stronghold and signals a new phase in AI-assisted hardware development.

Related Companies

No companies linked yet

Categories
半导体 人工智能 软件
AI Processing
2026-07-24 13:22
deepseek / deepseek-v4-pro