为了优化LLM,IBM让它们做除法。

Pour optimiser les LLM, IBM leur fait faire des divisions

Silicon.fr by Clément Bohic 2026-07-13 16:14 Original
摘要
IBM Research 提出 CoFrGeNet 架构,利用连分式(Continued Fractions)替代 Transformer 中的注意力机制和前馈网络,通过递归计算多项式比值,将多层所需的多次除运算简化为单次除运算,从而节省 GPU 资源并降低训练和推理成本。评估显示,在 GPT2-xl 上该方法在保持性能的同时,模型尺寸更小、处理速度更快,但在采用高效注意力机制(如 GQA)的 Llama 3 上优势相对有限。该方法与 MoE 架构结合效果更优,且兼容剪枝、滑动窗口注意力等优化策略,IBM 也在探索其在 Mamba 等 SSM 架构上的应用潜力。

IBM 研究人员提出一种名为 CoFrGeNet(Continued Fraction Generative Networks)的模型架构,其核心思想是将连分数引入神经网络——通过嵌套的除法表达数值,构建层层依赖的“计算阶梯”,在保证因果生成链的同时,实现通用的数值近似能力。传统连分数在每一层都需要一次昂贵的除法运算,对 GPU 极不友好。为此,IBM 将连分数改写为两个递归多项式(构成元素)的比值,使得无论网络深度多少,整个层只需执行一次除法。此举大幅降低了训练和推理时的计算开销,因为标准 PyTorch 实现中反向传播所需的除法次数与层数成正比。

研究团队在 GPT2-xl 和 Llama 3 两套架构上进行了评估,对比基线模型与三种 CoFrGeNet 变体:CoFrGeNet‑A(替换注意力机制)、CoFrGeNet‑F(替换前馈网络)以及 CoFrGeNet(同时替换两者),并加入了密集注意力和稀疏注意力两种对照。主要结果基于 GPT2-xl 报告。在该模型上,使用 OpenWebText 和 GneissWeb 35B 两类数据集预训练后,CoFrGeNet 在六个基准上的困惑度表现优异,且参数规模从基线的 15 亿有所缩小,训练与推理时间成比例减少。例如,表中显示 CoFrGeNetB(未使用构成元素的版本)与使用构成元素的版本相比,效率差距明显。在 Llama 3 上,由于其本身已采用高效的分组查询注意力(GQA),提升幅度相对有限;预训练混合了来自九个数据集的共 2 万亿 tokens,多项零样本任务(从开放问题到文本理解)的评测分数印证了这一趋势。微调后在 GLUE 分类套件上的性能指标同样显示 CoFrGeNet 具备竞争力,但未超越一种独立的增量式训练优化——后者通过逐阶段引入层来提升效果。

CoFrGeNet 兼容其他优化策略,如剪枝和滑动窗口注意力,在混合专家(MoE)架构中表现出更大潜力,因为每个专家仅处理部分 tokens,压缩空间更大。尽管通过构成元素技巧降低了除法负担,除法操作依然较重,IBM 正在探索软硬件协同解决方案,包括 FPGA 和模拟处理器。此外,团队承认需要在 Transformer 以外的架构上验证,首选是 Mamba(已被其 Granite 4.0 大规模采用)。Mamba 使用状态空间模型(SSM)替代注意力,信息选择发生在记忆阶段而非回忆阶段,且随着上下文增加,内存和延迟呈线性增长,不像 Transformer 的键值缓存那样呈二次方瓶颈。CoFrGeNet 若与 Mamba 结合,有望进一步释放效率增益。

Summary
IBM Research has developed CoFrGeNet, a continued fraction-based architecture that can replace attention and feed-forward layers in transformer models, using a mathematical trick to require only a single division per layer on GPUs. Tests on GPT2-xl showed reduced model size, faster training and inference, and maintained performance, with the method being compatible with other optimizations and potentially applicable to non-transformer architectures like Mamba.

IBM Research has developed a novel method to streamline large language models (LLMs) by embedding continued fractions into Transformer architectures, yielding the CoFrGeNet (Continued Fraction Generative Networks) family. The technique replaces two core components—the attention mechanism and feedforward networks—with minimal alterations to standard training and inference pipelines.

Continued fractions represent values as nested divisions, forming a computational “ladder” where each step depends on the reciprocal of the previous. When ensembled, they offer universal approximation power while preserving the causal chain of token generation. However, classic implementations demand a division operation at every rung, a costly proposition on GPUs. IBM Research circumvents this by reformulating the fraction as a ratio of two recursively computed polynomials known as continuants. The result: only a single division per layer, regardless of depth. This shrinks both inference and training overhead, as standard PyTorch backpropagation otherwise requires as many divisions as there are layers.

The team pitted a base model against three CoFrGeNet variants on two architectures: GPT2-xl and Llama 3. The variants replaced either attention (CoFrGeNet-A), feedforward networks (CoFrGeNet-F), or both (CoFeGeNet). Additional baselines used dense and sparse attention. Most published metrics focus on GPT2-xl; on Llama 3, the gains were less pronounced, likely because its base model already employs the efficient Grouped Query Attention (GQA). Pre-training was conducted on a mix of 2 trillion tokens from nine datasets. For GPT2-xl, perplexity was measured across six benchmarks after pre-training on OpenWebText and GneissWeb 35B. The CoFrGeNet variants not only preserved performance but also substantially reduced parameter count relative to the 1.5-billion-parameter base model, directly cutting training and inference time in similar proportions across pre-training datasets. (An implementation lacking continuants, CoFrGeNetB, served as a reference point.) GLUE benchmark scores after fine-tuning were also reported, though all results were outpaced by an independent optimization: an incremental training method that progressively introduces layers.

CoFrGeNet is compatible with other strategies such as pruning and sliding-window attention, and it appears particularly effective on Mixture-of-Experts (MoE) architectures, where each expert processes a subset of tokens, increasing compression potential. Despite the continuant trick, divisions remain a bottleneck; IBM Research is exploring both software and hardware remedies, including FPGAs and analog processors. The team also acknowledges the need to test the approach on non-Transformer architectures, specifically naming Mamba—the state-space model that powers their Granite 4.0 LLMs. Mamba substitutes attention with a mechanism inspired by control theory, where parameters are input-dependent and information selection happens during memorization rather than at recall, as in Transformers. This yields linear complexity scaling rather than the quadratic bottleneck caused by key-value caches in attention layers, which forces memory and latency to explode as context length grows.

Résumé
IBM Research a dévoilé CoFrGeNet, une famille d’architectures reposant sur des fractions continues optimisées (réduites à une seule division par couche) pour remplacer les mécanismes d’attention et de propagation avant dans les modèles transformateurs, ce qui réduit la taille et accélère l’entraînement comme l’inférence, surtout sur GPT2-xl. Moins performante sur Llama 3 en raison de son attention optimisée, cette méthode compatible avec d’autres optimisations devrait prochainement être testée sur l’architecture Mamba, chère à IBM pour ses Granite 4.0.

Exprimer des valeurs sous forme de divisions imbriquées : c’est le principe des fractions continues.

IBM Research les a mises à contribution dans le cadre d’une famille d’architectures dite CoFrGeNet (Continued Fraction Generative Networks). Elles sont censées pouvoir remplacer, avec un minimum de modifications des procédures d’entraînement et d’inférence, deux composants-clés des modèles transformateurs : le mécanisme d’attention et les réseaux à propagation avant.

Une seule division pour épargner les GPU

Appliquées aux réseaux de neurones, les fractions continues produisent des « échelles » de calcul où chaque niveau dépend de la réciproque du précédent. En ensembliser suffisamment apporte une capacité « universelle » d’approximation des nombres, tout en préservant la chaîne causale de génération des tokens.

Sous leur forme classique, ces fractions nécessitent de calculer, à chaque échelon, une division, opération coûteuse sur les GPU. IBM Research en a donc transformé l’écriture en un ratio de deux polynômes caculés de manière récursive : les constituants. Il n’y a ainsi plus qu’une division à effectuer, qu’importe la profondeur de la couche.

Le bénéfice se ressent tant à l’inférence qu’à l’entraînement, la propagation arrière sur les implémentations PyTorch standards exigeant autant de divisions qu’il y a de couches.

Une méthode efficace… surtout sur une ancienne architecture

Les évaluations ont consisté à comparer, sur deux architectures (GPT2-xl et Llama 3), un modèle de base avec trois variantes CoFrGeNet remplaçant soit l’attention, soit la propagation avant, soit les deux. IBM Research en a ajouté deux utilisant respectivement l’attention dense et l’attention parcimonieuse.

L’essentiel des chiffres communiqués concernent GPT2-xl. Sur Llama 3, la comparaison est sans doute moins favorable, le modèle de base exploitant déjà un mécanisme d’attention efficace (GQA). On le constate d’ailleurs sur plusieurs benchmarks, après un préentraînement sur un mix de 2000 milliards de tokens issus de 9 datasets.

Précision en 0-shot sur des tâches allant des questions ouverts à la compréhension de texte.

Pour l’architecture GPT2-xl, IBM Research annonce des résultats sur plusieurs plans. Parmi eux, la perplexité sur 6 benchmarks après un préentraînement sur deux datasets (OpenWebText et GneissWeb 35B).

CoFrGeNet-F correspond au remplacement de la propagation avant. CoFrGeNet-A, au remplacement de l’attention. CoFeGeNet, au remplacement des deux.

Un gain de temps à l’entraînement et à l’inférence

Au-delà des scores, on observera la différence de taille entre le modèle de base (1,5B) et ses variantes. Cela joue positivement sur les durées d’entraînement et d’inférence, dans des proportions similaires d’un dataset de préentraînement à l’autre.

CoFrGeNetB correspond à l’implémentation sans continuants.

IBM Research mentionne aussi des indicateurs de performance sur la suite GLUE (classification) après fine-tuning.

Tous ces scores ne tiennent pas contre d’une autre optimisation, indépendante de l’approche CoFrGeNet : une méthode incrémentale d’entraînement fondée sur l’introduction progressive des couches.

À expérimenter avec l’architecture Mamba

La méthode CoFrGeNet est compatibles avec les autres stratégies d’optimisation tels le pruning et l’attention à fenêtre glissante. Elle semble encore plus efficace sur les architectures MoE. Chaque expert se bornant à un sous-ensemble de tokens, le potentiel de compression est plus grand.

Face à la lourdeur des divisions, et malgré l’astuce des constituants, IBM Research dit réfléchir à des solutions logicielles et matérielles (il parle de FPGA et de processeurs analogiques). Il admet aussi qu’il faudrait réaliser l’expérience sur des architectures alternatives à Transformers. En tête de liste Mamba, qu’il a largement adoptée avec ses LLM Granite 4.0.

Mamba remplace le composant d’attention par un mécanisme inspiré de la théorie du contrôle : les SSM (State Space Models). Avec eux, la montée en charge est linéaire – et non quadratique*. On permet aux paramètres SSM d’être fonction de l’input, de sorte qu’une sélection des informations à conserver s’opère au moment de la mémorisation. Et non au moment de la remémoration comme c’est le cas pour les transformateurs.

* Dans les modèles transformateurs, le mécanisme d’attention constitue un goulet d’étranglement, du fait qu’il utilise une forme de cache clé-valeur permettant à chaque token d’accéder aux précédents lors de la prédiction. Plus la taille de contexte augmente, plus l’empreinte mémoire et la latence augmentent, de façon quadratique.

Illustration générée par IA

The post Pour optimiser les LLM, IBM leur fait faire des divisions appeared first on Silicon.fr.

AI Insight
Core Point

IBM Research introduces CoFrGeNet, a continued fraction-based architecture that replaces attention and feed-forward layers in transformers, reducing GPU division operations to a single recursive ratio—cutting training and inference costs.

Key Players
  • IBM Research — Corporate R&D division of IBM, global labs, headquartered in Armonk, NY.
Industry Impact
  • Computing/AI: High — method significantly lowers compute overhead for large language models, enabling more efficient training and inference.
Tracking

Monitor — promising efficiency gains on older architectures (GPT2-xl), but performance lags on modern Llama 3; future integration with Mamba SSMs and hardware adaptations may determine adoption.

Related Companies
positive
IBM
mature
positive
Categories
人工智能 软件 科研
AI Processing
2026-07-13 17:39
deepseek / deepseek-v4-pro