Exprimer des valeurs sous forme de divisions imbriquées : c’est le principe des fractions continues.
IBM Research les a mises à contribution dans le cadre d’une famille d’architectures dite CoFrGeNet (Continued Fraction Generative Networks). Elles sont censées pouvoir remplacer, avec un minimum de modifications des procédures d’entraînement et d’inférence, deux composants-clés des modèles transformateurs : le mécanisme d’attention et les réseaux à propagation avant.
Une seule division pour épargner les GPU
Appliquées aux réseaux de neurones, les fractions continues produisent des « échelles » de calcul où chaque niveau dépend de la réciproque du précédent. En ensembliser suffisamment apporte une capacité « universelle » d’approximation des nombres, tout en préservant la chaîne causale de génération des tokens.
Sous leur forme classique, ces fractions nécessitent de calculer, à chaque échelon, une division, opération coûteuse sur les GPU. IBM Research en a donc transformé l’écriture en un ratio de deux polynômes caculés de manière récursive : les constituants. Il n’y a ainsi plus qu’une division à effectuer, qu’importe la profondeur de la couche.
Le bénéfice se ressent tant à l’inférence qu’à l’entraînement, la propagation arrière sur les implémentations PyTorch standards exigeant autant de divisions qu’il y a de couches.
Une méthode efficace… surtout sur une ancienne architecture
Les évaluations ont consisté à comparer, sur deux architectures (GPT2-xl et Llama 3), un modèle de base avec trois variantes CoFrGeNet remplaçant soit l’attention, soit la propagation avant, soit les deux. IBM Research en a ajouté deux utilisant respectivement l’attention dense et l’attention parcimonieuse.
L’essentiel des chiffres communiqués concernent GPT2-xl. Sur Llama 3, la comparaison est sans doute moins favorable, le modèle de base exploitant déjà un mécanisme d’attention efficace (GQA). On le constate d’ailleurs sur plusieurs benchmarks, après un préentraînement sur un mix de 2000 milliards de tokens issus de 9 datasets.
Précision en 0-shot sur des tâches allant des questions ouverts à la compréhension de texte.
Pour l’architecture GPT2-xl, IBM Research annonce des résultats sur plusieurs plans. Parmi eux, la perplexité sur 6 benchmarks après un préentraînement sur deux datasets (OpenWebText et GneissWeb 35B).
CoFrGeNet-F correspond au remplacement de la propagation avant. CoFrGeNet-A, au remplacement de l’attention. CoFeGeNet, au remplacement des deux.
Un gain de temps à l’entraînement et à l’inférence
Au-delà des scores, on observera la différence de taille entre le modèle de base (1,5B) et ses variantes. Cela joue positivement sur les durées d’entraînement et d’inférence, dans des proportions similaires d’un dataset de préentraînement à l’autre.
CoFrGeNetB correspond à l’implémentation sans continuants.
IBM Research mentionne aussi des indicateurs de performance sur la suite GLUE (classification) après fine-tuning.
Tous ces scores ne tiennent pas contre d’une autre optimisation, indépendante de l’approche CoFrGeNet : une méthode incrémentale d’entraînement fondée sur l’introduction progressive des couches.
À expérimenter avec l’architecture Mamba
La méthode CoFrGeNet est compatibles avec les autres stratégies d’optimisation tels le pruning et l’attention à fenêtre glissante. Elle semble encore plus efficace sur les architectures MoE. Chaque expert se bornant à un sous-ensemble de tokens, le potentiel de compression est plus grand.
Face à la lourdeur des divisions, et malgré l’astuce des constituants, IBM Research dit réfléchir à des solutions logicielles et matérielles (il parle de FPGA et de processeurs analogiques). Il admet aussi qu’il faudrait réaliser l’expérience sur des architectures alternatives à Transformers. En tête de liste Mamba, qu’il a largement adoptée avec ses LLM Granite 4.0.
Mamba remplace le composant d’attention par un mécanisme inspiré de la théorie du contrôle : les SSM (State Space Models). Avec eux, la montée en charge est linéaire – et non quadratique*. On permet aux paramètres SSM d’être fonction de l’input, de sorte qu’une sélection des informations à conserver s’opère au moment de la mémorisation. Et non au moment de la remémoration comme c’est le cas pour les transformateurs.
* Dans les modèles transformateurs, le mécanisme d’attention constitue un goulet d’étranglement, du fait qu’il utilise une forme de cache clé-valeur permettant à chaque token d’accéder aux précédents lors de la prédiction. Plus la taille de contexte augmente, plus l’empreinte mémoire et la latence augmentent, de façon quadratique.
Illustration générée par IA
The post Pour optimiser les LLM, IBM leur fait faire des divisions appeared first on Silicon.fr.