Mistral AI 改变其强化学习策略

Mistral AI change d’approche pour l’apprentissage par renforcement

Silicon.fr by Clément Bohic 2026-07-09 10:06 Original
摘要
Mistral AI 接连发布 Leanstral 1.5 与 Robostral Navigate 两款模型,均采用源自 DeepSeek GRPO 改进的 CISPO 强化学习算法。该算法通过裁剪重要性采样权重而非梯度,更有效处理长推理链中的关键反思令牌,Leanstral 1.5 基于 Mistral Small 4,支持代码的数学形式验证;Robostral Navigate 则为仅依赖单 RGB 相机的 8B 参数机器人导航模型。Mistral AI 称,CISPO 将导航成功率提升了 3.2%,在未见过数据上达到 76.6% 的 R2R-CE 指标。

Mistral AI近期连续推出两款模型Leanstral 1.5和Robostral Navigate,均采用了强化学习算法CISPO,显示出其在训练方法上的重要转向。

CISPO由MiniMax-M1模型的创建者于2025年提出,其设计初衷是为了克服DeepSeek所开发GRPO算法的缺陷。GRPO通过可编程函数直接计算奖励,并对token的梯度进行裁剪来保持训练稳定,但这种做法在处理长推理链时会错误地剔除一些低概率却极为关键的“反思性”token(如However、Recheck、Wait、Aha),从而削弱模型自我纠错的能力。CISPO则转而裁剪重要性采样权重而非梯度,使所有token都能被模型利用,因此更适合长程推理任务。

Leanstral 1.5是一款混合专家(MoE)模型,拥有1190亿总参数、60亿活跃参数,基于Mistral Small 4构建,采用Apache 2.0许可。其核心特色在于内置基于Lean语言的程序化验证能力,能够通过数学证明来确保所生成代码的正确性。另一款模型Robostral Navigate是一个80亿参数的嵌入式导航系统,专为仅使用单个RGB摄像头(无需激光雷达或深度传感器)而设计,并能在不同类型机器人之间实现泛化。它采用“指向式”导航策略:给定任务和观测历史,模型直接推断目标在视野中的坐标及抵达时的朝向;当目标不在视野范围内时,则切换至局部坐标系进行推算,但此时对摄像头的内参变化较为敏感。

据Mistral AI称,引入CISPO使模型的成功率提升了3.2%,最亮眼的数据是Robostral Navigate在未参与训练的验证集上取得了76.6%的R2R-CE(连续环境中的房间到房间导航)准确率,但公司并未明确这一提升具体对应哪项指标。

Summary
Mistral AI released Leanstral 1.5 and Robostral Navigate, two models fine-tuned with the CISPO reinforcement learning algorithm that improves reasoning by preserving critical tokens, unlike prior GRPO methods from DeepSeek. Leanstral 1.5, a 6B-active MoE derived from Mistral Small 4, enables formal mathematical code verification via the Lean language, while Robostral Navigate is an 8B embodied navigation model using a single RGB camera, achieving 76.6% on unseen R2R-CE benchmarks. This shift to CISPO, proposed by MiniMax-M1’s creators, boosted navigation success by 3.2% and highlights Mistral’s focus on more efficient, generalizable AI for verification and robotics.

Mistral AI has unveiled two new models—Leanstral 1.5 and Robostral Navigate—both fine-tuned using CISPO, a reinforcement learning algorithm proposed in 2025 by the team behind the MiniMax-M1 model. CISPO addresses a known limitation of DeepSeek’s GRPO (Group Relative Policy Optimization), which avoids unstable parameter updates by clipping token gradients. On long reasoning chains, this discards low-probability but critical “reflexive” tokens (e.g., However, Recheck, Wait, Aha) that enable error correction. CISPO instead clips importance sampling weights, allowing all tokens to be exploited.

Leanstral 1.5, an Apache 2.0-licensed mixture-of-experts model with 6 billion active parameters (119 billion total), derives from Mistral Small 4. It uses the Lean language for programmatic verification, mathematically proving the correctness of generated code. Robostral Navigate is an 8-billion-parameter onboard navigation model that operates with a single RGB camera—no lidar or depth sensors—and generalizes across robot types. It navigates by pointing: given a task and observation history, it infers the target location’s coordinates in the field of view and determines arrival orientation; if the target is outside the field of view, it switches to local coordinates, which are more sensitive to camera intrinsics.

Mistral AI reports that incorporating CISPO improved success rates by 3.2%, though it does not specify the baseline. The highlighted performance is a 76.6% score on the R2R-CE (Room-to-Room in Continuous Environments) metric using the previously unseen portion of the validation dataset.

Résumé
Mistral AI a présenté Leanstral 1.5 (vérification mathématique de code) et Robostral Navigate (navigation robotique frugale), tous deux affinés avec CISPO, un algorithme d’apprentissage par renforcement issu des créateurs de MiniMax-M1. Cette approche, qui corrige les limites de GRPO de DeepSeek, a amélioré le taux de réussite en navigation de 3,2 % et permet au modèle de raisonnement de prouver l’exactitude du code.

Leanstral 1.5, puis Robostral Navigate : à quelques jours d’intervalle, Mistral AI a présenté deux modèles qui utilisent CISPO.

Cet algorithme d’apprentissage par renforcement a été proposé en 2025 par les créateurs du modèle MiniMax-M1. Il s’inscrit dans la lignée de la méthode GRPO, qu’on doit à DeepSeek.

GRPO (Group Relative Policy Optimization) n’implique pas de réseau de neurones distinct pour le calcul des récompenses. Pour chaque prompt, il produit plusieurs réponses et utilise leur moyenne comme référence, à renfort de fonctions programmables. Pour éviter les mises à jour de paramètres instables, il écrête les gradients des tokens.

Cet écrêtage pose un problème sur les chaînes de raisonnement longues : il éjecte des tokens à la probabilité faible, mais critiques. En l’occurrence, ceux dits « réflexifs » (However, Recheck, Wait, Aha), qui favorisent la correction des erreurs.

Plutôt que les gradients, CISPO (Clipped Importance Sampling Policy Optimization) écrête les poids d’échantillonnage préférentiel. L’ensemble des tokens sont ainsi exploités.

Vérification formelle et robotique

CISPO a servi à affiner Leanstral 1.5. Ce MoE (6 milliards de paramètres actifs sur 119 milliards) sous licence Apache 2.0 dérive de Mistral Small 4. Il a des propriétés de vérification programmatique reposant sur le langage Lean. Cela lui permet notamment de prouver mathématiquement l’exactitude du code qu’il produit.

On trouve aussi du CISPO dans Robostral Navigate. Il s’agit d’un modèle 8B de navigation embarquée. Il est conçu pour fonctionner avec une seule caméra RGB (pas de lidars, de capteurs de profondeur, etc.). Mistral AI vante sa capacité à généraliser entre types de robots.

Robostral Navigate utilise une navigation par « pointage » : étant donne une tâche et un historique d’observations, il infère les coordonnées de l’emplacement cible dans son champ de vision et détermine son orientation à l’arrivée. Lorsque la cible n’est pas dans le champ de vision, le modèle repasse sur un système de coordonnées locales, plus sensibles aux variations intrinsèques à la caméra.

L’usage de CISPO a accru de 3,2 % le taux de réussite, affirme Mistral AI, sans préciser à quel résultat il se réfère. Potentiellement à celui qu’il met le plus en avant : 76,6 % R2R-CE (Room-to-Room in Continuous Environments) avec la portion du dataset de validation jamais vue auparavant par le modèle.

Illustration générée par IA

The post Mistral AI change d’approche pour l’apprentissage par renforcement appeared first on Silicon.fr.

AI Insight
核心点

Mistral AI采用新强化学习算法CISPO优化长链推理与视觉导航,解决GRPO因梯度裁剪丢失关键反思token的问题。

关键参与者

Mistral AI — 法国AI公司,开源大模型开发者,发布Leanstral 1.5与Robostral Navigate。

行业影响
  • ICT/人工智能:高 — 新型RL算法提升模型推理和数学证明能力,推动开源AI前沿。
  • 汽车/自主系统:中 — 单RGB相机视觉导航模型可降低机器人/自动驾驶传感器成本。
  • 终端/消费电子:中 — 8B嵌入式导航模型适用于低算力设备,拓宽边缘AI应用场景。
追踪

[强烈追踪] — CISPO可能成为RL微调新范式,影响开源模型竞争格局。

Highlights
Tech Breakthrough
Related Companies
Mistral AI
startup
positive
DeepSeek
startup
neutral
neutral
Categories
人工智能
AI Processing
2026-07-09 11:21
deepseek / deepseek-v4-pro