温度,一项随推理模型而消失的设置

La température, un réglage qui se perd avec les modèles de raisonnement

Silicon.fr by Clément Bohic 2026-07-22 13:17 Original
摘要
谷歌、Anthropic和OpenAI等公司正逐步在新一代推理模型中弃用temperature、top_k和top_p等传统采样参数,因为这些参数会干扰模型内部推理逻辑。谷歌建议通过系统提示词来控制确定性,而Anthropic从Claude 4.1起已限制参数组合使用,OpenAI的o1及GPT-5系列则不开放任何采样参数调整。这一技术转变意味着未来开发者将更多依赖提示工程而非参数设置来管理AI生成内容的创造性与随机性。

Gemini API 文档现已明确警告:未来所有模型版本中,温度(temperature)、top_k 和 top_p 参数将直接返回错误,目前则只是被忽略。温度通过调节 token 间的概率差异来控制模型输出的确定性,top_k 将选择范围限定在固定数量的最可能 token 上,top_p 则动态限定累计概率达到阈值的那部分 token。

放弃这些采样参数的趋势正在加速。Google 建议在系统提示(system prompt)中设置明确规则来引导确定性。Anthropic 的调整更为激进——Claude 4.1 家族已禁止同时使用温度和 top_p,而 Claude Opus 4.7 与 Sonnet 5 更彻底抛弃了温度、top_k 和 top_p,理由是这些参数已与推理模型的内部生成逻辑不兼容。作为替代,原先“扩展思考 + token 预算 + 温度”的组合被“自适应思考”取代,由单独的参数分别控制推理深度和输出的详尽程度。

OpenAI 采取了同样路线。从 o1 及其后继模型起,可调节推理级别,但无法修改任何采样参数,包括 presence_penalty(对已出现 token 施加固定处罚)和 frequency_penalty(按出现次数等比处罚)。GPT-5 系列也遵循此限制,修改温度等参数会扰乱推理模型的生成过程。此外,speech-to-speech API 同样采用固定温度 0.8,OpenAI 称模型在该设定下“几乎总能更好”地运行,并再次建议通过 prompt 设计来影响创造性。

总体来看,推理模型的内在工作方式已使传统采样机制成为干扰项,主流厂商正一致转向以提示工程为主的创作控制方式。

Summary
Google, Anthropic, and OpenAI are deprecating sampling parameters like temperature, top_k, and top_p in their reasoning models because they disrupt internal generation logic, with future Gemini versions returning errors for their use. Developers are instead advised to control output behavior through explicit system prompts or new reasoning-specific settings like adaptive thinking. This shift forces a transition from parameter tuning to prompt engineering, impacting how businesses fine-tune creativity and determinism in AI applications.

Google’s Gemini API documentation now warns that temperature, top_k, and top_p—long used to control randomness and token selection—will return errors in future model generations; currently, they are ignored. Temperature adjusts determinism by widening or narrowing token probability differences, while top_k and top_p limit choices to the most probable tokens (by fixed count or cumulative probability threshold). Instead, Google advises embedding explicit determinism rules in the system prompt.

Anthropic went further: after initially restricting the joint use of temperature and top_p in Claude 4.1, it dropped all three sampling parameters from Claude Opus 4.7 and Sonnet 5, as they conflict with reasoning models’ internal logic. It replaced the “extended thinking + token budget + temperature” combination with “adaptive thinking” and separate controls for reasoning level and verbosity. OpenAI likewise removed sampling parameters—including presence_penalty and frequency_penalty—from o1 and GPT-5, allowing only reasoning level adjustment. For its speech-to-speech API, OpenAI sets a fixed temperature of 0.8 (which it says works “almost always better”) and recommends prompting to steer creativity.

Résumé
Google, Anthropic et OpenAI abandonnent progressivement les paramètres d'échantillonnage temperature, top_k et top_p sur leurs modèles de raisonnement (Gemini, Claude, GPT-5, o1) car ils seraient incompatibles avec leur logique interne. Désormais, le contrôle du déterminisme et de la créativité se fait via des règles explicites dans les prompts systèmes ou par des mécanismes de pensée adaptative, marquant un virage vers une approche plus intégrée de la génération de texte.

Avec toutes les futures générations de modèles, les paramètres temperature, top_k et top_p renverront une erreur.

Cet avertissement figure désormais dans la documentation de l’API Gemini. Pour le moment, celle-ci ignore simplement les paramètres en question.

Jouer sur la « température » d’un modèle permet de le rendre plus ou moins déterministe, en modifiant l’écart de probabilité entre les tokens.

Les paramètres top_k et top_p limitent le choix des tokens aux plus probables. Dans le premier cas, le nombre de tokens est fixe. Dans le second, il est variable (conditionné à l’atteinte d’un pourcentage de la masse de probabilité totale).

INTER

Pour contrôler le déterminisme, Google invite désormais à définir des règles explicites dans le prompt système.

Anthropic fait de même. Il avait d’abord empêché, avec la famille Claude 4.1, l’utilisation conjointe de temperature et de top_p. À partir de Claude Opus 4.7 et Sonnet 5, il les a abandonnés, ainsi que top_k. Motif : ces paramètres d’échantillonnage ne sont plus compatibles avec la logique interne des modèles de raisonnement.

Dans le même temps, la combinaison « pensée étendue + budget de tokens + température » a laissé place à une « pensée adaptative », avec des paramètres distincts pour gérer le niveau de raisonnement et la verbosité.

INTER

OpenAI a suivi la même voie. Avec le modèle o1 et ses successeurs, on peut contrôler le niveau de raisonnement, mais pas modifier les paramètres d’échantillonnage. Cela inclut presence_penalty et frequency_penalty. Le premier applique une pénalité fixe aux mots déjà apparus dans le texte généré. Le second en applique une proportionnelle au nombre d’apparitions.

Les modèles de la famille GPT-5 sont traités à la même enseigne. Vraisemblablement pour le même motif : modifier la température & Cie perturberait le processus de génération inhérent à ces modèles de raisonnement.

L’API speech-to-speech est également concernée. Le modèle sous-jacent fonctionne « presque toujours mieux » avec une valeur de température fixée (0.8), selon OpenAI. Qui conseille, là aussi, de jouer sur le prompting pour influencer le niveau de créativité.

Illustration générée par IA

The post La température, un réglage qui se perd avec les modèles de raisonnement appeared first on Silicon.fr.

AI Insight
Core Point

Major AI providers are removing sampling parameter controls (temperature, top_k, top_p) from reasoning models because they disrupt internal generation logic, redirecting determinism management to prompting and new reasoning-specific parameters.

Key Players
  • Google — AI developer offering Gemini APIs, USA.
  • Anthropic — AI developer offering Claude models, USA.
  • OpenAI — AI developer offering o1/GPT-5/speech-to-speech APIs, USA.
Industry Impact
  • ICT: High — API changes force developers to redesign integration and prompt engineering for reasoners.
  • Computing/AI: High — fundamental shift in output control mechanisms marks maturing model architectures.
Tracking

Monitor — developers must adapt to new control methods as this trend becomes standard for reasoning models.

Related Companies
neutral
OpenAI
mature
neutral
Google
mature
neutral
Anthropic
startup
neutral
Categories
人工智能 软件
AI Processing
2026-07-22 19:19
deepseek / deepseek-v4-pro