推理模型与思考档位

LLM 与 Prompt 基础进阶9讲解 3

推理模型在作答前先生成一段内部推理;「推理模型 vs 普通模型」的二分已合流成一个 effort 旋钮。思考 token 计入输出、受 max_tokens 约束,effort 影响的是整个响应的 token 花费而不只是「想多久」,所以档位选择本质上是成本、延迟与质量的三方权衡,按任务路由而不是一刀切。

也叫:推理模型 · reasoning model · thinking · 思考档位 · effort · 思考预算

原理拆解出自 T0-5

降一档,少的不只是思考 token
lowmax 五档,high 是默认档 —— 等价于你不传这个参数

  1. low分类、路由、抽取、子代理、高并发
  2. medium一般 Agent 任务的性价比档
  3. high默认档:复杂推理、难编码、主决策
  4. xhigh长程 Agent 与编码,部分模型可用
  5. max真正的前沿难题,边际收益小
省 token · 直接动手更常思考 · 想得更久
思考简单输入可能完全跳过更常思考、想得更久
工具调用合并成更少的调用做更多次调用
解释详略用更简短的话确认更多地解释计划
延迟与成本陡增

旧范式是手工设预算:2025 年靠「选普通模型还是推理模型」,再给 budget_tokens=10000 规定草稿写多少字;2026 年是一个模型 + thinking: adaptive + output_config.effort,档位一变,工具调用次数和解释详略一起跟着变。

两条硬约束:① effort 是行为信号,不是硬预算 —— 低档遇到足够难的问题模型仍然会思考,成本上限得靠别的机制;② max_tokens 才是硬顶,且思考和正文共享它,开高档不放大它的典型症状是草稿写得很爽、正文写到一半被截断,官方经验起点是从 6.4 万往上调。

在 Agent 场景里,effort 是成本的主旋钮,不是「思考深度」的小开关:你降一档,省下的不只是草稿纸,还有好几轮工具往返。所以降档必须重跑轨迹评测(Q3-21)。
原文示意
2025 范式:选模型 + 手工设预算
   普通模型  ──────────────────► 直接作答
   推理模型  ──► thinking(budget_tokens=10000) ──► 每次请求都想

2026 范式:一个模型 + 一个档位
   模型 ──► thinking: adaptive
            output_config.effort: low | medium | high | xhigh | max
              ├─ 低档:足够简单的输入,可能完全跳过思考
              ├─ 高档:更常思考、想得更久
              └─ 而且:工具调用次数、解释详略,一起跟着变

第三行是最容易被忽略、也最值钱的一点:effort 影响的是整个响应的 token 花费,不只是「想多久」。 官方明确说明,低档下模型会把多个操作合并成更少的工具调用、更直接地动手、用更简短的话确认;高档下则会更多地解释计划、做更多次工具调用。

这意味着一件事:在 Agent 场景里,effort 是成本的主旋钮,而不是一个「思考深度」的小开关。 你降一档,省下的不只是草稿纸,还有好几轮工具往返。这也解释了为什么降档必须重跑轨迹评测,而不能只看最终答案对不对(Q3-21 展开)。

两条硬约束

  1. effort 是行为信号,不是硬预算。 低档下遇到足够难的问题,模型仍然会思考,只是比高档想得少。所以它不能当成本硬上限用,成本上限得靠别的机制。
  2. max_tokens 才是硬顶,且思考和正文共享它。 开高档却不放大 max_tokens,典型症状是:草稿写得很爽,正文写到一半被截断。官方给的经验起点是从 6.4 万往上调。

为什么手写 CoT 可能是负优化

模型内部已经在跑推理了。你在提示词里规定推理路径,等于把它约束在你能想到的那一条路上——这和「给示例反而把模型限制在更窄的探索空间」是同一个机制。官方在自家系统提示词上的实践结论也一致:为新一代模型删掉了 80% 以上的规则型指令,编码评测无可测损失。

但这里必须划一条线,否则容易矫枉过正:

你在规定什么 2026 年的判断
推理过程(先做 A 再做 B 再检查 C) 多半是负优化,模型自己的路径通常更好
输出结构(返回哪些字段、什么格式) 仍然有效,而且应该交给结构化输出去硬保证(T1-2
领域知识与约束(你的口径、边界、只有你知道的事) 必须给,模型推不出来

一句话:别教它怎么想,要告诉它想什么、以及结果长什么样。

以上节选自T0-5 思考档位:「推理模型 vs 普通模型」的二分,怎么合流成了一个 effort 旋钮,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到8