思考档位:「推理模型 vs 普通模型」的二分,怎么合流成了一个 effort 旋钮

T0-5模块 0 · 大模型基础面试权重 更新于 2026-08
前置T0-1T0-2
关联题目Q1-07Q1-09

这篇学完你能回答什么

  1. 推理模型和普通模型有什么区别?这个二分在 2026 年还成立吗?
  2. 思考 token 计在哪边?它和 max_tokens、和成本是什么关系?
  3. 模型答得浅,你该加提示词还是提档位?

从一个真实故障讲起

同一个团队,同一个季度,两个方向都犯了错。

方向一:该省的地方花。 一个工单分类服务,日均几十万次调用,任务是把工单归到 12 个类别里。为了「提升准确率」,团队把它换成了推理型配置、开了思考。上线后:P99 延迟从 400ms 涨到 6s,成本涨了 8 倍,准确率提升 0.4 个百分点——落在评测集本身的噪声范围内。

方向二:该花的地方抠。 另一个合同风险审查任务,工程师发现模型答得浅,于是往提示词里塞了一大段:「请一步步思考,先列出所有条款,再逐条分析风险等级,再……」。结果更差了:模型把这套流程当成了输出格式来满足,认认真真列了个清单,真正的推理反而被压缩掉了。

两件事的共同点是:把「要多聪明」这件事,错当成了选模型和写提示词的问题。 而在 2026 年,它已经是一个显式的、按请求可调的参数。

该省的地方花,该花的地方抠
同一个团队、同一个季度,两个方向都栽在同一个误判上

  1. 工单分类服务

    日均几十万次调用,归到 12 个类别

  2. 为提准确率开思考

    换成推理型配置

  3. 这类任务没有推理空间断点

    分类、路由、抽取都属于这一类

  4. 准确率只涨 0.4 个点

    落在评测集本身的噪声范围内

P99 延迟400ms6s
成本开思考之前涨了 8 倍
换来的准确率想要的收益+0.4 个点,落在噪声里
反方向那一个往提示词塞「请一步步思考」更差:模型认真列了清单,推理被压缩掉
两件事的共同点是:把「要多聪明」错当成了选模型和写提示词的问题。而在 2026 年,它已经是一个显式的、按请求可调的参数。

核心概念:先打比方,再给定义

Reasoning model(推理模型)/ Thinking(思考)。在给出答案之前,先生成一段内部推理,再基于这段推理作答。比喻:不是换了个更聪明的人,是允许同一个人先在草稿纸上算一遍。

思考 token。这段草稿也是生成出来的,计在输出侧,按输出价计费。这是成本模型里最容易被漏掉的一块。

budget_tokens(旧范式)。开发者手工给一个思考预算:这次允许你在草稿纸上写多少字。

Adaptive thinking(自适应思考)。模型自己判断这题要不要想、想多久。

Effort(努力档位)。一个高层旋钮:low / medium / high(默认)/ xhigh / max。你不再规定「写多少字草稿」,而是说「这件事值得你花多大力气」。

这一篇最需要祛魅的一点:截至 2026-08,「推理模型 vs 普通模型」这个二分基本消失了。 同一个模型既能秒答也能深想,区别在于你给多少 effort。面试里还在按「两类模型」组织答案的人,暴露的是知识停在 2025 年。

不是换个更聪明的人,是给张草稿纸
两个术语配套记:草稿计在输出侧,力气大小由一个档位定

草稿纸 · 先算一遍再答

允许同一个人先在纸上算一遍

草稿也是一笔一笔写出来的,纸钱照付 —— 这是成本模型里最容易漏掉的一块

对应
Reasoning / Thinking · 思考

给出答案之前先生成一段内部推理

这段推理计在输出侧,按输出价计费;模型自己判断要不要想,叫 adaptive thinking

思考 token按输出价计费Adaptive thinking
旋钮 · 这事值多大力气

从「写多少字草稿」改成「花多大力气」

旧范式是开发者手工给预算;新范式是模型自己判断这题要不要想、想多久

对应
Effort · 努力档位

一个高层旋钮,按请求可调

low / medium / high(默认)/ xhigh / max;它取代的是旧范式里手工设的 budget_tokens

output_config.effortbudget_tokenslow → max
这一篇最需要祛魅的一点:截至 2026-08,「推理模型 vs 普通模型」这个二分基本消失了 —— 同一个模型既能秒答也能深想。还在按「两类模型」组织答案的人,暴露的是知识停在 2025 年。

原理拆解

降一档,少的不只是思考 token
lowmax 五档,high 是默认档 —— 等价于你不传这个参数

  1. low分类、路由、抽取、子代理、高并发
  2. medium一般 Agent 任务的性价比档
  3. high默认档:复杂推理、难编码、主决策
  4. xhigh长程 Agent 与编码,部分模型可用
  5. max真正的前沿难题,边际收益小
省 token · 直接动手更常思考 · 想得更久
思考简单输入可能完全跳过更常思考、想得更久
工具调用合并成更少的调用做更多次调用
解释详略用更简短的话确认更多地解释计划
延迟与成本陡增

旧范式是手工设预算:2025 年靠「选普通模型还是推理模型」,再给 budget_tokens=10000 规定草稿写多少字;2026 年是一个模型 + thinking: adaptive + output_config.effort,档位一变,工具调用次数和解释详略一起跟着变。

两条硬约束:① effort 是行为信号,不是硬预算 —— 低档遇到足够难的问题模型仍然会思考,成本上限得靠别的机制;② max_tokens 才是硬顶,且思考和正文共享它,开高档不放大它的典型症状是草稿写得很爽、正文写到一半被截断,官方经验起点是从 6.4 万往上调。

在 Agent 场景里,effort 是成本的主旋钮,不是「思考深度」的小开关:你降一档,省下的不只是草稿纸,还有好几轮工具往返。所以降档必须重跑轨迹评测(Q3-21)。
原文示意
2025 范式:选模型 + 手工设预算
   普通模型  ──────────────────► 直接作答
   推理模型  ──► thinking(budget_tokens=10000) ──► 每次请求都想

2026 范式:一个模型 + 一个档位
   模型 ──► thinking: adaptive
            output_config.effort: low | medium | high | xhigh | max
              ├─ 低档:足够简单的输入,可能完全跳过思考
              ├─ 高档:更常思考、想得更久
              └─ 而且:工具调用次数、解释详略,一起跟着变

第三行是最容易被忽略、也最值钱的一点:effort 影响的是整个响应的 token 花费,不只是「想多久」。 官方明确说明,低档下模型会把多个操作合并成更少的工具调用、更直接地动手、用更简短的话确认;高档下则会更多地解释计划、做更多次工具调用。

这意味着一件事:在 Agent 场景里,effort 是成本的主旋钮,而不是一个「思考深度」的小开关。 你降一档,省下的不只是草稿纸,还有好几轮工具往返。这也解释了为什么降档必须重跑轨迹评测,而不能只看最终答案对不对(Q3-21 展开)。

两条硬约束

  1. effort 是行为信号,不是硬预算。 低档下遇到足够难的问题,模型仍然会思考,只是比高档想得少。所以它不能当成本硬上限用,成本上限得靠别的机制。
  2. max_tokens 才是硬顶,且思考和正文共享它。 开高档却不放大 max_tokens,典型症状是:草稿写得很爽,正文写到一半被截断。官方给的经验起点是从 6.4 万往上调。

为什么手写 CoT 可能是负优化

模型内部已经在跑推理了。你在提示词里规定推理路径,等于把它约束在你能想到的那一条路上——这和「给示例反而把模型限制在更窄的探索空间」是同一个机制。官方在自家系统提示词上的实践结论也一致:为新一代模型删掉了 80% 以上的规则型指令,编码评测无可测损失。

但这里必须划一条线,否则容易矫枉过正:

你在规定什么 2026 年的判断
推理过程(先做 A 再做 B 再检查 C) 多半是负优化,模型自己的路径通常更好
输出结构(返回哪些字段、什么格式) 仍然有效,而且应该交给结构化输出去硬保证(T1-2
领域知识与约束(你的口径、边界、只有你知道的事) 必须给,模型推不出来

一句话:别教它怎么想,要告诉它想什么、以及结果长什么样。

工程实践(截至 2026-08)

表 1:档位速查

档位 典型用途 备注
low 分类、路由、抽取、子代理、高并发 token 显著节省,简单输入可能完全跳过思考
medium 一般 Agent 任务的性价比档 常见的「降本第一步」
high 默认档;复杂推理、难编码、主决策 等价于不传这个参数
xhigh 长程 Agent 与编码(动辄几十分钟、百万级 token) 只在部分模型上可用
max 真正的前沿难题 成本大涨、边际收益小;在结构化输出这类任务上反而可能「想太多」

表 2:迁移与坑

说明
手工 thinking 被拒 截至 2026-08,Sonnet 5 上 thinking: {type: "enabled"} 直接返回 400(在 4.6 上已弃用)
高档不配大 max_tokens 思考吃掉输出预算,正文被截断
会话中途改 effort 该值会渲染进 prompt,一改就击穿 prompt 缓存;官方建议一个会话内保持恒定
Opus 5 上关不掉思考 thinking: disabled 配合 xhigh 或 max 档返回 400
换模型直接沿用旧档位 官方明确建议重新做一次 effort 扫描,不要照搬上一代的设置
用 temperature 求稳 这条路已经封了,见 T0-2

三段式判断(面试必备)

  • 解决什么:把「要多聪明」从「选哪个模型 + 提示词怎么写」,变成一个可按请求调整的显式旋钮,从而能在同一条工作流里分级消费算力。
  • 代价是什么:延迟与成本随档位陡增;档位参与缓存键,会话内不能乱动;更隐蔽的是它会改变工具调用行为,Agent 的执行轨迹跟着变,评测必须重跑。
  • 什么时候不该用高档:没有推理空间的任务(分类、路由、抽取、格式化);延迟敏感的实时交互;以及最该警惕的一种——用高档去掩盖检索质量或数据质量问题,那是在为错误的输入支付更贵的思考费。
旧的思考写法,在新模型上直接 400
截至 2026-08:两处返回 400、一处击穿缓存、一处正文被截断

迁移与坑
会发生什么怎么办
手工 thinking 被拒Sonnet 5 上 thinking: {type: "enabled"} 直接返回 400在 4.6 上已弃用;2026 范式走 thinking: adaptive + effort
高档不配大 max_tokens唯一的硬顶思考吃掉输出预算,正文写到一半被截断max_tokens 才是硬顶,官方经验起点从 6.4 万往上调
会话中途改 effort该值会渲染进 prompt,一改就击穿 prompt 缓存官方建议一个会话内保持恒定
Opus 5 上关不掉思考thinking: disabled 配合 xhigh 或 max 档返回 400这两档下没有「不思考」这个选项
换模型沿用旧档位照搬上一代扫出来的设置官方明确建议重新做一次 effort 扫描
用 temperature 求稳这条路已经封了见 T0-2
三段式判断(面试必备)
解决什么
把「要多聪明」从选模型加写提示词,变成按请求可调的旋钮,同一条工作流里分级消费算力
代价是什么
延迟与成本随档位陡增;档位参与缓存键,会话内不能乱动
更隐蔽的代价
它会改变工具调用行为,Agent 的执行轨迹跟着变 —— 评测必须重跑
什么时候别开高档
没有推理空间的任务(分类、路由、抽取、格式化);延迟敏感的实时交互
降本第一步
medium 是一般 Agent 任务的性价比档;low 下简单输入可能完全跳过思考
最该警惕的一种用法是拿高档去掩盖检索质量或数据质量问题 —— 那是在为错误的输入支付更贵的思考费。降档是常见的降本第一步,但换了模型就要重扫一遍,别照搬上一代的设置。

面试视角

问法变了:这个二分还成立吗
Q1-07 在头部 AI 公司一二面高频;平台组会顺着问到成本与路由

  1. 先讲机制先出草稿再作答,草稿计在输出侧
  2. 指出二分已合流adaptive + effort,这一句是拿分点
  3. 讲清 effort 管的范围整个响应的 token,包括工具调用次数
  4. 给反向判断哪些任务开了反而更差
  5. 落到分级策略哪些环节走低档、哪些走高档
只读过:这些回答会暴露你
  • 还在把模型分成「推理型」和「普通型」两类来选
  • 认为思考 token 不额外收费
  • 觉得「反正开了更聪明,那就都开」
  • 模型答得浅,第一反应是往提示词里加「请一步步思考」
  • 把 effort 当成本硬上限,以为低档就一定不想
真做过:这些细节骗不了人
  • 开口就点出二分合流:同一个模型,adaptive 加 effort
  • 知道思考 token 计在输出侧,并且真算进过成本
  • 说得出哪些任务开了更差:分类、路由、抽取、格式化
  • 答得浅先提档位,而不是绕着提示词想办法
  • 知道 effort 会改工具调用次数,降档后重跑轨迹评测
拿分点只有一句:二分已经合流。讲完机制别停,报出自己项目的分级策略 —— 哪些环节走低档、哪些走高档、这个划分是怎么用数据定下来的。配套题目:Q1-07Q1-09

面试官怎么问。 Q1-07 在头部 AI 公司的一二面是高频题,2026 年的问法已经从「什么是推理模型」变成了「这个二分还成立吗」。平台组和网关组会顺着问到成本与路由(Q6-08)。

答题结构建议

  1. 先讲机制(先出草稿再作答,草稿计在输出侧);
  2. 主动指出二分已经合流(adaptive + effort),这一句是拿分点;
  3. 讲清 effort 影响的是全部输出 token,包括工具调用;
  4. 给反向判断(什么任务开了更差);
  5. 落到自己的分级策略。

分水岭信号

  • 只读过:还在把模型分成「推理型」和「普通型」两类来选;认为思考 token 不额外收费;觉得「反正开了更聪明,那就都开」;模型答得浅时的第一反应是往提示词里加「请一步步思考」。
  • 真做过:知道思考 token 计在输出侧并算进过成本;能说出「模型答得浅应该提档位,而不是绕着提示词想办法」;知道 effort 会改变工具调用次数,因此降档后要重跑轨迹评测;能报出自己项目里哪些环节走低档、哪些走高档,以及这个划分是怎么用数据定下来的。

小结与延伸

一句话收口:2026 年你选的不再是「聪明的模型」和「快的模型」,而是同一个模型上「花多大力气」这一档;而这一档同时决定了延迟、成本和它会调多少次工具。

  • 关联题目:Q1-07Q1-09
  • 延伸:T0-2(采样参数与它的退场)、T1-1(few-shot 与 CoT 的有效边界)、T3-12(Agent 成本与延迟优化)、Q6-08(模型路由)

继续深入

本篇归属第 1 章「LLM 与 Prompt 基础」,去做这一章的题