这篇学完你能回答什么
- 推理模型和普通模型有什么区别?这个二分在 2026 年还成立吗?
- 思考 token 计在哪边?它和 max_tokens、和成本是什么关系?
- 模型答得浅,你该加提示词还是提档位?
从一个真实故障讲起
同一个团队,同一个季度,两个方向都犯了错。
方向一:该省的地方花。 一个工单分类服务,日均几十万次调用,任务是把工单归到 12 个类别里。为了「提升准确率」,团队把它换成了推理型配置、开了思考。上线后:P99 延迟从 400ms 涨到 6s,成本涨了 8 倍,准确率提升 0.4 个百分点——落在评测集本身的噪声范围内。
方向二:该花的地方抠。 另一个合同风险审查任务,工程师发现模型答得浅,于是往提示词里塞了一大段:「请一步步思考,先列出所有条款,再逐条分析风险等级,再……」。结果更差了:模型把这套流程当成了输出格式来满足,认认真真列了个清单,真正的推理反而被压缩掉了。
两件事的共同点是:把「要多聪明」这件事,错当成了选模型和写提示词的问题。 而在 2026 年,它已经是一个显式的、按请求可调的参数。
工单分类服务
日均几十万次调用,归到 12 个类别
为提准确率开思考
换成推理型配置
这类任务没有推理空间断点
分类、路由、抽取都属于这一类
准确率只涨 0.4 个点
落在评测集本身的噪声范围内
核心概念:先打比方,再给定义
Reasoning model(推理模型)/ Thinking(思考)。在给出答案之前,先生成一段内部推理,再基于这段推理作答。比喻:不是换了个更聪明的人,是允许同一个人先在草稿纸上算一遍。
思考 token。这段草稿也是生成出来的,计在输出侧,按输出价计费。这是成本模型里最容易被漏掉的一块。
budget_tokens(旧范式)。开发者手工给一个思考预算:这次允许你在草稿纸上写多少字。
Adaptive thinking(自适应思考)。模型自己判断这题要不要想、想多久。
Effort(努力档位)。一个高层旋钮:low / medium / high(默认)/ xhigh / max。你不再规定「写多少字草稿」,而是说「这件事值得你花多大力气」。
这一篇最需要祛魅的一点:截至 2026-08,「推理模型 vs 普通模型」这个二分基本消失了。 同一个模型既能秒答也能深想,区别在于你给多少 effort。面试里还在按「两类模型」组织答案的人,暴露的是知识停在 2025 年。
允许同一个人先在纸上算一遍
草稿也是一笔一笔写出来的,纸钱照付 —— 这是成本模型里最容易漏掉的一块
给出答案之前先生成一段内部推理
这段推理计在输出侧,按输出价计费;模型自己判断要不要想,叫 adaptive thinking
从「写多少字草稿」改成「花多大力气」
旧范式是开发者手工给预算;新范式是模型自己判断这题要不要想、想多久
一个高层旋钮,按请求可调
low / medium / high(默认)/ xhigh / max;它取代的是旧范式里手工设的 budget_tokens
原理拆解
low 到 max 五档,high 是默认档 —— 等价于你不传这个参数- low分类、路由、抽取、子代理、高并发
- medium一般 Agent 任务的性价比档
- high默认档:复杂推理、难编码、主决策
- xhigh长程 Agent 与编码,部分模型可用
- max真正的前沿难题,边际收益小
旧范式是手工设预算:2025 年靠「选普通模型还是推理模型」,再给 budget_tokens=10000 规定草稿写多少字;2026 年是一个模型 + thinking: adaptive + output_config.effort,档位一变,工具调用次数和解释详略一起跟着变。
两条硬约束:① effort 是行为信号,不是硬预算 —— 低档遇到足够难的问题模型仍然会思考,成本上限得靠别的机制;② max_tokens 才是硬顶,且思考和正文共享它,开高档不放大它的典型症状是草稿写得很爽、正文写到一半被截断,官方经验起点是从 6.4 万往上调。
2025 范式:选模型 + 手工设预算
普通模型 ──────────────────► 直接作答
推理模型 ──► thinking(budget_tokens=10000) ──► 每次请求都想
2026 范式:一个模型 + 一个档位
模型 ──► thinking: adaptive
output_config.effort: low | medium | high | xhigh | max
├─ 低档:足够简单的输入,可能完全跳过思考
├─ 高档:更常思考、想得更久
└─ 而且:工具调用次数、解释详略,一起跟着变第三行是最容易被忽略、也最值钱的一点:effort 影响的是整个响应的 token 花费,不只是「想多久」。 官方明确说明,低档下模型会把多个操作合并成更少的工具调用、更直接地动手、用更简短的话确认;高档下则会更多地解释计划、做更多次工具调用。
这意味着一件事:在 Agent 场景里,effort 是成本的主旋钮,而不是一个「思考深度」的小开关。 你降一档,省下的不只是草稿纸,还有好几轮工具往返。这也解释了为什么降档必须重跑轨迹评测,而不能只看最终答案对不对(Q3-21 展开)。
两条硬约束
- effort 是行为信号,不是硬预算。 低档下遇到足够难的问题,模型仍然会思考,只是比高档想得少。所以它不能当成本硬上限用,成本上限得靠别的机制。
max_tokens才是硬顶,且思考和正文共享它。 开高档却不放大max_tokens,典型症状是:草稿写得很爽,正文写到一半被截断。官方给的经验起点是从 6.4 万往上调。
为什么手写 CoT 可能是负优化
模型内部已经在跑推理了。你在提示词里规定推理路径,等于把它约束在你能想到的那一条路上——这和「给示例反而把模型限制在更窄的探索空间」是同一个机制。官方在自家系统提示词上的实践结论也一致:为新一代模型删掉了 80% 以上的规则型指令,编码评测无可测损失。
但这里必须划一条线,否则容易矫枉过正:
| 你在规定什么 | 2026 年的判断 |
|---|---|
| 推理过程(先做 A 再做 B 再检查 C) | 多半是负优化,模型自己的路径通常更好 |
| 输出结构(返回哪些字段、什么格式) | 仍然有效,而且应该交给结构化输出去硬保证(T1-2) |
| 领域知识与约束(你的口径、边界、只有你知道的事) | 必须给,模型推不出来 |
一句话:别教它怎么想,要告诉它想什么、以及结果长什么样。
工程实践(截至 2026-08)
表 1:档位速查
| 档位 | 典型用途 | 备注 |
|---|---|---|
| low | 分类、路由、抽取、子代理、高并发 | token 显著节省,简单输入可能完全跳过思考 |
| medium | 一般 Agent 任务的性价比档 | 常见的「降本第一步」 |
| high | 默认档;复杂推理、难编码、主决策 | 等价于不传这个参数 |
| xhigh | 长程 Agent 与编码(动辄几十分钟、百万级 token) | 只在部分模型上可用 |
| max | 真正的前沿难题 | 成本大涨、边际收益小;在结构化输出这类任务上反而可能「想太多」 |
表 2:迁移与坑
| 坑 | 说明 |
|---|---|
| 手工 thinking 被拒 | 截至 2026-08,Sonnet 5 上 thinking: {type: "enabled"} 直接返回 400(在 4.6 上已弃用) |
| 高档不配大 max_tokens | 思考吃掉输出预算,正文被截断 |
| 会话中途改 effort | 该值会渲染进 prompt,一改就击穿 prompt 缓存;官方建议一个会话内保持恒定 |
| Opus 5 上关不掉思考 | thinking: disabled 配合 xhigh 或 max 档返回 400 |
| 换模型直接沿用旧档位 | 官方明确建议重新做一次 effort 扫描,不要照搬上一代的设置 |
| 用 temperature 求稳 | 这条路已经封了,见 T0-2 |
三段式判断(面试必备)
- 解决什么:把「要多聪明」从「选哪个模型 + 提示词怎么写」,变成一个可按请求调整的显式旋钮,从而能在同一条工作流里分级消费算力。
- 代价是什么:延迟与成本随档位陡增;档位参与缓存键,会话内不能乱动;更隐蔽的是它会改变工具调用行为,Agent 的执行轨迹跟着变,评测必须重跑。
- 什么时候不该用高档:没有推理空间的任务(分类、路由、抽取、格式化);延迟敏感的实时交互;以及最该警惕的一种——用高档去掩盖检索质量或数据质量问题,那是在为错误的输入支付更贵的思考费。
| 坑 | 会发生什么 | 怎么办 |
|---|---|---|
| 手工 thinking 被拒 | Sonnet 5 上 thinking: {type: "enabled"} 直接返回 400 | 在 4.6 上已弃用;2026 范式走 thinking: adaptive + effort |
| 高档不配大 max_tokens唯一的硬顶 | 思考吃掉输出预算,正文写到一半被截断 | max_tokens 才是硬顶,官方经验起点从 6.4 万往上调 |
| 会话中途改 effort | 该值会渲染进 prompt,一改就击穿 prompt 缓存 | 官方建议一个会话内保持恒定 |
| Opus 5 上关不掉思考 | thinking: disabled 配合 xhigh 或 max 档返回 400 | 这两档下没有「不思考」这个选项 |
| 换模型沿用旧档位 | 照搬上一代扫出来的设置 | 官方明确建议重新做一次 effort 扫描 |
| 用 temperature 求稳 | 这条路已经封了 | 见 T0-2 |
- 解决什么
- 把「要多聪明」从选模型加写提示词,变成按请求可调的旋钮,同一条工作流里分级消费算力
- 代价是什么
- 延迟与成本随档位陡增;档位参与缓存键,会话内不能乱动
- 更隐蔽的代价
- 它会改变工具调用行为,Agent 的执行轨迹跟着变 —— 评测必须重跑
- 什么时候别开高档
- 没有推理空间的任务(分类、路由、抽取、格式化);延迟敏感的实时交互
- 降本第一步
- medium 是一般 Agent 任务的性价比档;low 下简单输入可能完全跳过思考
面试视角
- 先讲机制先出草稿再作答,草稿计在输出侧
- 指出二分已合流adaptive + effort,这一句是拿分点
- 讲清 effort 管的范围整个响应的 token,包括工具调用次数
- 给反向判断哪些任务开了反而更差
- 落到分级策略哪些环节走低档、哪些走高档
- 还在把模型分成「推理型」和「普通型」两类来选
- 认为思考 token 不额外收费
- 觉得「反正开了更聪明,那就都开」
- 模型答得浅,第一反应是往提示词里加「请一步步思考」
- 把 effort 当成本硬上限,以为低档就一定不想
- 开口就点出二分合流:同一个模型,adaptive 加 effort
- 知道思考 token 计在输出侧,并且真算进过成本
- 说得出哪些任务开了更差:分类、路由、抽取、格式化
- 答得浅先提档位,而不是绕着提示词想办法
- 知道 effort 会改工具调用次数,降档后重跑轨迹评测
Q1-07、Q1-09。面试官怎么问。 Q1-07 在头部 AI 公司的一二面是高频题,2026 年的问法已经从「什么是推理模型」变成了「这个二分还成立吗」。平台组和网关组会顺着问到成本与路由(Q6-08)。
答题结构建议
- 先讲机制(先出草稿再作答,草稿计在输出侧);
- 主动指出二分已经合流(adaptive + effort),这一句是拿分点;
- 讲清 effort 影响的是全部输出 token,包括工具调用;
- 给反向判断(什么任务开了更差);
- 落到自己的分级策略。
分水岭信号
- 只读过:还在把模型分成「推理型」和「普通型」两类来选;认为思考 token 不额外收费;觉得「反正开了更聪明,那就都开」;模型答得浅时的第一反应是往提示词里加「请一步步思考」。
- 真做过:知道思考 token 计在输出侧并算进过成本;能说出「模型答得浅应该提档位,而不是绕着提示词想办法」;知道 effort 会改变工具调用次数,因此降档后要重跑轨迹评测;能报出自己项目里哪些环节走低档、哪些走高档,以及这个划分是怎么用数据定下来的。
小结与延伸
继续深入
本篇归属第 1 章「LLM 与 Prompt 基础」,去做这一章的题。