推理模型(thinking 类)和普通模型有什么区别?什么任务值得用?

Q1-07推理模型与思考档位高频新增推理模型思考effort成本延迟模型路由

谁在问:头部 AI 公司一二面;平台组 / 网关组会往成本方向追

口语化问法

  • 推理模型和普通模型有什么区别?你们哪些场景用了?
  • 思考那部分 token 收不收费?收在哪一边?
  • 模型在一个复杂问题上答得很浅,你会怎么办?

考察意图

这题在 2026 年已经从概念题变成了时效题。面试官在看三件事:

  1. 你的知识停在哪一年——还在按「两类模型」组织答案,说明停在 2025;
  2. 你有没有算过账——思考 token 计在输出侧,是很多人成本模型里漏掉的一块;
  3. 你的反向判断——什么任务开了思考反而更差,这是有没有真跑过评测的直接证据。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

推理模型在给出答案之前,会先生成一段内部推理过程,再基于这段推理作答,在数学、复杂编码、多步分析这类需要多步推导的任务上明显更好。代价是延迟高、成本高——那段思考内容也是生成出来的,计在输出侧按输出价计费。

值得用的场景:复杂推理、多约束规划、疑难排查。不值得用的:简单分类、格式转换、实时性要求高的交互。

90

90 分答案(有生产经验的回答)

在上面基础上加三层:

第一,截至 2026-08,「推理模型 vs 普通模型」这个二分基本已经合流了。 现在是同一个模型上的自适应思考加一个 effort 档位(low / medium / high / xhigh / max),模型自己决定要不要想、想多久,你只给「这件事值得花多大力气」。手工设思考预算的老写法在新一代模型上已经被拒——比如 Sonnet 5 上传 thinking: {type: "enabled"} 直接返回 400。

第二,effort 影响的是整个响应的 token 花费,不只是思考。 官方明确说明:低档下模型会把多个操作合并成更少的工具调用、更直接地动手;高档下会更多解释计划、做更多次工具调用。这意味着在 Agent 场景里,effort 是成本的主旋钮,不是一个思考深度的小开关。它也带来一个后果:降档之后必须重跑轨迹评测,不能只看最终答案对不对,因为执行路径已经变了。

第三,我的分级策略。 分类、路由、抽取、子代理走 low;一般 Agent 步骤走 medium;主决策和难编码留 high 及以上。这个划分不是拍脑袋,是在自己的评测集上做了一遍 effort 扫描定下来的——而且换模型之后要重新扫,官方也建议不要照搬上一代的设置。另外高档必须配大 max_tokens,否则思考吃掉预算、正文被截断在半路。

追问链

图 1 · 五层追问树:面试官会往哪儿挖
五问围着同一根旋钮:effort 既是深度也是成本

  1. 思考 token 计在哪一边?对 max_tokens 有什么影响?

    期望计在输出侧、按输出价计费 —— 输出价通常是输入价的数倍,这是成本估算最容易漏的一块;max_tokens 是思考加正文的共同硬顶,开高档不放大它,典型症状就是答案被截断
    信号知道「思考和正文共享 max_tokens」 → 一定被截断过一次;只回答「会更贵」 → 没细算过
  2. 「推理模型 vs 普通模型」这个二分在 2026 年还成立吗?

    期望基本不成立:自适应思考 + effort 五档lowmax)取代了「选推理模型 + 设 budget_tokens」;加分项是知道 effort 值会渲染进 prompt,同一会话内改 effort 会击穿 prompt 缓存,官方建议会话内保持恒定
    信号本题最强的时效筛:仍按两类模型做选型 → 知识停在 2025;顺带说出「改 effort 击穿缓存」 → 真读过文档不是二手总结
  3. 有没有什么任务,开了思考反而更差?

    期望没有推理空间的那些:分类、路由、抽取、格式转换 —— 思考只加延迟和成本,还可能「想出」多余解释污染输出结构;延迟敏感的实时交互也是;结构化输出上档位过高会过度思考。最该警惕的是用高档掩盖检索或数据质量问题,等于为错误输入付更贵的思考费
    信号举得出「用高档掩盖数据问题」这类反模式 → 真做过成本复盘;只会说「简单任务不用开」 → 常识级回答
  4. 模型在复杂问题上答得很浅,你是加提示词还是提档位?

    期望提档位,官方判断很直接:推理太浅就提 effort,别绕着提示词想办法。塞「请一步步思考,先 A 再 B」在新一代模型上常是负优化 —— 内部已在推理,规定路径把它限死在你想到的那条,还容易被当成输出格式来满足。界线是规定过程有害、规定结构有效、给领域约束必须
    信号划得出「别教它怎么想,要告诉它想什么」 → 理解了 2026 的范式;第一反应加「请深入思考」 → 停在 2023 年的提示词技巧
  5. Agent 服务上线后成本超预算 3 倍,业务明确不接受降质,你怎么砍?

    期望先按环节拆 token,别猜:多是「工具结果累积 × 高档位」 → ② 分环节降档:子代理/分类/路由走 low,主决策留 high → ③ 削工具结果(永久居民,成本按剩余轮次复利;代价是伤缓存)→ ④ 修缓存:前缀前置、断点落恒定块末尾、effort 恒定 → ⑤ 简单子任务走小模型 → ⑥ 最后才谈减功能。降档会改工具调用次数,必须重跑轨迹评测
    信号第一句是「先按环节拆 token,别猜」、且知道降档同时降了工具调用次数所以要看轨迹 → 优秀;直接跳「换个便宜模型」 → 不量化也不评估影响面
这是道时效题,2025 的答案在这儿要扣分:第 2 层筛你的知识停在哪一年,第 5 层筛你有没有按环节拆过 token、降完档记不记得重跑轨迹评测。

评分要点

  1. 说清推理模型的机制:先生成推理再作答
  2. 明确思考 token 计在输出侧、与正文共享 max_tokens
  3. 知道 2026 年二分已合流为自适应思考 + effort 档位
  4. 知道 effort 影响全部输出 token,包括工具调用次数
  5. 能给出反向判断:什么任务开了反而更差
  6. 知道「答得浅提档位,而不是加提示词」
  7. 能划清「规定过程」与「规定结构」的界线
  8. 降本时先量化拆分、分环节降档,并重跑轨迹评测

常见错误

仍把模型分成「推理型」和「普通型」两类来做选型。
认为思考 token 不额外收费,或说不清计在哪一侧。
觉得「反正开了更聪明,那就都开」。
模型答得浅时,第一反应是往提示词里加「请一步步思考」。
谈降本只会说「换便宜的模型」,不做环节拆分。
不知道降档会改变工具调用行为,评测只看最终答案。
含糊标志词:「推理模型就是更强的模型」「开了肯定更准」「这个按官方推荐设就行」。

关联学习