CoT 为什么有效?推理模型时代还需要手写 CoT 吗?

Q1-09CoT 与推理常见新增CoT思维链推理模型effortself-consistency

谁在问:二面;头部 AI 公司会拿它测知识时效

口语化问法

  • 思维链为什么能提升效果?机制上讲讲。
  • 现在的模型自己就会推理了,你还写『请一步步思考』吗?
  • 你怎么知道模型是怎么得出这个结论的?

考察意图

一道典型的时效题。同样的问题,2023 年的标准答案和 2026 年的标准答案是相反的,所以它非常适合区分「读过那篇经典论文」和「跟上了当前实践」。

面试官在看三点:机制解释是否准确;反向判断是否成立(什么时候不该写);以及你能不能把「让它更准」和「让我能看懂」这两个目的分开——这是很多人混在一起的地方。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

CoT 是让模型把中间推理步骤显式写出来再给答案。它有效的原因是:把一个「一步到位」的映射拆成多步,等于给了模型更多的计算步数去逼近答案;同时中间结果被写进上下文,后续步骤可以引用,减少了一次性推错的概率。

在推理模型上,这类推理已经内置在模型里了,所以不需要再手写「请一步步思考」。

90

90 分答案(有生产经验的回答)

在上面基础上加三层:

第一,手写 CoT 在 2026 年不只是「没必要」,而是可能有害**。** 模型内部已经在跑推理,你在提示词里规定路径,等于把它限制在你能想到的那一条上。更常见的失败形态是:模型把这套流程当成输出格式来满足——认认真真列了个条理清晰的清单,看起来很像样,但真正的推理被挤走了。我们在合同审查任务上就撞过这个,加了流程说明之后评测反而掉了。

第二,要划清三条线,否则容易矫枉过正。 规定推理过程(先 A 再 B 再检查 C)多半负优化;规定输出结构(要求返回哪些字段)仍然有效,而且应该交给结构化输出去硬保证;给领域约束和判断口径(只有你知道的事)则是必须的。一句话:别教它怎么想,要告诉它想什么、以及结果长什么样。

第三,模型答得浅的正确动作是提档位,不是加提示词。 官方给的判断很直接:推理太浅应该提高 effort,而不是绕着提示词想办法。这也把「提示词优化」的边界划清楚了——它解决不了推理深度问题。

至于我为什么有时还会要求输出 reasoning 字段:那不是为了让它更准,是为了可观测和可判分。这两个目的必须分开,混在一起就会得出「加了 reasoning 效果就该变好」的错误预期。

追问链

图 1 · 五层追问树:面试官会往哪儿挖
同一个问题,2023 的标准答案和 2026 的标准答案是相反的

  1. CoT 为什么有效?机制上说。

    期望额外的计算步数 + 中间结果显式写进上下文供后续引用,把一步映射拆成多步;在早期模型上这是真实收益,本质是用生成长度换推理深度
    信号说得出「用生成长度换计算深度」 → 理解了机制;只说「像人做题写步骤」 → 停在类比层,撑不起后面的反向判断
  2. 那推理模型时代还要不要手写 CoT?

    期望不要写规定路径的那种 —— 内部推理已经存在,外部规定会限制探索空间,还容易被当成输出格式去满足。加分项是关联官方同源实践:为新一代模型删掉 80% 以上的规则型系统提示词,编码评测无可测损失
    信号仍坚持「加上总没坏处」 → 知识停在 2023;说得出「它会把流程当格式满足」这个具体失败形态 → 自己撞过
  3. 如果不写 CoT,我怎么知道它是怎么想的?

    期望把两个目的分开:提升效果靠档位和上下文,可观测靠输出结构(依据字段、引用来源)和 trace;要 reasoning 字段是为了让人和评测能读懂、能判分,不是为了让它更准。还要清醒 —— 模型写出的推理是事后表述,能辅助排查,不能当因果证据
    信号指出「输出的推理不等于真实推理过程」 → 有评测经验;把 reasoning 字段当成效果手段 → 两个目的没分开
  4. self-consistency(多次采样投票)还有用吗?代价是什么?

    期望思路仍有效 —— 多条独立路径投票能压掉单次推理的偶然错误;代价是成本按采样次数翻倍、延迟上升。2026 的现实约束是它需要采样多样性,而新一代模型上 temperature 已经调不动,只能靠多次独立请求制造差异,还得评估这种差异够不够
    信号指出「温度调不动了,靠多次独立请求」这个当前约束 → 真在新模型上试过;只会背 self-consistency 定义 → 看论文没落地
  5. 合同审查在难样本上表现不稳,产品让你「把提示词优化一下」,你怎么办?

    期望先拒绝这个归因、给替代路径:挑难样本归因 → ② 三类对三个动作:信息没给全 → 补上下文修检索;深度不够 → 提 effort,不是加「请深入思考」;标准有分歧 → 是评测集的病不是模型的,先写 rubric 否则打移动靶 → ③ 提示词给得了口径,给不了深度 → ④ 改动只在难样本子集跑,十几条涨两点多半噪声 → ⑤ 收口成有基线有归因分类的循环
    信号把「标准本身有分歧」列为一种可能并归到评测集问题 → 做过人工标注;直接改措辞、或只回一句「提示词解决不了」 → 差
面试官要的是你把两个目的分没分开 —— 让它更准,和让我看懂。第 2 层筛知识时效,第 5 层筛你能不能把「标准有分歧」认成评测集的病。

评分要点

  1. 能从机制上解释 CoT(额外计算步 + 中间结果可引用)
  2. 明确手写 CoT 在推理模型上可能是负优化
  3. 能说出「把流程当输出格式满足」这个具体失败形态
  4. 划清「规定过程 / 规定结构 / 给领域约束」三条线
  5. 知道答得浅应提 effort,而非加提示词
  6. 把「提升效果」和「可观测」两个目的分开
  7. 知道输出的推理不等于真实推理过程
  8. 面对模糊的「优化提示词」诉求,能先做归因分类

常见错误

认为「请一步步思考」在任何模型上都是免费的增益。
解释 CoT 只停在「像人写解题步骤」,推不出任何反向判断。
把要求输出 reasoning 字段当成提升准确率的手段。
把模型写出来的推理当成它真实的思考过程,据此下结论。
遇到效果不稳,唯一动作就是改提示词措辞,没有归因步骤。
含糊标志词:「加上总没坏处」「让它思考得更严谨一点」「多写几句引导」。

关联学习