什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?

Q4-10知识蒸馏与合规常见蒸馏合成数据拒绝采样服务条款合规小模型

谁在问:二面;toB / 金融 / 有法务约束的团队必问;成本敏感的业务负责人也会问

口语化问法

  • 蒸馏是什么?你们有没有用大模型的输出去训小模型?
  • 用 GPT 生成的数据训自己的模型,有没有什么问题?
  • 怎么把线上的大模型换成小模型来省钱?

考察意图

  1. 技术侧知不知道形态差异。白盒(有 logits)和黑盒(只有文本)的区别,以及黑盒必须配的那个动作。
  2. 知不知道教师的错误会被继承。这是"做过"和"听过"的分界——真做过的人一定会提过滤。
  3. 合规边界能不能说清。这是本题真正的区分点。大多数候选人对合规只有一句模糊的"好像不太行",能说清"允许什么、禁止什么、判据是什么"的极少。而这恰恰是 toB 团队最需要的能力。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

知识蒸馏是让一个强的大模型当"老师",把能力传给一个小的"学生"模型。最常见的做法是用大模型对一批输入生成高质量输出,把这些输出当作训练数据去 SFT 一个小模型。

好处是小模型推理成本低、延迟小,在特定任务上能接近大模型的效果。

要注意的:生成的数据质量要过滤,不能直接全用;小模型的能力上限受任务复杂度限制;另外用商业模型的输出训模型可能有服务条款上的限制,需要看清楚。

三个点都碰到了,及格。但"需要看清楚"是把问题推回去了,追问"具体限制什么"会答不上来。

90

90 分答案(有生产经验的回答)

技术侧,先分清两种形态:

  • 白盒蒸馏:能拿到教师的完整概率分布(logits),用 KL 散度让学生的分布逼近教师。信息量最大——学生不只学"答案是什么",还学"教师对各个候选有多确信"。前提是教师权重在手,只有开源权重模型能这么做。
  • 黑盒蒸馏:只能拿到教师输出的文本,当作 SFT 的标准答案。调 API 的场景只能这么做,也是绝大多数团队的实际形态。

黑盒蒸馏有两个动作必须做:

  1. 拒绝采样过滤(rejection sampling):教师对同一输入采样 N 次,用规则、判分器或多数投票筛掉错的,只留通过验证的当训练数据。不做过滤直接拿教师输出训,等于把教师的错误率原样烧进学生的权重——而且学生还没有教师的纠错能力,错误会被放大。
  2. 认清学生的能力上限就是教师。想让学生超过教师,蒸馏做不到,得走可验证奖励那一档。

分布也要注意:蒸馏数据的输入分布应该来自你的线上真实请求,而不是让教师自由发挥造一批。用教师自造的输入训出来的学生,在你的线上分布上会水土不服。

合规侧(截至 2026-08,条款易变,正式项目务必核对原文):

厂商 明确允许 明确禁止
OpenAI Output 的所有权归用户(条款把权利让渡给用户) 用 Output 开发与 OpenAI 竞争的模型;程序化批量抽取 Output;反向工程
Anthropic 用输出训练不与 Anthropic 竞争的模型。官方举例:情感分析、内容分类、摘要、信息抽取、语义检索、异常检测 训练通用聊天机器人、开放式文本生成模型;把 Output 当训练目标去复刻;反向工程训练方法

一句话判断口径:

风险不在"用没用大模型造数据",在"造出来的东西是不是同类通用模型"。 训一个客服意图分类的小模型 → 基本安全;训"我们自己的通用助手" → 踩线。

最容易答错的一点:所有权和用途是两件事。 OpenAI 的条款明确写了输出归你,但同一份条款也明确禁止拿它训竞品。如果一个人用"输出的版权是我们的"来论证"所以我们可以拿去训模型",这是一个可以当场判定的知识缺口。

补两条背景:法律上的追责路径主要是服务条款违约 + 商业秘密,而不是著作权(模型输出的版权地位本身还不清晰);开源权重模型另算——Apache 2.0 系(如 Qwen)基本没有这类限制,Llama 系有自己的社群许可条款要单独看。所以合规上最稳的做法是用宽松许可的开源权重模型当教师。

成本侧,蒸馏在 2026 年是微调最站得住的理由。 它不依赖"微调让模型更强"这个已经站不住的假设,只依赖"同样的效果我用更小的模型达成"。高 QPS 场景下这能省掉一个数量级的成本,同时压低首 token 延迟。

追问链

图 1 · 五层追问树:面试官会往哪儿挖
前三问考蒸馏怎么做,后两问考你敢不敢把合规说到判据

  1. 白盒和黑盒蒸馏差在哪?你们用的哪种?

    期望白盒有 logits,可用 KL 对齐分布,信息量大但要教师权重,还能做中间层特征对齐(hidden states / attention);黑盒只有文本,退化成 SFT调 API 只能黑盒
    信号说出「白盒学的是分布,黑盒学的是采样出来的一个点」→ 理解到位;分不清两者 → 只看过科普
  2. 教师模型自己也会答错,这些错怎么办?

    期望必须做拒绝采样:多次采样 + 验证(规则 / 判分器 / 自洽性投票),只留通过的;有 ground truth 的直接对答案,没有的用一致性投票或另一个模型交叉校验。不过滤等于把教师的错误率烧进学生,而学生的纠错能力比教师更弱
    信号主动说「要做拒绝采样」→ 基本可判定真做过蒸馏;答「教师是大模型,一般不会错」→ 没做过
  3. 学生模型有可能超过教师吗?

    期望纯蒸馏不行,上限就是教师。两个例外:① 窄任务上学生可以超过教师的平均表现 —— 教师是通才、学生是专才,且拒绝采样把教师的最好表现筛了出来,相当于拿 best-of-N 的教师当老师;② 想真正突破上限得走可验证奖励那一档
    信号只答「不能」→ 正确但浅;说出「拒绝采样蒸的是 best-of-N 教师,所以窄任务上能超过教师平均水平」→ 很强的信号
  4. 合规上到底哪些能做哪些不能做?

    期望判据是训出来的是不是同类通用模型:分类、抽取、摘要、语义检索这类非竞争用途允许(Anthropic 条款原文举例),训通用助手禁止。所有权 ≠ 使用权OpenAI 把 Output 判给你,同条款又禁止拿它训竞品。追责走条款违约 + 商业秘密而非著作权;开源权重是更稳的教师
    信号报得出「允许什么」的具体清单 → 真读过条款;用「输出版权归我们所以能随便用」论证 → 直接判为知识缺口
  5. 法务问:「用 GPT 生成的数据训出来的模型,能商用吗?能对外说自研吗?」

    期望拆成三问,混着答必错:① 训练合不合条款 —— 非竞争用途允许、通用助手禁止,给判据别踢回法务;② 能否商用 —— ① 过关即无障碍,要留证据链(用途 + 能力范围文档);③ 怎么对外说 —— 「完全自研」不诚实,2026 年验得出痕迹,稳妥说法「基于开源基座 + 自有数据训练」→ 解法:换 Apache 2.0 系开源权重当教师重跑,差距可接受即归零
    信号答「应该没问题吧,输出是我们的」→ 本题最主要的淘汰点;提「换开源权重教师重跑,把法律问题变成技术问题」→ 最强信号
技术只占一半的一道题:第 2 层(拒绝采样)分技术真伪,后两层分合规深浅 —— 多数人对合规只有一句「好像不太行」,说得清「允许什么、禁止什么、判据是什么」的极少。

评分要点

  1. 能说清蒸馏是什么,以及最常见的"大模型造数据训小模型"形态
  2. 能区分白盒与黑盒蒸馏
  3. 知道必须做拒绝采样过滤,并说得出为什么
  4. 知道学生的能力上限是教师
  5. 知道蒸馏数据的输入分布应来自线上
  6. 能说出合规判据:"是不是同类通用模型"
  7. 知道所有权 ≠ 使用权
  8. (加分)知道开源权重模型是更稳的教师选择
  9. (加分)能说出蒸馏是 2026 年最站得住的微调理由(成本压缩)

常见错误

"输出的版权是我们的,所以能随便用"混淆所有权与使用权,可当场判定的知识缺口。
"让 GPT 生成一批数据训一下就行"没有过滤、没有分布意识、没有合规意识。
"教师是大模型,输出质量有保证"没做过。教师的错误率会被原样继承并放大。
"蒸馏之后小模型能超过大模型"泛泛地说是错的;只有在窄任务 + 拒绝采样的条件下才成立,且要说清条件。
"合规这块得问法务"含糊回答的典型形态:把判断责任推给别人。 技术方案的合规判据应该由方案设计者先给出。
分不清白盒黑盒说明只在概念层面了解过。
全程不提成本蒸馏的核心动机就是成本,不提说明没在真实场景里用过。

关联学习