什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?
谁在问:二面;toB / 金融 / 有法务约束的团队必问;成本敏感的业务负责人也会问
口语化问法
- 蒸馏是什么?你们有没有用大模型的输出去训小模型?
- 用 GPT 生成的数据训自己的模型,有没有什么问题?
- 怎么把线上的大模型换成小模型来省钱?
考察意图
- 技术侧知不知道形态差异。白盒(有 logits)和黑盒(只有文本)的区别,以及黑盒必须配的那个动作。
- 知不知道教师的错误会被继承。这是"做过"和"听过"的分界——真做过的人一定会提过滤。
- 合规边界能不能说清。这是本题真正的区分点。大多数候选人对合规只有一句模糊的"好像不太行",能说清"允许什么、禁止什么、判据是什么"的极少。而这恰恰是 toB 团队最需要的能力。
参考答案
60 分答案(及格线)
知识蒸馏是让一个强的大模型当"老师",把能力传给一个小的"学生"模型。最常见的做法是用大模型对一批输入生成高质量输出,把这些输出当作训练数据去 SFT 一个小模型。
好处是小模型推理成本低、延迟小,在特定任务上能接近大模型的效果。
要注意的:生成的数据质量要过滤,不能直接全用;小模型的能力上限受任务复杂度限制;另外用商业模型的输出训模型可能有服务条款上的限制,需要看清楚。
三个点都碰到了,及格。但"需要看清楚"是把问题推回去了,追问"具体限制什么"会答不上来。
90 分答案(有生产经验的回答)
技术侧,先分清两种形态:
- 白盒蒸馏:能拿到教师的完整概率分布(logits),用 KL 散度让学生的分布逼近教师。信息量最大——学生不只学"答案是什么",还学"教师对各个候选有多确信"。前提是教师权重在手,只有开源权重模型能这么做。
- 黑盒蒸馏:只能拿到教师输出的文本,当作 SFT 的标准答案。调 API 的场景只能这么做,也是绝大多数团队的实际形态。
黑盒蒸馏有两个动作必须做:
- 拒绝采样过滤(rejection sampling):教师对同一输入采样 N 次,用规则、判分器或多数投票筛掉错的,只留通过验证的当训练数据。不做过滤直接拿教师输出训,等于把教师的错误率原样烧进学生的权重——而且学生还没有教师的纠错能力,错误会被放大。
- 认清学生的能力上限就是教师。想让学生超过教师,蒸馏做不到,得走可验证奖励那一档。
分布也要注意:蒸馏数据的输入分布应该来自你的线上真实请求,而不是让教师自由发挥造一批。用教师自造的输入训出来的学生,在你的线上分布上会水土不服。
合规侧(截至 2026-08,条款易变,正式项目务必核对原文):
| 厂商 | 明确允许 | 明确禁止 |
|---|---|---|
| OpenAI | Output 的所有权归用户(条款把权利让渡给用户) | 用 Output 开发与 OpenAI 竞争的模型;程序化批量抽取 Output;反向工程 |
| Anthropic | 用输出训练不与 Anthropic 竞争的模型。官方举例:情感分析、内容分类、摘要、信息抽取、语义检索、异常检测 | 训练通用聊天机器人、开放式文本生成模型;把 Output 当训练目标去复刻;反向工程训练方法 |
一句话判断口径:
风险不在"用没用大模型造数据",在"造出来的东西是不是同类通用模型"。 训一个客服意图分类的小模型 → 基本安全;训"我们自己的通用助手" → 踩线。
最容易答错的一点:所有权和用途是两件事。 OpenAI 的条款明确写了输出归你,但同一份条款也明确禁止拿它训竞品。如果一个人用"输出的版权是我们的"来论证"所以我们可以拿去训模型",这是一个可以当场判定的知识缺口。
补两条背景:法律上的追责路径主要是服务条款违约 + 商业秘密,而不是著作权(模型输出的版权地位本身还不清晰);开源权重模型另算——Apache 2.0 系(如 Qwen)基本没有这类限制,Llama 系有自己的社群许可条款要单独看。所以合规上最稳的做法是用宽松许可的开源权重模型当教师。
成本侧,蒸馏在 2026 年是微调最站得住的理由。 它不依赖"微调让模型更强"这个已经站不住的假设,只依赖"同样的效果我用更小的模型达成"。高 QPS 场景下这能省掉一个数量级的成本,同时压低首 token 延迟。
追问链
白盒和黑盒蒸馏差在哪?你们用的哪种?
期望白盒有logits,可用 KL 对齐分布,信息量大但要教师权重,还能做中间层特征对齐(hidden states/attention);黑盒只有文本,退化成SFT。调 API 只能黑盒信号说出「白盒学的是分布,黑盒学的是采样出来的一个点」→ 理解到位;分不清两者 → 只看过科普教师模型自己也会答错,这些错怎么办?
期望必须做拒绝采样:多次采样 + 验证(规则 / 判分器 / 自洽性投票),只留通过的;有ground truth的直接对答案,没有的用一致性投票或另一个模型交叉校验。不过滤等于把教师的错误率烧进学生,而学生的纠错能力比教师更弱信号主动说「要做拒绝采样」→ 基本可判定真做过蒸馏;答「教师是大模型,一般不会错」→ 没做过学生模型有可能超过教师吗?
期望纯蒸馏不行,上限就是教师。两个例外:① 窄任务上学生可以超过教师的平均表现 —— 教师是通才、学生是专才,且拒绝采样把教师的最好表现筛了出来,相当于拿 best-of-N 的教师当老师;② 想真正突破上限得走可验证奖励那一档信号只答「不能」→ 正确但浅;说出「拒绝采样蒸的是 best-of-N 教师,所以窄任务上能超过教师平均水平」→ 很强的信号合规上到底哪些能做哪些不能做?
期望判据是训出来的是不是同类通用模型:分类、抽取、摘要、语义检索这类非竞争用途允许(Anthropic条款原文举例),训通用助手禁止。所有权 ≠ 使用权:OpenAI把 Output 判给你,同条款又禁止拿它训竞品。追责走条款违约 + 商业秘密而非著作权;开源权重是更稳的教师信号报得出「允许什么」的具体清单 → 真读过条款;用「输出版权归我们所以能随便用」论证 → 直接判为知识缺口法务问:「用 GPT 生成的数据训出来的模型,能商用吗?能对外说自研吗?」
期望拆成三问,混着答必错:① 训练合不合条款 —— 非竞争用途允许、通用助手禁止,给判据别踢回法务;② 能否商用 —— ① 过关即无障碍,要留证据链(用途 + 能力范围文档);③ 怎么对外说 —— 「完全自研」不诚实,2026 年验得出痕迹,稳妥说法「基于开源基座 + 自有数据训练」→ 解法:换 Apache 2.0 系开源权重当教师重跑,差距可接受即归零信号答「应该没问题吧,输出是我们的」→ 本题最主要的淘汰点;提「换开源权重教师重跑,把法律问题变成技术问题」→ 最强信号
评分要点
- 能说清蒸馏是什么,以及最常见的"大模型造数据训小模型"形态
- 能区分白盒与黑盒蒸馏
- 知道必须做拒绝采样过滤,并说得出为什么
- 知道学生的能力上限是教师
- 知道蒸馏数据的输入分布应来自线上
- 能说出合规判据:"是不是同类通用模型"
- 知道所有权 ≠ 使用权
- (加分)知道开源权重模型是更稳的教师选择
- (加分)能说出蒸馏是 2026 年最站得住的微调理由(成本压缩)