蒸馏与合规边界

微调与对齐进阶4讲解 1

蒸馏是用大模型造数据训小模型:技术侧靠合成数据、拒绝采样筛出高质量样本;合规侧要看教师模型的服务条款 —— 多数闭源厂商禁止用输出训练竞品模型。能不能蒸、蒸谁的,先看条款再看效果。

也叫:蒸馏 · distillation · 合成数据 · 拒绝采样 · 服务条款 · 小模型

蒸馏:技术侧与合规侧出自 T4-4

技术侧。 蒸馏分两种形态:

  • 白盒蒸馏:能拿到教师的完整概率分布(logits),用 KL 散度让学生的分布逼近教师的分布。信息量最大,但要求教师权重在手——只有开源权重模型能这么做。
  • 黑盒蒸馏:只能拿到教师输出的文本,用它当 SFT 的标准答案。调 API 的场景只能这么做,这也是绝大多数团队的实际形态。

黑盒蒸馏有两个必须做的动作:

  1. 拒绝采样过滤(rejection sampling):教师对同一个输入采样 N 次,用判分器/规则/多数投票筛掉错的,只把通过验证的留下来当训练数据。不做过滤直接拿教师输出训,等于把教师的错误率原样烧进学生的权重。
  2. 明确学生的能力上限就是教师。想让学生超过教师,得走可验证奖励那一档,靠蒸馏做不到。

合规侧(截至 2026-08,条款易变,正式项目务必现场核对原文)。

厂商 明确允许 明确禁止
OpenAI Output 的所有权归用户(条款里把权利让渡给用户) 用 Output 开发与 OpenAI 竞争的模型;程序化批量抽取 Output;反向工程
Anthropic 用输出训练不与 Anthropic 竞争的模型。官方举例:情感分析、内容分类、摘要、信息抽取、语义检索、异常检测 训练通用聊天机器人、开放式文本生成模型;把 Output 当训练目标去复刻;反向工程训练方法

一句话判断口径:

风险不在"用没用大模型造数据",在"造出来的东西是不是同类通用模型"。 训一个客服意图分类的小模型 → 基本安全;训"我们自己的通用助手" → 踩线。

还有一个最容易答错的点所有权和用途是两件事。 OpenAI 的条款明确说输出归你,但同一份条款也明确禁止拿它训竞品。面试里如果候选人用"输出的版权是我的"来论证"我可以拿去训模型",这是一个可以直接判定的知识缺口。

补充两条背景:法律上的追责路径主要是服务条款违约 + 商业秘密,而不是著作权(模型输出的版权地位本身还不清晰);开源权重模型另算——Apache 2.0 系(如 Qwen)基本没有这类限制,Llama 系有自己的社群许可条款需要单独看。

以上节选自T4-4 数据与副作用:数据怎么造、蒸馏的合规边界、以及微调之后模型为什么变笨了,读全文能看到前后语境。

考这个知识点的题1

会连带问到3