← 返回资讯

模型蒸馏科普:如何把大模型的能力"压缩"进小模型

2026-07-31

7B 的 DeepSeek-R1-Distill 能在数学推理上逼近 70B 教师模型的效果——这不是魔法,而是知识蒸馏(Knowledge Distillation) 的工程价值。理解蒸馏,能帮你判断什么时候选蒸馏版本的小模型,什么时候必须用原版大模型。

一、蒸馏的核心思路

传统训练用”硬标签”:答案是”猫”,损失函数只优化让模型输出”猫”这一个词。

蒸馏用”软标签”:教师模型(大模型)的输出是一个概率分布——“猫 0.87、狗 0.08、兔 0.03”。学生模型(小模型)不只学”猫”这个答案,而是学整个概率分布,包括教师认为”狗比兔更像猫”这个隐含知识。

一句话:软标签携带的信息量远大于硬标签,学生模型从中获得的监督信号更丰富。

温度参数:软标签为什么要”软化”

刚才那组概率”猫 0.87、狗 0.08、兔 0.03”其实已经被”软化”过了。教师模型原始的 softmax 输出往往非常尖锐,正确答案的概率可能是 0.999,其余全是接近 0 的小数——这种分布跟硬标签没什么两样,学生模型照样学不到”狗比兔更像猫”的信息。

解决办法是在 softmax 之前除以一个温度值 T(一般取 2~5 之间调参)。T 越大,分布被拉得越平缓,次要类别的概率被放大,暴露出更多”教师的犹豫”;T=1 就是正常输出,不做软化。训练时教师和学生用相同的 T 计算分布,再用 KL 散度衡量两个分布的差异作为损失函数的一部分——你可以把 KL 散度理解成”学生的判断和教师的判断差多远”,差得越多损失越大,反向传播就会把学生的参数往教师的方向拉。

实际的损失函数通常是两部分加权求和:一部分是学生对软标签的 KL 散度损失,另一部分是学生对硬标签(真实答案)的标准交叉熵损失。工程上常见配比是软标签损失权重高一些(比如 0.7)、硬标签损失权重低一些(比如 0.3),这样学生既学教师的”思路”,也不脱离真实答案兜底。具体配比没有放之四海而皆准的黄金数字,得在你自己的验证集上跑几组消融实验(比如 0.5/0.5、0.7/0.3、0.9/0.1)挑出效果最好的一组,别直接抄论文里的默认值就上生产。

二、主流蒸馏策略对比

策略蒸馏位置说明典型应用
输出蒸馏(Logit Distillation)最终输出层学软标签分布,实现简单最广泛,DeepSeek-R1-Distill 采用
特征蒸馏(Feature Distillation)中间层学中间表征,效果更强但需模型结构对齐同架构师生对
关系蒸馏多层输出关系学 Token 间相似度矩阵研究场景居多
链式思考蒸馏(CoT Distillation)输出文本用教师生成的推理链训练学生o1/R1 系列推理模型蒸馏

链式思考蒸馏——推理能力的关键

强推理模型(如 OpenAI o1、DeepSeek-R1)的蒸馏核心是让小模型学习大模型的推理过程,而非仅仅最终答案:

  1. 教师模型对大量数学/代码题目生成详细推理链(Chain of Thought)
  2. 这些推理链作为训练数据直接喂给学生模型
  3. 学生模型学会”先想再答”的推理范式

这解释了为什么 DeepSeek-R1-Distill-7B 在数学题上远超同参数量的普通 7B 模型。

链式思考蒸馏跟前面说的”软标签+KL 散度”其实是两条不同的技术路线,不要混为一谈:输出蒸馏是学一个概率分布,而 CoT 蒸馏学的是一整段自然语言文本(推理过程),训练时用的是标准的语言模型损失(预测下一个 token),而不是 KL 散度。这也是为什么 CoT 蒸馏对数据质量特别敏感——如果教师模型的推理链里有一步逻辑跳跃或算错了,学生模型会原样学会这个错误,而且不像分类任务那样容易被”投票”稀释掉。所以做 CoT 蒸馏数据集时,业界通用做法是对教师生成的推理链做二次校验(比如用另一个模型或规则脚本核对最终答案是否正确),只保留答案正确的推理链进训练集,错误的直接丢弃,宁可数据量少一点也不能把错误逻辑喂给学生。

一个简化的 CoT 蒸馏数据构造流程大致是这样:

for question in dataset:
    cot, answer = teacher_model.generate(question, mode="think_step_by_step")
    if verify(answer, question.ground_truth):
        training_set.append({"input": question, "target": cot + answer})
    else:
        discard(question)  # 推理链有误,不能进训练集

这里 verify 函数的实现方式因任务而异:数学题可以直接对比最终数值,代码题可以跑单元测试看是否通过,开放式问答则往往需要引入第三方裁判模型打分。这一步的严谨程度,直接决定了你蒸馏出来的小模型有多”靠谱”。

三、蒸馏的局限性

局限说明
知识上限学生永远无法超越教师——蒸馏只能传递教师已有的知识
任务泛化性针对特定任务蒸馏的小模型,在其他任务上可能退化
长尾知识丢失教师模型中罕见但重要的知识,在软标签稀疏时难以传递
数据需求大高质量蒸馏需要海量教师推理样本,成本不低

四、蒸馏版 vs 原版:开发者如何选

选蒸馏版(小模型)的场景:

  • 任务边界清晰(代码补全、结构化提取、特定领域 QA)
  • 成本和延迟是硬约束
  • 私有部署或端侧部署
  • 有充分的任务对齐测试结果支撑

选原版大模型的场景:

  • 任务多样,需要通用泛化能力
  • 长尾知识密集(如法律全文检索、医学文献分析)
  • 没有充分实测,不确定蒸馏版是否够用
  • 多轮复杂对话,上下文状态维持要求高

实践建议:用蒸馏版做 80% 的高频简单任务,用原版大模型处理 20% 的复杂边缘 case,兼顾成本与质量。

五、真实踩坑:蒸馏版效果不及预期怎么排查

如果你在用蒸馏版模型时发现效果比宣传的差一截,别急着下结论说”蒸馏版不行”,先按这个顺序排查:

第一步,看任务分布是否偏离了蒸馏训练数据。 厂商公布的蒸馏版跑分(比如数学、代码基准)用的测试集,跟你实际业务的输入分布往往差异很大。一个典型现象是:官方跑分里数学题准确率很高,但你拿它做”合同条款摘要”却频繁跑偏——这不是模型退步了,而是这类任务根本不在教师模型生成的推理链训练数据范围内。解决办法是自己拿业务真实的 50~100 条样本做一次小规模实测,别只信官方跑分。

第二步,确认温度/采样参数没有被默认值坑了。 蒸馏模型(尤其是推理模型的蒸馏版)对采样温度更敏感,很多人直接沿用调用原版大模型时的参数(比如 temperature=0.7),结果蒸馏版输出变得东拉西扯甚至重复。DeepSeek-R1-Distill 系列官方建议的推理采样参数跟直接问答任务不同,具体数值以官方模型卡(model card)为准,不要凭经验照搬。

第三步,检查是不是把”推理过程”和”最终答案”搞混了。 部分蒸馏推理模型的输出会先给一段 <think> 标签包裹的思考过程,再给最终答案。如果你的解析代码没有正确拆分这两部分,把整段思考过程当成答案返回给用户,看起来就像是”这模型话痨、答非所问”——这其实是解析逻辑的锅,不是模型能力问题。排查时先把原始返回的完整文本打印出来看一眼,再决定是不是模型的问题。

第四步,量化和蒸馏叠加时先分别验证。 很多小模型是”蒸馏+量化”双重压缩(比如蒸馏出 7B 再做 4-bit 量化部署到端侧),如果效果差,先只上蒸馏版本(不量化)测一遍,确认是量化引入的精度损失还是蒸馏本身的知识损失,两步分开测才能定位到底是哪一层的问题。

六、蒸馏成本怎么估算

自己拿 API 蒸馏一个私有小模型,成本主要花在两块:教师模型生成训练数据的调用费用,以及学生模型的训练算力费用

生成训练数据的费用估算方式很直接:预计需要多少条训练样本(一般至少几千到几万条起步,具体视任务复杂度而定)× 每条样本教师模型生成的平均 token 数(CoT 蒸馏由于要生成完整推理链,单条样本的输出 token 数可能是普通问答的 5~10 倍)× 教师模型的输出单价。这笔账你可以直接用要接入的模型当前的按量计费单价去估,具体单价务必以对应厂商官网当前计费页面为准,不要用记忆中的旧价格套算,模型定价调整是常态。

训练算力费用则取决于学生模型的参数量和训练轮数,量级差异很大——同样是蒸馏,用几千条样本做 LoRA 微调级别的轻量蒸馏,和从零做全参数蒸馏训练,成本可以差出一到两个数量级。如果只是想验证”蒸馏是否对我的任务有效”,建议先用小规模数据集(几百到一千条)做一轮轻量实验,看指标趋势是否符合预期,再决定要不要投入更大规模的数据和算力去正式跑。

常见问题

蒸馏版和量化版的区别是什么? 蒸馏是改变模型结构(参数变少),量化是保持结构但降低每个参数的数值精度。两者都能缩小模型,但手段不同,可以叠加使用(先蒸馏再量化)。详见 量化模型趋势

厂商说的”蒸馏版”一定比直接训练的同尺寸模型强吗? 通常是的——前提是教师模型确实更强,且蒸馏数据与目标任务匹配。但如果蒸馏数据集与你的任务差异很大,蒸馏优势可能消失,需要自行实测。

可以用 API 接口的大模型来蒸馏自己的私有小模型吗? 需要仔细阅读各厂商 API 使用条款。部分厂商(如 OpenAI)明确禁止使用其输出训练竞争模型;其他厂商条款各异,务必确认合规性再实施。


延伸阅读:小模型与端侧模型崛起 · 量化模型趋势 · MoE 架构科普 · 怎么追踪大模型动态 · 返回 AI 资讯中心