学 AI 产品 · 专业 AI 产品经理播客第 5 章 · T5 开源、蒸馏与本地部署 · EP 02
第 5 章 · EP 02

涌现:能力为什么会突然出现 · 蒸馏是怎么做的:从老师到学生

时长 15:38音色 云健 · 男声

同步字幕

章节导航(点击跳转)

0:00开场 · 大模型为什么还要拼命变小1:03
1:03涌现 · 跨过阈值之后的阶跃1:06
2:10六个被反复提到的例子1:39
3:50阶跃来自模型,还是来自你的尺子1:24
5:14对做产品的人意味着什么1:19
6:33为什么要把模型做小 · 三个现实理由1:32
8:06先看显存这个硬指标1:42
9:48蒸馏 · 让大模型教小模型,和一个真实产物3:44
13:32可带走的设计原则与踩坑点2:05
解读全文

涌现 · 为什么要把模型做小 · 蒸馏怎么做 · 解读与音频稿件

本集对应模块 T5 的三节课:「涌现:能力为什么会突然出现」「为什么要把模型做小」「蒸馏是怎么做的:从老师到学生」。
来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)

本集要解决什么

一条主线矛盾:上一秒刚说完规模能换来能力,下一秒为什么整个行业还在拼命把模型做小?

答案:能力不是唯一的约束条件。成本、延迟、数据能不能出门,这三件事会在真实项目里直接把旗舰模型挡在门外。蒸馏则是「把小模型能力尽量补上来」的那个手段。

关键判断:蒸馏省的是钱和时间,它不创造新能力。

能力地图

能力落点一句话
涌现识别阶跃曲线跨阈值后短区间内跳升,前半段不携带后半段信息
阈值量级六项能力多步数学约 10B、多语言/工具调用约 7B、CoT 约 100B
指标反思离散 vs 连续阶跃可能来自尺子而非模型
三大动机成本 / 速度 / 合规做小是被现实逼出来的
显存估算参数量(B) × 精度系数FP16 取 2.6,INT4 取 0.65,已含运行时开销
蒸馏五步问题集→作答→取分布→训练→迭代难点在细节不在流程
软硬标签概率分布 vs 标准答案软标签传递老师的权衡
温度系数T调软分布,让相对关系更明显

逻辑拆解

一、涌现 · 两条曲线

走势形态例子
常规能力随规模稳步抬升每加一倍参数多拿一点分
涌现能力长期贴地,跨阈值后跳升多步推理、工具调用等

麻烦在左半段:跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。只有前半段数据时无法外推、无法预测抬头位置,目前也没有理论能提前算出某项能力会在哪个规模出现。

工程含义:在小模型上试了很久没成 ≠ 这条路不通;看到一点苗头 ≠ 再大一点就一定行。曲线的前半段不携带关于后半段的信息。

二、六个被反复提到的例子

能力量级说明
多步数学推理约 10B单步算术小模型也能对一部分,连推几步则长期贴零
多语言迁移约 7B英文语料学到的推理方式迁移到低资源语种
结构化输出与工具调用约 7B稳定吐合法 JSON、按签名填对参数类型,非专门设计
思维链推理(CoT)约 100B小模型上拿不到收益,有时反而带偏原本能答对的题
理论心智(ToM)争议中改写几个字能力即消失(Ullman, arXiv:2302.08399)
长对话角色一致性约 13B几十轮后仍守住身份、语气与边界
这些数字是量级参考,行业内没有统一权威阈值,别拿去做容量规划。换架构、换批训练数据、换评测方式,位置都会明显偏移。

思维链在约 100B 规模才出现明显收益,见 Wei et al., NeurIPS 2022(arXiv:2201.11903);理论心智见 Kosinski, arXiv:2302.02083(2023)。

提示1 · 看到阶跃,先怀疑自己的尺子

Schaeffer, Miranda & Koyejo, *Are Emergent Abilities of Large Language Models a Mirage?*, NeurIPS 2023(arXiv:2304.15004)主张:相当一部分「涌现」由研究者选择的评测指标引发。

  • 离散指标:多步数学题按「答案完全正确」判分,中间错一步整题算零。模型从错得离谱进步到只差最后一点,分数照样是零;跨过最后门槛才一次性跳起。
  • 连续指标:逐个 token 看正确答案的对数概率,同一组实验的曲线变成平滑上升。

跳变消失了,说明跳变来自尺子,模型本身一直在稳步变好。 对做产品的人,这个提醒比争论本身有用——你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃。

三、对做产品的人的三条

  1. 换更大的模型之前,先自己测一遍 — 跑分榜测通用任务,你的场景可能正好卡在阈值附近。花半天做二三十条样本的小测试集,比读十篇评测有用。
  2. 小模型做不到的事,别急着用提示词硬凑 — 先换一档规模试试。大一档立刻就对,说明那些复杂提示词只是在补规模缺口,通常又长又脆,换模型换版本就失效。
  3. 看到「突然会了」别急着下结论 — 加一个宽松判分口径做交叉验证(按步骤给分、按字段给分),两把尺子都显示跳升才算站得住。
规模是一个自变量,值得单独测。 这件事只有在你自己的任务上才能问出答案。

四、为什么要把模型做小 · 三个理由

理由要点
成本参数量小一个量级,推理算力通常也小一个量级。常见口径:比旗舰低一到两个数量级,不是打折
速度远端调用要走网络往返 + 排队 + 逐字生成;本地小模型省掉网络段,首字快得多。用户等 3 秒 vs 0.3 秒是两种体验
私有化与合规病历、卷宗、内部代码、未公开财务数据要求不出内网。能力再强也用不上,第一步就过不去

具体成本差距取决于尺寸、量化档位、批量大小与部署方式,别记死数字,记住是量级差距。

五、先看显存这个硬指标

显存(GB)≈ 参数量(B)× 精度系数
FP16 取 2.6,INT4 取 0.65。系数中已包含 KV Cache 等运行时开销,不要在外面再乘一次。
型号FP16INT424 GB 消费级卡上
Qwen3-0.6B1.6 GB0.4 GB轻松,端侧也带得动
Qwen3-8B20.8 GB5.2 GB很宽裕,8 GB 卡也能跑
Qwen3-32B83.2 GB20.8 GB勉强,上下文一长会溢出
Qwen3-235B-A22B611 GB152.8 GB跑不动,不是量化能解决的

提示2 · MoE 显存按总参数量算,别用激活参数量

混合专家模型的显存按总参数量计算,激活参数量只影响速度。这是最容易算错的一处。此外判定时留了约 15% 余量——所以 20.8 GB 在 24 GB 卡上算「勉强」而非「可以」。

结论:8B 这个尺寸量化后,一块几年前的游戏显卡就跑得动;旗舰尺寸不管怎么量化都进不去。

六、蒸馏 · 五步流程

  1. 准备问题集 — 覆盖目标领域。这一步决定学生能力的上限:没被问到的领域学生就学不到;
  2. 教师模型作答,保留完整推理过程 — 关键在「完整」。只留最终答案 = 学生背结论;保留推理链条 = 学生有机会学到怎么想。这也是推理类模型特别适合当老师的原因;
  3. 取出概率分布,而非最终答案 — 每输出一个词,内部是一整张候选词概率表。只取排第一会丢掉大量信息;
  4. 训练学生 — 数据由原始问题 + 教师完整回答 + 每步概率分布组成,目标是让输出分布尽量贴近老师;
  5. 评估并迭代 — 通常要来回好几轮。

七、软标签 vs 硬标签

以「正确答案是猫」为例:

硬标签(传统训练)软标签(蒸馏)
猫正确72%
狗错误20%
兔错误8%

硬标签下狗和兔「一样错」,「狗跟猫比较像、兔子差得远」这层信息完全丢失。

硬标签只告诉学生答案,软标签还告诉学生老师是怎么权衡的。

八、温度系数 T

老师太自信时分布会很尖锐(98% / 1% / 1%),跟硬标签没多大区别,软标签优势体现不出来。做法是计算概率时除以一个数 T:T 越大分布越平缓,词与词之间的相对关系越明显。

这与采样时的 Temperature 是同一机制,用途不同——那里为了让输出多样,这里为了让信息更充分传给学生。

九、真实案例 · DeepSeek-R1 六个蒸馏版

2025-01-20 发布,同时开源六个蒸馏版:

模型底座
DeepSeek-R1-Distill-Qwen-1.5BQwen2.5
DeepSeek-R1-Distill-Qwen-7BQwen2.5
DeepSeek-R1-Distill-Llama-8BLlama3
DeepSeek-R1-Distill-Qwen-14BQwen2.5
DeepSeek-R1-Distill-Qwen-32BQwen2.5
DeepSeek-R1-Distill-Llama-70BLlama3

值得留意的细节:学生底座不是自家的,是从别人开源模型里挑的。官方未解释原因,但可反推三个条件:① 权重开放且许可允许再训练;② 尺寸谱系足够全;③ 社区工具链成熟。三者同时满足的选项当时并不多。

提示3 · 看第三方的选择,比看官方介绍可靠

厂商自己说的开源程度可以有水分,但另一家公司愿意把自己的旗舰成果建在你的底座上,是拿真金白银的算力投的票。评估一个底座时,看有多少第三方旗舰成果建在它上面。

效果方面要留个心眼:官方评测中 32B 蒸馏版在数学和代码基准上超过 OpenAI o1-mini,但社区在自有测试集上复现时结果并不总一致。常见原因是评测集选择、提示词写法与采样参数差异。官方跑分只能当参考。

先把丑话说在前面 · 蒸馏的两条边界

一、小模型有能力天花板。 在需要长链条推理、多步规划、跨大量上下文做取舍的任务上,小模型仍然显著弱于旗舰模型。这类差距不会因为换个更强的老师就消失。做选型时别指望一个 7B 模型接管所有场景,先把任务拆开,看清楚哪些环节真的用得上小模型。

二、学生会连老师的毛病一起学过去。 老师的偏见、知识盲区、表达习惯,学生都会继承,而且自己分辨不出来。当大量小模型都从同一批老师那里学,整个生态会朝同一个方向漂。

本节带走什么(四条)

  1. 把模型做小的动因是成本、延迟、数据合规这三条现实约束,跟追求能力上限无关;
  2. 能不能落地,先看显存这个硬指标,公式是参数量乘精度系数;
  3. 蒸馏是让大模型教小模型,目的是省掉从零训练的成本;
  4. 小模型有能力天花板,也会继承老师的缺陷——这两点在选型时要先摆到台面上。

审查清单

  1. 换模型前,有没有用自己的二三十条样本测试集跑一遍?
  2. 验收标准是不是「一次跑通才算过」?有没有加一个宽松口径做交叉验证?
  3. 遇到提示词怎么改都不对的任务,有没有先换一档规模试试?
  4. 显存估算用 参数量 × 系数 时,有没有在系数外又乘一次运行时开销?
  5. MoE 模型是不是按总参数量算的?
  6. 有没有留约 15% 余量?
  7. 蒸馏任务的问题集,覆盖度够不够?(决定学生能力上限)
  8. 教师作答有没有保留完整推理链条而非只留最终答案?

约束说明

  • 阈值非精确值约束:六个能力的参数量均为量级参考,取自公开研究与行业讨论中被反复引用的观察,不是精确测量值。换架构、换训练数据或换评测方式都会明显偏移。
  • 学术争议约束:涌现现象在学术上尚无定论。Schaeffer et al. 主张相当一部分涌现由评测指标引发;该反驳未推翻现象本身,说明的是「先确认阶跃来自模型还是尺子」。
  • 成本数字约束:「低一到两个数量级」是量级描述,不是基准测试结果。实际差距取决于尺寸、量化档位、批量大小与部署方式,请以自己场景实测为准。
  • 显存公式约束:FP16 取 2.6、INT4 取 0.65 是经验估算值,不是厂商标称值,系数中已含约三到五成运行时开销。
  • 蒸馏能力边界约束:蒸馏不创造新能力。长链条推理、多步规划、跨大量上下文做取舍这类任务上,小模型仍显著弱于旗舰,且该差距不因换更强老师而消失。
  • 继承缺陷约束:学生会连老师的偏见、知识盲区、表达习惯一起继承,且自己分辨不出来。大量小模型从同一批老师学习会导致生态朝同一方向漂。
  • 案例时效约束:DeepSeek-R1 蒸馏版信息核对日期 2026-08-07,各版本仍需遵循其底座模型自身的许可条款。
  • 取材约束:本集只使用本集素材内资料,不跨集引用,不虚构源文档未出现的数据、案例与引文。

可带走的设计原则

  1. 规模是一个自变量,值得单独测。 换模型前用自己的小测试集跑一遍。
  2. 看到阶跃先怀疑自己的尺子。 加宽松口径交叉验证,两把尺子都跳才算数。
  3. 别用提示词硬补规模缺口。 复杂提示词通常又长又脆。
  4. 显存 = 参数量 × 精度系数,系数已含运行时开销;MoE 按总参数量算;留 15% 余量。
  5. 蒸馏省的是钱和时间,不创造新能力。 先把任务拆开,别指望小模型接管所有场景。
  6. 学生会继承老师的毛病。 选底座时把生态漂移纳入考虑。

音频与稿件

  • 音频:oss02-播客.mp3
  • 字幕:oss02-播客.srt
  • 口播稿:script.txt
  • 集页:https://xueai-podcast.pages.dev/t/oss02/

本内容改编自小山学堂《学 AI 产品,从入门到精通》,为二次演绎配音版。

来源:xueai.miyang.cn(小山学堂 · 洛小山)