本集对应模块 T5 的三节课:「涌现:能力为什么会突然出现」「为什么要把模型做小」「蒸馏是怎么做的:从老师到学生」。
来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)
一条主线矛盾:上一秒刚说完规模能换来能力,下一秒为什么整个行业还在拼命把模型做小?
答案:能力不是唯一的约束条件。成本、延迟、数据能不能出门,这三件事会在真实项目里直接把旗舰模型挡在门外。蒸馏则是「把小模型能力尽量补上来」的那个手段。
关键判断:蒸馏省的是钱和时间,它不创造新能力。
| 能力 | 落点 | 一句话 |
|---|---|---|
| 涌现识别 | 阶跃曲线 | 跨阈值后短区间内跳升,前半段不携带后半段信息 |
| 阈值量级 | 六项能力 | 多步数学约 10B、多语言/工具调用约 7B、CoT 约 100B |
| 指标反思 | 离散 vs 连续 | 阶跃可能来自尺子而非模型 |
| 三大动机 | 成本 / 速度 / 合规 | 做小是被现实逼出来的 |
| 显存估算 | 参数量(B) × 精度系数 | FP16 取 2.6,INT4 取 0.65,已含运行时开销 |
| 蒸馏五步 | 问题集→作答→取分布→训练→迭代 | 难点在细节不在流程 |
| 软硬标签 | 概率分布 vs 标准答案 | 软标签传递老师的权衡 |
| 温度系数 | T | 调软分布,让相对关系更明显 |
| 走势 | 形态 | 例子 |
|---|---|---|
| 常规能力 | 随规模稳步抬升 | 每加一倍参数多拿一点分 |
| 涌现能力 | 长期贴地,跨阈值后跳升 | 多步推理、工具调用等 |
麻烦在左半段:跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。只有前半段数据时无法外推、无法预测抬头位置,目前也没有理论能提前算出某项能力会在哪个规模出现。
工程含义:在小模型上试了很久没成 ≠ 这条路不通;看到一点苗头 ≠ 再大一点就一定行。曲线的前半段不携带关于后半段的信息。
| 能力 | 量级 | 说明 |
|---|---|---|
| 多步数学推理 | 约 10B | 单步算术小模型也能对一部分,连推几步则长期贴零 |
| 多语言迁移 | 约 7B | 英文语料学到的推理方式迁移到低资源语种 |
| 结构化输出与工具调用 | 约 7B | 稳定吐合法 JSON、按签名填对参数类型,非专门设计 |
| 思维链推理(CoT) | 约 100B | 小模型上拿不到收益,有时反而带偏原本能答对的题 |
| 理论心智(ToM) | 争议中 | 改写几个字能力即消失(Ullman, arXiv:2302.08399) |
| 长对话角色一致性 | 约 13B | 几十轮后仍守住身份、语气与边界 |
这些数字是量级参考,行业内没有统一权威阈值,别拿去做容量规划。换架构、换批训练数据、换评测方式,位置都会明显偏移。
思维链在约 100B 规模才出现明显收益,见 Wei et al., NeurIPS 2022(arXiv:2201.11903);理论心智见 Kosinski, arXiv:2302.02083(2023)。
Schaeffer, Miranda & Koyejo, *Are Emergent Abilities of Large Language Models a Mirage?*, NeurIPS 2023(arXiv:2304.15004)主张:相当一部分「涌现」由研究者选择的评测指标引发。
跳变消失了,说明跳变来自尺子,模型本身一直在稳步变好。 对做产品的人,这个提醒比争论本身有用——你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃。
规模是一个自变量,值得单独测。 这件事只有在你自己的任务上才能问出答案。
| 理由 | 要点 |
|---|---|
| 成本 | 参数量小一个量级,推理算力通常也小一个量级。常见口径:比旗舰低一到两个数量级,不是打折 |
| 速度 | 远端调用要走网络往返 + 排队 + 逐字生成;本地小模型省掉网络段,首字快得多。用户等 3 秒 vs 0.3 秒是两种体验 |
| 私有化与合规 | 病历、卷宗、内部代码、未公开财务数据要求不出内网。能力再强也用不上,第一步就过不去 |
具体成本差距取决于尺寸、量化档位、批量大小与部署方式,别记死数字,记住是量级差距。
显存(GB)≈ 参数量(B)× 精度系数
FP16 取 2.6,INT4 取 0.65。系数中已包含 KV Cache 等运行时开销,不要在外面再乘一次。
| 型号 | FP16 | INT4 | 24 GB 消费级卡上 |
|---|---|---|---|
| Qwen3-0.6B | 1.6 GB | 0.4 GB | 轻松,端侧也带得动 |
| Qwen3-8B | 20.8 GB | 5.2 GB | 很宽裕,8 GB 卡也能跑 |
| Qwen3-32B | 83.2 GB | 20.8 GB | 勉强,上下文一长会溢出 |
| Qwen3-235B-A22B | 611 GB | 152.8 GB | 跑不动,不是量化能解决的 |
混合专家模型的显存按总参数量计算,激活参数量只影响速度。这是最容易算错的一处。此外判定时留了约 15% 余量——所以 20.8 GB 在 24 GB 卡上算「勉强」而非「可以」。
结论:8B 这个尺寸量化后,一块几年前的游戏显卡就跑得动;旗舰尺寸不管怎么量化都进不去。
以「正确答案是猫」为例:
| 硬标签(传统训练) | 软标签(蒸馏) | |
|---|---|---|
| 猫 | 正确 | 72% |
| 狗 | 错误 | 20% |
| 兔 | 错误 | 8% |
硬标签下狗和兔「一样错」,「狗跟猫比较像、兔子差得远」这层信息完全丢失。
硬标签只告诉学生答案,软标签还告诉学生老师是怎么权衡的。
老师太自信时分布会很尖锐(98% / 1% / 1%),跟硬标签没多大区别,软标签优势体现不出来。做法是计算概率时除以一个数 T:T 越大分布越平缓,词与词之间的相对关系越明显。
这与采样时的 Temperature 是同一机制,用途不同——那里为了让输出多样,这里为了让信息更充分传给学生。
2025-01-20 发布,同时开源六个蒸馏版:
| 模型 | 底座 |
|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5 |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5 |
| DeepSeek-R1-Distill-Llama-8B | Llama3 |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5 |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5 |
| DeepSeek-R1-Distill-Llama-70B | Llama3 |
值得留意的细节:学生底座不是自家的,是从别人开源模型里挑的。官方未解释原因,但可反推三个条件:① 权重开放且许可允许再训练;② 尺寸谱系足够全;③ 社区工具链成熟。三者同时满足的选项当时并不多。
厂商自己说的开源程度可以有水分,但另一家公司愿意把自己的旗舰成果建在你的底座上,是拿真金白银的算力投的票。评估一个底座时,看有多少第三方旗舰成果建在它上面。
效果方面要留个心眼:官方评测中 32B 蒸馏版在数学和代码基准上超过 OpenAI o1-mini,但社区在自有测试集上复现时结果并不总一致。常见原因是评测集选择、提示词写法与采样参数差异。官方跑分只能当参考。
一、小模型有能力天花板。 在需要长链条推理、多步规划、跨大量上下文做取舍的任务上,小模型仍然显著弱于旗舰模型。这类差距不会因为换个更强的老师就消失。做选型时别指望一个 7B 模型接管所有场景,先把任务拆开,看清楚哪些环节真的用得上小模型。
二、学生会连老师的毛病一起学过去。 老师的偏见、知识盲区、表达习惯,学生都会继承,而且自己分辨不出来。当大量小模型都从同一批老师那里学,整个生态会朝同一个方向漂。
参数量 × 系数 时,有没有在系数外又乘一次运行时开销?oss02-播客.mp3oss02-播客.srtscript.txt本内容改编自小山学堂《学 AI 产品,从入门到精通》,为二次演绎配音版。
来源:xueai.miyang.cn(小山学堂 · 洛小山)