学 AI 产品 · 专业 AI 产品经理播客第 5 章 · T5 开源、蒸馏与本地部署 · EP 01
第 5 章 · EP 01

权重是什么?一个模型的全部本事 · 开源是一门生意:各家在图什么

时长 15:23音色 云健 · 男声

同步字幕

章节导航(点击跳转)

0:00开场 · 新闻里天天说开源,开的到底是什么1:12
1:12权重就是一堆数字1:56
3:09参数量决定体积,但体积不等于显存1:12
4:21拥有权重,就是拥有控制权1:03
5:24三个问题,问完就有答案1:14
6:38同一把尺子量五家,和一个必须说清楚的事实2:35
9:13开源是一门生意 · 六家六种算盘2:06
11:20衍生模型数量比下载量更诚实2:23
13:43可带走的设计原则与踩坑点1:39
解读全文

权重是什么 · 真开源与假开源 · 开源是一门生意 · 解读与音频稿件

本集对应模块 T5(开源、蒸馏与本地部署)的三节课:「权重是什么?一个模型的全部本事」「真开源 vs 假开源:怎么看懂一张许可证」「开源是一门生意:各家在图什么」。
来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)

本集要解决什么

新闻里天天说「某某模型开源了」,但开源的到底是什么?是代码吗?其实主要是一个文件——权重。搞清楚它是什么,后面所有关于开源的争论你都能自己判断。

本集三段:权重本身(长什么样、多大、为什么拥有权重就是拥有控制权)→ 怎么看懂一张许可证(三个问题定位开放程度)→ 商业逻辑(各家为什么要开源)。

本章例子多取自 Qwen,但选它是因为素材齐、尺寸铺得最全,不是因为它最好。要拿到的是判断标准,不是品牌名。

能力地图

能力落点一句话
权重本质训练产物一堆数字,训练结束即冻结
体积估算参数量(B) × 2FP16 下每参数 2 字节
运行时占用参数量 + 30%~50%额外开销来自 KV Cache
控制权三要素离线 / 可改 / 留痕拥有权重 = 拥有控制权
开放度三问可下载 / 可商用 / 可训练问完即定位
三档归档无附加 / 自定义条款 / 仅 API选型直接套用
生态衡量衍生模型数量比下载量更诚实
策略规律模型在收入结构中的位置是商品→闭源;是互补品→开源

逻辑拆解

一、权重就是一堆数字

模型内部没有规则、没有知识库、没有 if-else,有的只是一个巨大的数字表格。每个数就是一个权重。训练的全部意义,就是把这几十亿个数从随机值一点点调整到合适的值。 调完参数冻结,模型定型。

这也解释了:模型跟你聊天时不会学到任何东西。权重是训练阶段定死的,对话阶段只读不写。所谓上下文是临时摆在旁边的工作区,不是写进权重的记忆。

佐证:DeepSeek-R1 放出的蒸馏版里多数用 Qwen 底座——这是第三方选择,不是自家宣传。

二、参数量决定体积

FP16 下每个数占 2 字节,所以:

权重文件体积(GB)≈ 参数量(B)× 2
型号FP16 体积
Qwen3-0.6B约 1.2 GB
Qwen3-8B约 16 GB
Qwen3-32B约 64 GB
Qwen3-235B-A22B约 470 GB
Qwen3.8-Max(2.4 万亿参数)数 TB 量级

提示1 · 看文件大小估显存,会低估

存储体积和运行时占用是两码事。 运行时还要额外开销一块地方存放对话的中间状态,也就是 KV Cache,通常要在参数量基础上多留三到五成。下单一块显卡算着能装下、跑起来爆显存,差的就是这块。

三、拥有权重 = 拥有控制权

维度含义反面对照
离线拔网线也能跑,涨价/限流/下架影响不到只给 API 则受制于人
可改可继续训练,微调专属版本调 API 永远做不到
留痕数据不出自己的机器医疗/法务/内部代码的唯一路径

只提供 API 的模型,你租的是使用权。价格、可用性、下线时间全由对方决定——这在技术选型时会直接变成风险。

四、三个问题定位开放程度

不用读完整份许可证,按顺序问:

  1. 权重文件能下载吗? — 不能下载,后面所有事都免谈,这一问筛掉一大半;
  2. 能商用吗?有没有附加门槛? — 最易踩坑:有的加用户规模上限,有的限定研究用途;
  3. 能用它的输出训练新模型吗? — 即能否蒸馏,各家分歧最大。

五、同一把尺子量五家

许可证下载权重商用训练新模型
Qwen3 全系Apache 2.0可可,无用户量限制可
Mistral 7BApache 2.0可可,无限制可
DeepSeek-R1MIT License可可,无需申请可,官方明确允许蒸馏
Llama 3Llama 3 Community License可限月活超 7 亿需单独授权可
GPT-4 / Claude / Gemini Ultra无公开权重许可否否否

三档归档:

  • 第一档 · 权重开放且无附加条件(Apache 2.0、MIT):下载、修改、商用、再分发、拿去训练都不需额外打招呼,法务最省事。代表:Qwen3 全系、Mistral 7B、DeepSeek-R1。
  • 第二档 · 权重开放但附带自定义条款:技术上完全可用,商业上要先算清楚会不会撞红线。代表:Llama 3 系列。
  • 第三档 · 只提供 API:没有本地部署、私有化和继续训练这些选项。

提示2 · 选型看具体版本的许可证,不看公司整体印象

许可证会变。 Qwen 在 2.5 那一代用分级许可:多数尺寸走 Apache 2.0,但 3B 采用 Qwen Research 许可、72B 采用 Qwen 许可;到 Qwen3 才统一成全系 Apache 2.0。同一系列内不同尺寸可能不一致。

六、一个必须说清楚的事实

上面五家,训练数据全都没有公开。

按传统软件的开源标准,源代码等价物应该是训练数据加训练代码,光给编译产物不算开源。大模型领域说的「开源」实际指权重开放——这是一个被行业默认接受的降级定义。你拿到的不是配方,是做好的菜。

自查清单(四条)

  1. 去官方仓库找许可证文件本身,不看新闻稿和宣传页;
  2. 确认你要用的那个具体尺寸的许可证,同一系列内可能不一致;
  3. 自定义许可证重点找用户规模、使用场景、地域三类限制;
  4. 确认能否用于训练,这决定了微调和蒸馏的空间。

七、六家六种算盘

厂商策略商业逻辑
Meta权重开放主营社交广告,把模型做成免费通用品 = 抽掉对手定价基础(补充品商品化)
Google部分开源小模型换开发者,旗舰闭源走 API 与云服务,两条腿走路
Mistral真开源Apache 2.0 建声誉,收入来自企业定制与私有化部署,靠服务不靠锁客
阿里 · Qwen全系开源开源建事实标准,算力需求回到云上,模型免费、算力收费
DeepSeekMIT 开源最宽松许可 + 明确允许蒸馏,以极低市场费用换全球技术声誉
OpenAI完全闭源最强能力即护城河,开源等于填平护城河

规律:一家公司开不开源,看的是模型在它的收入结构里处于什么位置。模型本身是商品的,倾向闭源;模型是获客入口或者互补品的,倾向开源。

提示3 · 用衍生模型数量衡量生态,别用下载量

下载量容易刷,榜单排名换个测法就变。衍生模型数量造不了假,因为每个衍生模型背后都是一次真实的算力投入。它本质上是一份长期的用户选择记录——开发者选底座考虑的是许可证是否干净、尺寸是否齐全、社区工具链是否现成。

参考数据(Hugging Face 平台统计,Qwen 系列,2026-01-21):衍生模型 20 万(全球首个达该量级的开源模型系列)、累计下载 10 亿次(日均约 110 万)、累计开源模型近 400 个。对照:衍生模型数 2025 年 2 月约 9 万,2025 年内突破 10 万。

八、练手案例 · 宣布要开源 ≠ 已经开源

Qwen3.8-Max 于 2026-08-03 发布,总参数 2.4 万亿、激活 950 亿,API 已可用,官方表示权重将开源。但截至核对日(2026-08-07)权重尚未放出,许可证未公布。

它现在填不进三档表的任何一档——判断需要的两个信息都缺。权重没放出来之前,谁也不知道会配什么样的许可证。

另需提醒:2.4 万亿参数权重文件是数 TB 量级。「权重开放」和「你跑得动」是两件事。

为什么本章以千问为例(三条理由)

选它不是因为它最好,而是因为素材齐、方便动手:

  1. 尺寸铺得最全 — 官方库里从 0.8B 一直排到 122B,中间有 2B、4B、9B、27B、35B。每讲到一档设备都能对应上一个真能下载下来的文件,不用换品牌凑数;
  2. 别人拿它当底座 — DeepSeek-R1 放出的六个蒸馏版里有四个用 Qwen 底座,这是第三方选择,不是自家宣传;
  3. 它自己就是反面教材 — Qwen2.5 时期的 3B 和 72B 用过非标准许可证,正好拿来讲「开源」这两个字有多不可靠。一个系列内部都能出现两套规则,厂商宣传语的精确度可想而知。

中文社区里有人管它叫「源神」(开源之神)。这是网友的戏称,不是评价标准,也不代表它每一项都最强。学完这一章要拿到的是判断标准,不是一个品牌名——同一套标准套到任何一家身上都应该照样能用。

课堂练习 · 把规律套到你自己公司

问一句:你的公司靠什么赚钱? 然后看模型在你的收入结构里处在哪个位置。

  • 如果模型就是你卖的东西 → 开源等于把货白送,倾向闭源;
  • 如果模型只是让客户更容易买你别的产品的东西 → 互补品越便宜主业越值钱,倾向开源。

这个推演的好处是它不依赖任何行业知识,只要你知道公司怎么赚钱,就能推出大致方向。

常见误区速查

误区实际情况
「开源」= 训练数据也公开实际指权重开放,是降级定义。五家训练数据均未公开
文件 16 GB 就是 16 GB 显存运行时还要留 30%~50% 给 KV Cache
这家公司开源,所以它全系都开源同一系列不同尺寸可能不同许可(如 Qwen2.5 的 3B/72B)
官方宣布要开源 = 可以选型了权重未落地、许可证未公布前无法归档
下载量高 = 生态好下载量可刷,衍生模型数量才是真实投入的记录
模型开源了 = 我能部署数 TB 量级权重与可部署是两件事

给做选型的人 · 三步

  1. 先看许可证 — 确认能不能用、有没有门槛;
  2. 再看商业逻辑 — 判断这家会不会持续开源。靠模型直接赚钱的公司策略随时可能收紧;开源是获客手段的公司通常更稳定;
  3. 最后看生态厚度 — 衍生模型多、社区工具全,意味着遇到问题能搜到答案,出了 bug 有人已经踩过。

生态集中的代价:当二十万个衍生模型都长在少数几个底座上,它们会一起继承同一套偏见、同一种表达习惯,甚至同一批错误。

审查清单

  1. 有没有确认目标模型的具体尺寸的许可证,而非系列整体印象?
  2. 许可证有没有用户规模上限(如月活阈值)?
  3. 有没有确认能否蒸馏/用于训练——这决定后续微调空间?
  4. 显存估算有没有在参数量基础上多留 30%~50% 给 KV Cache?
  5. 有没有把「宣布要开源」误当作「已经开源」?
  6. 评估的是许可证原文还是新闻稿?
  7. 生态评估用的是衍生模型数量还是下载量?

约束说明

  • 体积估算约束:参数量 × 2 是 FP16 下的理论估算,实际文件因分片方式与附带配置文件略有出入。
  • 显存约束:「多留三到五成」是经验值,实际占用还受 batch size、上下文长度、推理框架影响,长上下文场景下 KV Cache 占比会更高。
  • 降级定义约束:大模型领域的「开源」指权重开放,不等于训练数据开放。与法务沟通时必须说清,否则双方理解的可能不是一回事。
  • 许可证时效性约束:所有许可证结论依据各厂商官方原文,核对日期 2026-08-07。许可证会变,选型时以你要用的具体版本为准。
  • 未落地案例约束:Qwen3.8-Max 截至核对日权重未放出、许可证未公布,本页结论为「无法归档」,不代表其最终开放程度。
  • 数据来源约束:20 万衍生模型 / 10 亿下载 / 近 400 个模型为 Hugging Face 平台统计(2026-01-21),经多家财经媒体报道;衍生模型数在 2025 年 2 月约 9 万。数据会随时间增长,引用时视为量级参考。
  • 举例品牌约束:本章以 Qwen 举例是因素材齐、尺寸谱系完整,不构成「它最好」的评价。同一套标准应能套用到任何一家。
  • 取材约束:本集只使用本集素材内资料,不跨集引用,不虚构源文档未出现的数据、案例与引文。

可带走的设计原则

  1. 先看许可证,找官方仓库原文,确认具体尺寸,不看新闻稿。
  2. 再看商业逻辑——模型在收入结构中的位置决定开源策略的稳定性。
  3. 用衍生模型数量衡量生态,比下载量诚实。
  4. 把「宣布要开源」和「已经开源」分开;把「权重开放」和「你跑得动」分开。
  5. 记住这是降级定义——权重开放 ≠ 训练数据开放。
  6. 警惕生态集中:衍生模型集中在少数底座,会共同继承同一套偏见与错误。

音频与稿件

  • 音频:oss01-播客.mp3
  • 字幕:oss01-播客.srt
  • 口播稿:script.txt
  • 集页:https://xueai-podcast.pages.dev/t/oss01/

本内容改编自小山学堂《学 AI 产品,从入门到精通》,为二次演绎配音版。

来源:xueai.miyang.cn(小山学堂 · 洛小山)