本集对应模块 T5(开源、蒸馏与本地部署)的三节课:「权重是什么?一个模型的全部本事」「真开源 vs 假开源:怎么看懂一张许可证」「开源是一门生意:各家在图什么」。
来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)
新闻里天天说「某某模型开源了」,但开源的到底是什么?是代码吗?其实主要是一个文件——权重。搞清楚它是什么,后面所有关于开源的争论你都能自己判断。
本集三段:权重本身(长什么样、多大、为什么拥有权重就是拥有控制权)→ 怎么看懂一张许可证(三个问题定位开放程度)→ 商业逻辑(各家为什么要开源)。
本章例子多取自 Qwen,但选它是因为素材齐、尺寸铺得最全,不是因为它最好。要拿到的是判断标准,不是品牌名。
| 能力 | 落点 | 一句话 |
|---|---|---|
| 权重本质 | 训练产物 | 一堆数字,训练结束即冻结 |
| 体积估算 | 参数量(B) × 2 | FP16 下每参数 2 字节 |
| 运行时占用 | 参数量 + 30%~50% | 额外开销来自 KV Cache |
| 控制权三要素 | 离线 / 可改 / 留痕 | 拥有权重 = 拥有控制权 |
| 开放度三问 | 可下载 / 可商用 / 可训练 | 问完即定位 |
| 三档归档 | 无附加 / 自定义条款 / 仅 API | 选型直接套用 |
| 生态衡量 | 衍生模型数量 | 比下载量更诚实 |
| 策略规律 | 模型在收入结构中的位置 | 是商品→闭源;是互补品→开源 |
模型内部没有规则、没有知识库、没有 if-else,有的只是一个巨大的数字表格。每个数就是一个权重。训练的全部意义,就是把这几十亿个数从随机值一点点调整到合适的值。 调完参数冻结,模型定型。
这也解释了:模型跟你聊天时不会学到任何东西。权重是训练阶段定死的,对话阶段只读不写。所谓上下文是临时摆在旁边的工作区,不是写进权重的记忆。
佐证:DeepSeek-R1 放出的蒸馏版里多数用 Qwen 底座——这是第三方选择,不是自家宣传。
FP16 下每个数占 2 字节,所以:
权重文件体积(GB)≈ 参数量(B)× 2
| 型号 | FP16 体积 |
|---|---|
| Qwen3-0.6B | 约 1.2 GB |
| Qwen3-8B | 约 16 GB |
| Qwen3-32B | 约 64 GB |
| Qwen3-235B-A22B | 约 470 GB |
| Qwen3.8-Max(2.4 万亿参数) | 数 TB 量级 |
存储体积和运行时占用是两码事。 运行时还要额外开销一块地方存放对话的中间状态,也就是 KV Cache,通常要在参数量基础上多留三到五成。下单一块显卡算着能装下、跑起来爆显存,差的就是这块。
| 维度 | 含义 | 反面对照 |
|---|---|---|
| 离线 | 拔网线也能跑,涨价/限流/下架影响不到 | 只给 API 则受制于人 |
| 可改 | 可继续训练,微调专属版本 | 调 API 永远做不到 |
| 留痕 | 数据不出自己的机器 | 医疗/法务/内部代码的唯一路径 |
只提供 API 的模型,你租的是使用权。价格、可用性、下线时间全由对方决定——这在技术选型时会直接变成风险。
不用读完整份许可证,按顺序问:
| 许可证 | 下载权重 | 商用 | 训练新模型 | |
|---|---|---|---|---|
| Qwen3 全系 | Apache 2.0 | 可 | 可,无用户量限制 | 可 |
| Mistral 7B | Apache 2.0 | 可 | 可,无限制 | 可 |
| DeepSeek-R1 | MIT License | 可 | 可,无需申请 | 可,官方明确允许蒸馏 |
| Llama 3 | Llama 3 Community License | 可 | 限月活超 7 亿需单独授权 | 可 |
| GPT-4 / Claude / Gemini Ultra | 无公开权重许可 | 否 | 否 | 否 |
三档归档:
许可证会变。 Qwen 在 2.5 那一代用分级许可:多数尺寸走 Apache 2.0,但 3B 采用 Qwen Research 许可、72B 采用 Qwen 许可;到 Qwen3 才统一成全系 Apache 2.0。同一系列内不同尺寸可能不一致。
上面五家,训练数据全都没有公开。
按传统软件的开源标准,源代码等价物应该是训练数据加训练代码,光给编译产物不算开源。大模型领域说的「开源」实际指权重开放——这是一个被行业默认接受的降级定义。你拿到的不是配方,是做好的菜。
| 厂商 | 策略 | 商业逻辑 |
|---|---|---|
| Meta | 权重开放 | 主营社交广告,把模型做成免费通用品 = 抽掉对手定价基础(补充品商品化) |
| 部分开源 | 小模型换开发者,旗舰闭源走 API 与云服务,两条腿走路 | |
| Mistral | 真开源 | Apache 2.0 建声誉,收入来自企业定制与私有化部署,靠服务不靠锁客 |
| 阿里 · Qwen | 全系开源 | 开源建事实标准,算力需求回到云上,模型免费、算力收费 |
| DeepSeek | MIT 开源 | 最宽松许可 + 明确允许蒸馏,以极低市场费用换全球技术声誉 |
| OpenAI | 完全闭源 | 最强能力即护城河,开源等于填平护城河 |
规律:一家公司开不开源,看的是模型在它的收入结构里处于什么位置。模型本身是商品的,倾向闭源;模型是获客入口或者互补品的,倾向开源。
下载量容易刷,榜单排名换个测法就变。衍生模型数量造不了假,因为每个衍生模型背后都是一次真实的算力投入。它本质上是一份长期的用户选择记录——开发者选底座考虑的是许可证是否干净、尺寸是否齐全、社区工具链是否现成。
参考数据(Hugging Face 平台统计,Qwen 系列,2026-01-21):衍生模型 20 万(全球首个达该量级的开源模型系列)、累计下载 10 亿次(日均约 110 万)、累计开源模型近 400 个。对照:衍生模型数 2025 年 2 月约 9 万,2025 年内突破 10 万。
Qwen3.8-Max 于 2026-08-03 发布,总参数 2.4 万亿、激活 950 亿,API 已可用,官方表示权重将开源。但截至核对日(2026-08-07)权重尚未放出,许可证未公布。
它现在填不进三档表的任何一档——判断需要的两个信息都缺。权重没放出来之前,谁也不知道会配什么样的许可证。
另需提醒:2.4 万亿参数权重文件是数 TB 量级。「权重开放」和「你跑得动」是两件事。
选它不是因为它最好,而是因为素材齐、方便动手:
中文社区里有人管它叫「源神」(开源之神)。这是网友的戏称,不是评价标准,也不代表它每一项都最强。学完这一章要拿到的是判断标准,不是一个品牌名——同一套标准套到任何一家身上都应该照样能用。
问一句:你的公司靠什么赚钱? 然后看模型在你的收入结构里处在哪个位置。
这个推演的好处是它不依赖任何行业知识,只要你知道公司怎么赚钱,就能推出大致方向。
| 误区 | 实际情况 |
|---|---|
| 「开源」= 训练数据也公开 | 实际指权重开放,是降级定义。五家训练数据均未公开 |
| 文件 16 GB 就是 16 GB 显存 | 运行时还要留 30%~50% 给 KV Cache |
| 这家公司开源,所以它全系都开源 | 同一系列不同尺寸可能不同许可(如 Qwen2.5 的 3B/72B) |
| 官方宣布要开源 = 可以选型了 | 权重未落地、许可证未公布前无法归档 |
| 下载量高 = 生态好 | 下载量可刷,衍生模型数量才是真实投入的记录 |
| 模型开源了 = 我能部署 | 数 TB 量级权重与可部署是两件事 |
生态集中的代价:当二十万个衍生模型都长在少数几个底座上,它们会一起继承同一套偏见、同一种表达习惯,甚至同一批错误。
参数量 × 2 是 FP16 下的理论估算,实际文件因分片方式与附带配置文件略有出入。oss01-播客.mp3oss01-播客.srtscript.txt本内容改编自小山学堂《学 AI 产品,从入门到精通》,为二次演绎配音版。
来源:xueai.miyang.cn(小山学堂 · 洛小山)