1
00:00:00,100 --> 00:00:06,432
本内容改编自小山学堂《学 AI 产品，从入门到精通》，为二次演绎配音版。

2
00:00:06,382 --> 00:00:09,495
新闻里天天说某某模型开源了。

3
00:00:09,495 --> 00:00:12,836
开源的到底是什么东西，是代码吗。

4
00:00:12,836 --> 00:00:15,637
其实主要是一个文件，权重。

5
00:00:15,637 --> 00:00:23,052
这一集就从这个文件讲起，搞清楚它是什么，后面所有关于开源的争论你都能自己判断。

6
00:00:23,052 --> 00:00:25,084
这一集分三段走。

7
00:00:25,084 --> 00:00:31,670
第一段讲权重本身，它长什么样、多大、为什么说拥有权重就是拥有控制权。

8
00:00:31,670 --> 00:00:38,581
第二段讲怎么看懂一张许可证，三个问题问完，各家嘴里的开源差多远就清楚了。

9
00:00:38,581 --> 00:00:47,656
第三段讲商业逻辑，开源要花钱，权重放出去了就收不回来，没有一家是做慈善，那他们到底在图什么。

10
00:00:47,656 --> 00:00:53,762
先说清楚一件事，后面举的例子大部分取自千问，但不是因为它最好。

11
00:00:53,762 --> 00:01:04,867
选它是因为素材齐，尺寸铺得最全，从很小的型号一直到超大规模都有公开型号，同一个系列内部比较不会掺进架构差异的干扰。

12
00:01:04,867 --> 00:01:12,716
你学完要拿到的是判断标准，不是品牌名，同一套标准套到任何一家身上都应该照样能用。

13
00:01:12,870 --> 00:01:14,298
先说结论。

14
00:01:14,248 --> 00:01:18,202
权重就是模型训练完之后留下的一堆数字。

15
00:01:18,202 --> 00:01:24,416
训练花掉的几千万美元、几个月的算力，最后全部凝结成这一个文件。

16
00:01:24,416 --> 00:01:32,217
拿到它，你就能在自己的机器上跑出一模一样的模型，不需要联网，不需要向任何人付费。

17
00:01:32,217 --> 00:01:36,868
模型内部没有规则，没有知识库，没有判断分支。

18
00:01:36,868 --> 00:01:42,301
有的只是一个巨大的数字表格，表格里的每个数就是一个权重。

19
00:01:42,301 --> 00:01:46,507
一个八十亿参数的模型，就有八十亿个这样的数。

20
00:01:46,507 --> 00:01:52,986
训练的全部意义，就是把这几十亿个数从随机值一点点调整到合适的值。

21
00:01:52,986 --> 00:01:56,652
调完了，参数冻结，模型就定型了。

22
00:01:56,652 --> 00:02:00,270
这里顺带解释了一件很多人困惑的事。

23
00:02:00,270 --> 00:02:04,320
模型跟你聊天的时候，并不会学到任何东西。

24
00:02:04,320 --> 00:02:08,575
权重是训练阶段定死的，对话阶段只读不写。

25
00:02:08,575 --> 00:02:11,411
你告诉它的事，它下次就忘了。

26
00:02:11,411 --> 00:02:14,849
这不是产品没做好，是这个结构决定的。

27
00:02:14,849 --> 00:02:21,051
所谓上下文，是临时摆在旁边的一块工作区，不是写进权重里的记忆。

28
00:02:21,051 --> 00:02:22,806
再补一个佐证。

29
00:02:22,806 --> 00:02:30,185
深度求索放出的蒸馏版里，大部分用的是千问底座，这是第三方的选择，不是自家宣传。

30
00:02:30,185 --> 00:02:36,087
别人愿意拿你的权重当底座去继续训练，这件事本身就很说明问题。

31
00:02:36,087 --> 00:02:40,270
选它还有第三个理由，它自己就是个反面教材。

32
00:02:40,270 --> 00:02:47,253
二点五那一代的两个尺寸用过非标准许可证，正好拿来讲开源这两个字有多不可靠。

33
00:02:47,253 --> 00:02:53,803
一个系列内部都能出现两套规则，你就别指望厂商的宣传语能有多精确了。

34
00:02:53,803 --> 00:02:59,116
最后再强调一次，中文社区里有人管它叫源神，开源之神。

35
00:02:59,116 --> 00:03:04,488
这是网友的戏称，不是评价标准，也不代表它每一项都最强。

36
00:03:04,488 --> 00:03:09,428
你学完这一集要拿到的是判断标准，不是一个品牌名。

37
00:03:09,580 --> 00:03:13,580
每个权重占多少字节，取决于存储精度。

38
00:03:13,530 --> 00:03:18,891
模型发布时通常用十六位浮点，也就是每个数占两个字节。

39
00:03:18,891 --> 00:03:24,924
所以文件体积有个很好记的估算，权重文件体积约等于参数量乘以二。

40
00:03:24,924 --> 00:03:28,482
八十亿参数乘两个字节，十六 GB。

41
00:03:28,482 --> 00:03:31,114
拿一组真实型号做尺子。

42
00:03:31,114 --> 00:03:45,589
六亿参数约一点二 GB，八十亿参数约十六 GB，三百二十亿参数约六十四 GB，两千三百五十亿参数的混合专家型号约四百七十 GB，至于总参数二点四万亿的旗舰，那就是数 TB 量级了。

43
00:03:45,589 --> 00:03:49,640
这里有个特别容易混淆的地方，一定要说清楚。

44
00:03:49,640 --> 00:03:52,789
存储体积和运行时占用是两码事。

45
00:03:52,789 --> 00:03:57,104
文件十六 GB，不代表十六 GB 显存就能跑起来。

46
00:03:57,104 --> 00:04:03,942
模型运行时还要额外开销一块地方存放对话的中间状态，也就是 KV Cache。

47
00:04:03,942 --> 00:04:08,570
算下来通常要在参数量的基础上多留三到五成。

48
00:04:08,570 --> 00:04:12,909
结论就一句话，看文件大小估显存，会低估。

49
00:04:12,909 --> 00:04:21,635
这个坑很多人踩过，下单一块显卡，算着能装下，结果跑起来直接爆显存，差的就是那块中间状态。

50
00:04:21,770 --> 00:04:25,397
把上面的事串起来，权重的意义就清楚了。

51
00:04:25,347 --> 00:04:28,569
它不只是一个文件，它是控制权。

52
00:04:28,569 --> 00:04:29,963
第一是离线。

53
00:04:29,963 --> 00:04:36,682
不依赖任何服务商，拔掉网线也能跑，对方涨价、限流、下架都影响不到你。

54
00:04:36,682 --> 00:04:40,528
这一条在供应链不稳定的时候特别值钱。

55
00:04:40,528 --> 00:04:41,994
第二是可改。

56
00:04:41,994 --> 00:04:47,258
能在它基础上继续训练，用自己的数据微调出一个专属版本。

57
00:04:47,258 --> 00:04:52,631
这是调接口永远做不到的，因为接口那头的权重你碰不到。

58
00:04:52,631 --> 00:04:54,266
第三是留痕。

59
00:04:54,266 --> 00:04:56,393
数据不出自己的机器。

60
00:04:56,393 --> 00:05:02,126
医疗、法务、内部代码这类不能外发的场景，只有这一条路。

61
00:05:02,126 --> 00:05:06,081
合规要求摆在那儿，不是你愿意不愿意的问题。

62
00:05:06,081 --> 00:05:10,648
反过来看，只提供接口的模型，你租的是使用权。

63
00:05:10,648 --> 00:05:14,795
价格、可用性、什么时候下线，全由对方决定。

64
00:05:14,795 --> 00:05:24,686
这个区别在做技术选型时会直接变成风险，而它引出的正是下一节要拆的东西，各家嘴里的开源，含义差得非常远。

65
00:05:24,840 --> 00:05:27,758
第二段讲怎么看懂一张许可证。

66
00:05:27,708 --> 00:05:33,249
几乎每家都说自己开源，但这个词在各家嘴里的含义差得很远。

67
00:05:33,249 --> 00:05:39,619
有的能随便商用，有的用户量一大就要另外签合同，有的只是发了篇论文。

68
00:05:39,619 --> 00:05:43,658
学会自己判断，比记住谁家开源更有用。

69
00:05:43,658 --> 00:05:50,809
不用读完整份许可证，按顺序问三个问题，绝大多数模型的开放程度就定位清楚了。

70
00:05:50,809 --> 00:05:53,790
第一问，权重文件能下载吗。

71
00:05:53,790 --> 00:05:57,083
能下载，才谈得上后面所有事情。

72
00:05:57,083 --> 00:06:04,163
只能通过接口调用的模型，无论宣传里怎么写，你都拿不到前面说的那个控制权。

73
00:06:04,163 --> 00:06:06,687
这一问就能筛掉一大半。

74
00:06:06,687 --> 00:06:10,268
第二问，能商用吗，有没有附加门槛。

75
00:06:10,268 --> 00:06:12,119
这里最容易踩坑。

76
00:06:12,119 --> 00:06:18,249
有的许可证允许商用，但加了用户规模上限；有的限定只能用于研究。

77
00:06:18,249 --> 00:06:24,499
做产品之前不看清楚，等用户量涨上来才发现要补授权，就很被动了。

78
00:06:24,499 --> 00:06:28,261
第三问，能用它的输出去训练新模型吗。

79
00:06:28,261 --> 00:06:30,629
也就是能不能拿它做蒸馏。

80
00:06:30,629 --> 00:06:38,754
这一条决定了你能否在它基础上做出自己的模型，各家在这一条上的态度分歧最大。

81
00:06:38,900 --> 00:06:42,503
拿这把尺子去量五家，结论很直观。

82
00:06:42,453 --> 00:06:50,626
千问三全系，阿帕奇二点零协议，可下载权重，可商用且无用户量限制，可用于训练新模型。

83
00:06:50,626 --> 00:06:57,129
米斯特拉尔七 B，同样是阿帕奇二点零，可下载、可商用无限制、可用于训练。

84
00:06:57,129 --> 00:07:05,626
深度求索的推理模型，用的是 MIT 协议，可下载权重，可商用无需申请，而且官方明确允许蒸馏。

85
00:07:05,626 --> 00:07:11,275
拉玛三，可下载权重，也可用于训练新模型，但商用有门槛。

86
00:07:11,275 --> 00:07:18,319
它的社区许可里写着，上一自然月月活超过七亿需要向厂商申请单独商业授权。

87
00:07:18,319 --> 00:07:26,155
至于 GPT-4、Claude、Gemini Ultra 这一档，权重不可下载，无法本地部署，无法用于训练。

88
00:07:26,155 --> 00:07:28,619
收成三个档次就清楚了。

89
00:07:28,619 --> 00:07:41,900
第一档是权重开放且无附加条件，用的是阿帕奇二点零、MIT 这类标准开源许可，下载、修改、商用、再分发、拿去训练都不需要额外打招呼，法务审起来最省事。

90
00:07:41,900 --> 00:07:50,122
第二档是权重开放但附带自定义条款，技术完全可用，商业上要先算清楚自己会不会撞到红线。

91
00:07:50,122 --> 00:07:55,747
第三档是只提供接口，能力可能是最强的，但你租的是使用权。

92
00:07:55,747 --> 00:08:01,059
还有一件事必须说清楚，上面五家，训练数据全都没有公开。

93
00:08:01,059 --> 00:08:09,340
按传统软件的开源标准，源代码等价物应该是训练数据加训练代码，光给编译产物不算开源。

94
00:08:09,340 --> 00:08:13,643
大模型领域里说的开源，实际指的是权重开放。

95
00:08:13,643 --> 00:08:20,025
这是一个被行业默认接受的降级定义，用这个词的时候心里要清楚它的边界。

96
00:08:20,025 --> 00:08:23,042
你拿到的不是配方，是做好的菜。

97
00:08:23,042 --> 00:08:26,227
同样值得留意的是，许可证会变。

98
00:08:26,227 --> 00:08:39,184
千问在二点五那一代用的是分级许可，多数尺寸走阿帕奇二点零，但三十亿和七百二十亿两个尺寸另有单独条款，到千问三才统一成全系阿帕奇二点零。

99
00:08:39,184 --> 00:08:46,263
所以选型时看的应该是你要用的那个具体版本的许可证，不是这家公司的整体印象。

100
00:08:46,263 --> 00:08:49,040
带走一张自查清单，四条。

101
00:08:49,040 --> 00:08:54,437
一，去官方仓库找许可证文件本身，不看新闻稿和宣传页。

102
00:08:54,437 --> 00:09:00,650
二，确认你要用的那个具体尺寸的许可证，同一系列内可能不一致。

103
00:09:00,650 --> 00:09:07,550
三，如果是自定义许可证，重点找用户规模、使用场景、地域这三类限制。

104
00:09:07,550 --> 00:09:13,884
四，确认能否用于训练，这决定了你之后有没有微调和蒸馏的空间。

105
00:09:14,040 --> 00:09:17,824
第三段换个角度，这些厂商为什么要开源。

106
00:09:17,774 --> 00:09:25,214
训练一个旗舰模型要烧掉巨额算力，权重一旦放出去就收不回来，没有一家是做慈善。

107
00:09:25,214 --> 00:09:30,706
Meta 权重开放，因为自己不靠卖模型赚钱，主营是社交广告。

108
00:09:30,706 --> 00:09:35,646
把模型做成免费的通用品，等于抽掉对手的定价基础。

109
00:09:35,646 --> 00:09:41,620
经济学里叫补充品商品化，你的互补品越便宜，你的主业越值钱。

110
00:09:41,620 --> 00:09:52,581
Google 部分开源，小模型开源换开发者，旗舰闭源走接口与云服务变现，两条腿走路，既不放弃生态，也不让出最强能力的定价权。

111
00:09:52,581 --> 00:10:03,603
米斯特拉尔真开源，基础模型用阿帕奇二点零建立技术声誉，收入来自企业定制与私有化部署合同，靠服务赚钱，不靠接口锁客。

112
00:10:03,603 --> 00:10:13,315
千问全系开源，开源建立事实标准，开发者拿去微调、部署，最终大量算力需求回到云上，模型免费，算力收费。

113
00:10:13,315 --> 00:10:21,379
这条路径要跑通，前提是生态规模足够大，所以它在尺寸覆盖和发布密度上一直很激进。

114
00:10:21,379 --> 00:10:31,163
深度求索用 MIT 这种最宽松的许可，并明确允许拿它的输出去蒸馏，以极低的市场费用换取全球范围的技术声誉。

115
00:10:31,163 --> 00:10:39,540
OpenAI 完全闭源，从非营利开源起步，转向商业闭源，最强能力就是护城河，开源等于把护城河填平。

116
00:10:39,540 --> 00:10:46,500
规律一句话，一家公司开不开源，看的是模型在它的收入结构里处于什么位置。

117
00:10:46,500 --> 00:10:53,579
模型本身是商品的，倾向闭源；模型是获客入口或者互补品的，倾向开源。

118
00:10:53,579 --> 00:11:02,738
这条规律还可以套到你自己身上，问一句你的公司靠什么赚钱，然后看模型在你的收入结构里处在哪个位置。

119
00:11:02,738 --> 00:11:12,137
如果模型就是你卖的东西，那开源等于把货白送；如果模型只是让客户更容易买你别的产品的东西，那越便宜越好。

120
00:11:12,137 --> 00:11:20,478
这个推演的好处是它不依赖任何行业知识，只要你知道公司怎么赚钱，就能推出来大致的方向。

121
00:11:20,620 --> 00:11:23,995
怎么衡量一个开源生态的真实影响力。

122
00:11:23,945 --> 00:11:27,635
下载量容易刷，榜单排名换个测法就变。

123
00:11:27,635 --> 00:11:36,613
行业里更看重的是衍生模型数量，也就是有多少开发者真的拿它的权重再训练出了新模型并发布出来。

124
00:11:36,613 --> 00:11:42,803
这个数字造不了假，因为每一个衍生模型背后都是一次真实的算力投入。

125
00:11:42,803 --> 00:11:44,450
看一组数字。

126
00:11:44,450 --> 00:11:59,125
某系列衍生模型二十万个，是全球首个达到该量级的开源模型系列；累计下载十亿次，日均约一百一十万次；累计开源的模型数近四百个，覆盖文本、多模态、代码等方向。

127
00:11:59,125 --> 00:12:05,736
作为对照，该系列衍生模型数在二零二五年二月约九万，当年内突破十万。

128
00:12:05,736 --> 00:12:10,315
这组数字真正说明的事情是，开发者会用脚投票。

129
00:12:10,315 --> 00:12:21,289
他们选择在哪个底座上继续训练，考虑的是许可证是否干净、尺寸是否齐全、社区里能不能找到现成的工具链，跟宣传没什么关系。

130
00:12:21,289 --> 00:12:26,253
所以衍生模型数量本质上是一份长期的用户选择记录。

131
00:12:26,253 --> 00:12:29,306
还有一个正好可以用来练手的例子。

132
00:12:29,306 --> 00:12:39,366
二零二六年八月三日发布的旗舰型号，总参数二点四万亿，激活参数九百五十亿，接口已经可用，官方表示权重将开源。

133
00:12:39,366 --> 00:12:44,882
但截至核对日，权重还没放出来，采用什么许可证也没有公布。

134
00:12:44,882 --> 00:12:49,762
宣布要开源和已经开源是两件事，这不是咬文嚼字。

135
00:12:49,762 --> 00:12:54,546
权重没放出来之前，谁也不知道它会配一张什么样的许可证。

136
00:12:54,546 --> 00:13:00,808
回到那张三档表，它现在还填不进任何一档，判断需要的两个信息都缺。

137
00:13:00,808 --> 00:13:08,392
顺便提醒一句，这个尺寸你多半跑不动，二点四万亿参数的权重文件是数 TB 量级。

138
00:13:08,392 --> 00:13:13,837
权重开放和你跑得动是两件事，这一点对任何大模型都成立。

139
00:13:13,837 --> 00:13:17,983
上面六家的策略不一样，开到什么程度也不一样。

140
00:13:17,983 --> 00:13:27,503
有的只开小尺寸、把最强的留在自己产品里，比如放出小系模型、留住旗舰；也有的把最强的那个直接开出来。

141
00:13:27,503 --> 00:13:33,825
所以旗舰能不能开没有统一答案，得一家一家看，一个模型一个模型看。

142
00:13:33,825 --> 00:13:43,548
这条结论的实操价值在于，别用对某一家形成的印象去猜另一家，尤其别用某个系列的历史行为去预测它的下一代。

143
00:13:43,680 --> 00:13:47,367
最后收几条能直接用在选型上的原则。

144
00:13:47,317 --> 00:13:51,897
第一，先看许可证，确认能不能用、有没有门槛。

145
00:13:51,897 --> 00:14:01,019
去官方仓库找许可证文件本身，不看新闻稿，而且要确认你要用的那个具体尺寸，同一系列内可能不一致。

146
00:14:01,019 --> 00:14:05,587
第二，再看商业逻辑，判断这家会不会持续开源。

147
00:14:05,587 --> 00:14:13,363
靠模型直接赚钱的公司，开源策略随时可能收紧；开源是获客手段的公司，通常更稳定。

148
00:14:13,363 --> 00:14:17,438
这一条决定的是长期风险，不是当下能不能用。

149
00:14:17,438 --> 00:14:20,166
第三，最后看生态厚度。

150
00:14:20,166 --> 00:14:27,522
衍生模型多、社区工具全，意味着你遇到问题时能搜到答案，出了 bug 有人已经踩过。

151
00:14:27,522 --> 00:14:31,416
用衍生模型数量去衡量，别看下载量。

152
00:14:31,416 --> 00:14:34,938
第四，把「宣布要开源」和「已经开源」分开。

153
00:14:34,938 --> 00:14:39,926
权重没落地、许可证没公布之前，任何判断都是猜的。

154
00:14:39,926 --> 00:14:46,813
同理，权重开放和你跑得动是两件事，别因为一个模型开源了就默认你能部署。

155
00:14:46,813 --> 00:14:54,012
第五，记住大模型领域的开源是个降级定义，指的是权重开放，不是训练数据开放。

156
00:14:54,012 --> 00:15:01,849
用这个词的时候心里要有边界，跟法务沟通时尤其要说清楚，否则双方理解的根本不是一回事。

157
00:15:01,849 --> 00:15:06,957
此外还有一条容易被忽略的代价，生态集中是有风险的。

158
00:15:06,957 --> 00:15:16,572
当二十万个衍生模型都长在少数几个底座上，它们会一起继承同一套偏见、同一种表达习惯，甚至同一批错误。

159
00:15:16,572 --> 00:15:22,870
选型时把鸡蛋放在几个篮子里，和放在一个篮子里，风险完全不同。

