1
00:00:00,100 --> 00:00:06,432
本内容改编自小山学堂《学 AI 产品，从入门到精通》，为二次演绎配音版。

2
00:00:06,382 --> 00:00:19,675
这一集我们来解决一个很具体也很常见的尴尬，别人聊人工智能的时候，你听到的词个个眼熟，个个说不清，而且你隐约觉得有些话水分不小，但不知道该怎么问。

3
00:00:19,675 --> 00:00:21,550
本集做三件事。

4
00:00:21,550 --> 00:00:34,507
第一，把最常听到的那几个缩写放回各自的层级，人工智能、自然语言处理、大语言模型、生成式预训练变换器，一圈套一圈，听完你心里就有了一张图。

5
00:00:34,507 --> 00:00:44,591
第二，把训练这个词在圈内的真实含义讲清楚，顺带给你一把四层梯子，以后听到谁说训了个模型，你立刻知道他在第几层。

6
00:00:44,591 --> 00:00:52,271
第三，把发布会和朋友圈里最常见的八句话翻译成人话，再给你三个当场能问出底细的问题。

7
00:00:52,271 --> 00:00:54,603
为什么产品经理要关心。

8
00:00:54,603 --> 00:01:01,742
因为你每周都要在会场上听各种宣称，自研、深度赋能、全面拥抱智能体时代。

9
00:01:01,742 --> 00:01:06,394
这些词直接影响你做选型、排资源和定预期。

10
00:01:06,394 --> 00:01:12,391
分不清层级，你要么被话术带着走，要么因为听不懂而错过真东西。

11
00:01:12,391 --> 00:01:19,122
再往深一层说，这些概念背后其实连着两件事，一件是钱，一件是时间。

12
00:01:19,122 --> 00:01:28,088
算力贵，是所有人工智能服务收费的根源；训练贵，是为什么绝大多数团队只能站在别人的底座上做应用。

13
00:01:28,088 --> 00:01:34,387
把这两条想明白，你对一个需求要花多少钱、要排多久，心里就有数了。

14
00:01:34,387 --> 00:01:40,841
这一集的目标不是让你能拆穿谁，而是让你听懂之后，把判断留在心里。

15
00:01:41,000 --> 00:01:42,740
先解决缩写。

16
00:01:42,690 --> 00:01:48,748
新闻里一句话能塞四五个缩写，别慌，它们其实是一圈套一圈的关系。

17
00:01:48,748 --> 00:01:57,510
最外面那个圈是人工智能，它是最大的圈，所有让机器做原本需要人的智能才能做的事，都归在这里。

18
00:01:57,510 --> 00:02:01,933
里面一圈是自然语言处理，教机器懂人话的领域。

19
00:02:01,933 --> 00:02:06,452
再往里是大语言模型，就是管文字的那些大模型。

20
00:02:06,452 --> 00:02:14,445
最里面是生成式预训练变换器，也就是大家常说的 GPT，它是造大语言模型的一种主流做法。

21
00:02:14,445 --> 00:02:17,811
这里有个关键点，GPT 有双重身份。

22
00:02:17,811 --> 00:02:32,754
它原本是一串技术术语的缩写，指造大模型的一种做法；后来那家公司把自家产品也命名为这个系列，于是新闻里的这个词有了两个意思，说技术时指那种做法，说产品时指那家的模型。

23
00:02:32,754 --> 00:02:39,750
就像席梦思原本是一个床垫品牌，用的人多了，大家把这类床垫都叫席梦思。

24
00:02:39,750 --> 00:02:43,920
听到它时看一眼上下文，就能分清指哪个。

25
00:02:43,920 --> 00:02:46,528
还有几个词不在这一条线上。

26
00:02:46,528 --> 00:02:57,346
生成式人工智能内容，说的是拿这些工具去生成内容这件事本身，写文、画图、做视频都算，它是一个行为，不是一种模型。

27
00:02:57,346 --> 00:03:03,848
智能体，是给大模型装上手脚的应用形态，会自己拆任务、动手干活。

28
00:03:03,848 --> 00:03:10,326
通用人工智能，是终极目标，什么活都能干的通用智能，目前尚未实现。

29
00:03:10,326 --> 00:03:16,420
多模态，是长在模型身上的能力，文字、图片、声音都能看懂。

30
00:03:16,420 --> 00:03:20,627
下次再听到新缩写，先问一句它归哪个圈。

31
00:03:20,627 --> 00:03:30,326
是一种模型，就归到大语言模型那一层，比如视觉语言模型就是看得懂图的大语言模型，落在多模态能力上。

32
00:03:30,326 --> 00:03:36,997
是一种应用形态，就归到智能体那一层，各种数字员工多半是换个营销说法。

33
00:03:36,997 --> 00:03:42,262
是一种行为或能力，就归到生成式内容或者多模态那一类。

34
00:03:42,262 --> 00:03:48,223
新缩写多半是这几个的组合或变体，先归圈，就不会被吓住。

35
00:03:48,370 --> 00:03:53,908
第二个问题，一家卖显卡的公司，市值为什么能排进全球最前列。

36
00:03:53,858 --> 00:03:59,303
看懂它只需要两个画面，一场淘金潮，和一场算术比赛。

37
00:03:59,303 --> 00:04:01,010
先说淘金潮。

38
00:04:01,010 --> 00:04:09,171
当年淘金热有个经典观察，冲进金矿的人未必挖到金子，在路口卖铲子和牛仔裤的人先发了财。

39
00:04:09,171 --> 00:04:12,717
今天的人工智能就是新一轮淘金潮。

40
00:04:12,717 --> 00:04:20,024
淘金的人是全世界的公司，都冲进来训模型、做应用，谁最后挖到金子现在还说不准。

41
00:04:20,024 --> 00:04:27,368
铲子是算力，主要就是一排排装满显卡的机房，没铲子，再好的想法也开不了工。

42
00:04:27,368 --> 00:04:33,846
卖铲人就是这家公司，它卖的就是这把铲子，而且几乎是独一家，想买还得排队。

43
00:04:33,846 --> 00:04:41,382
训练一个大模型，光算力开销就在几十万到上亿的量级，这些钱大头流向了同一家公司。

44
00:04:41,382 --> 00:04:46,719
所以逻辑很简单，不管谁最后挖到金子，铲子人人都得买。

45
00:04:46,719 --> 00:04:50,649
淘金的人越多越疯狂，卖铲人越值钱。

46
00:04:50,649 --> 00:04:56,755
这也是为什么很多公司明明还没找到赚钱的场景，也愿意先囤一批卡。

47
00:04:56,755 --> 00:05:02,368
在他们看来，铲子本身就是家底，有没有挖到金子是后一步的事。

48
00:05:02,368 --> 00:05:09,964
理解这一点，你就能看懂那些看起来很激进的采购新闻背后，其实是一套很朴素的算术。

49
00:05:10,110 --> 00:05:16,165
第二个画面，为什么非要用显卡，电脑里原本的中央处理器也很强啊。

50
00:05:16,115 --> 00:05:18,483
因为两者的强法不一样。

51
00:05:18,483 --> 00:05:23,964
中央处理器像一位博士，什么难题都会，但一次专注做一道。

52
00:05:23,964 --> 00:05:29,601
显卡像一万名小学生，每人只会简单算术，但能同时开工。

53
00:05:29,601 --> 00:05:35,767
人工智能训练要算的恰好是海量的简单乘加，正对小学生的胃口。

54
00:05:35,767 --> 00:05:47,642
你可以想象一场比赛，二十四道题，博士逐题精算，一道道磨，终于算完了；小学生那边题目简单，全员同时开工，唰一下，一眨眼全算完。

55
00:05:47,642 --> 00:05:53,868
题目简单但数量巨大时，一万名同时开工的小学生完胜一位博士。

56
00:05:53,868 --> 00:05:58,195
训练要算的正是这种题，而且是天文数字的量。

57
00:05:58,195 --> 00:06:00,490
那为什么别家追不上。

58
00:06:00,490 --> 00:06:04,144
造出性能接近的芯片，别家未必做不到。

59
00:06:04,144 --> 00:06:08,747
难追的是另一样东西，多年积累的软件工具链和生态。

60
00:06:08,747 --> 00:06:17,522
全世界的开发者写程序，用的那套工具默认长在它的地基上，换一家的芯片，等于让所有人搬家重装修。

61
00:06:17,522 --> 00:06:23,050
硬件可以砸钱造，生态只能靠时间长，这就是它的护城河。

62
00:06:23,050 --> 00:06:24,973
这跟你有什么关系。

63
00:06:24,973 --> 00:06:29,793
关系很直接，算力贵，是所有人工智能服务收费的根源。

64
00:06:29,793 --> 00:06:41,031
你每次对话，按词元计的费里摊着显卡的折旧和机房的电费；生成一张图比生成一段文字贵几十倍，也是因为图要算的量比文字大得多。

65
00:06:41,031 --> 00:06:45,622
理解了铲子有多贵，就理解了账单为什么长那样。

66
00:06:45,622 --> 00:06:53,159
顺带解释一个高频词，公司之间比拼算力储备、囤了多少张卡，说的就是谁家铲子多。

67
00:06:53,159 --> 00:07:00,178
铲子多，训练快、服务稳，招开发者也容易，这是人工智能时代新的家底。

68
00:07:00,320 --> 00:07:05,606
第三个问题，饭局上总有人举着酒杯说我最近训了个模型。

69
00:07:05,556 --> 00:07:09,342
这句话的水分可以从零到百分之九十九。

70
00:07:09,342 --> 00:07:13,345
先说清楚训练这个词在圈内的真实含义。

71
00:07:13,345 --> 00:07:17,227
大模型里面装着几百亿到上万亿个参数。

72
00:07:17,227 --> 00:07:28,188
参数说白了就是一大堆数字，你可以把它们想象成调音台上密密麻麻的旋钮，模型的每一分本事，全都存在这些旋钮拧到了哪个位置上。

73
00:07:28,188 --> 00:07:33,320
训练就是把这几百亿个旋钮一个个拧对，办法笨得出奇。

74
00:07:33,320 --> 00:07:36,578
遮住后半句，让模型猜下一个词。

75
00:07:36,578 --> 00:07:44,943
比如给它今天天气真，它蒙了个香，原文却是好，猜错了，就把参与这次判断的旋钮各自拧回来一丁点。

76
00:07:44,943 --> 00:07:49,498
一次只挪极小一格，然后换下一句，再来一遍。

77
00:07:49,498 --> 00:07:52,155
这个动作要重复上万亿次。

78
00:07:52,155 --> 00:07:59,210
冲刷完，旋钮的位置里就沉淀下了天气后面更可能跟好、不太可能跟香这件事。

79
00:07:59,210 --> 00:08:02,311
所谓学会，全部内容就是这个。

80
00:08:02,311 --> 00:08:09,582
这件事费电、费卡、费钱，跟供一个孩子读完二十年书差不多，属于重资产工程。

81
00:08:09,582 --> 00:08:19,234
注意这里的对比，一次训练要重复上万亿次拧旋钮的动作，而你平时跟它说一句话，只是一次调用，旋钮纹丝不动。

82
00:08:19,234 --> 00:08:26,806
而你平时对它说你是一位资深编辑，或者给它上传一份公司资料，这些操作一个参数都没动。

83
00:08:26,806 --> 00:08:34,366
打个比方，前者是重新培养一个大学生，后者是给现成的大学生递一张便签、发一本手册。

84
00:08:34,366 --> 00:08:38,669
便签很有用，但你不能说自己培养了一个大学生。

85
00:08:38,669 --> 00:08:45,183
所以下次听到训了个模型，第一反应可以是，他动没动参数，动了多少。

86
00:08:45,320 --> 00:08:49,320
有了这个认识，就能把所有情况分成四层。

87
00:08:49,270 --> 00:08:54,198
从下往上，每爬一层，成本和门槛都指数级上升。

88
00:08:54,198 --> 00:08:56,433
第一层，改提示词。

89
00:08:56,433 --> 00:08:59,042
换个说法，让它更懂你。

90
00:08:59,042 --> 00:09:06,902
给模型一段角色设定、工作流程、输出要求，比如你是一位严谨的法务，回答前先列风险点。

91
00:09:06,902 --> 00:09:13,308
耗时几分钟，成本免费，模型参数一个没动，但输出质量可以天差地别。

92
00:09:13,308 --> 00:09:16,746
九成的日常需求，这一层就够了。

93
00:09:16,746 --> 00:09:20,760
第二层，挂知识库，也叫检索增强生成。

94
00:09:20,760 --> 00:09:27,732
把公司文档、产品手册整理好放进一个书架，它回答前先去翻一翻，再照着资料作答。

95
00:09:27,732 --> 00:09:31,590
耗时几小时到几天，成本几百到几万。

96
00:09:31,590 --> 00:09:39,114
听起来像教会了它，但模型本身没变，只是手边多了参考书，书拿走，它立刻恢复原样。

97
00:09:39,114 --> 00:09:41,049
第三层，微调。

98
00:09:41,049 --> 00:09:44,366
真的动了参数，但底座是别人的。

99
00:09:44,366 --> 00:09:51,506
拿一个练好的开源模型，用自己的几千到几十万条数据接着练，参数真的被改了。

100
00:09:51,506 --> 00:09:57,131
耗时几天到几周，成本几千到几十万，需要数据和工程师。

101
00:09:57,131 --> 00:10:01,073
相当于给一位大学毕业生做岗前专科培训。

102
00:10:01,073 --> 00:10:07,888
到这一层，说训了个模型勉强成立，但要记住，底座那个大脑还是别人造的。

103
00:10:07,888 --> 00:10:10,472
第四层，从头预训练。

104
00:10:10,472 --> 00:10:18,657
从一堆随机数字开始，用半个互联网的数据、成千上万张显卡，练几个月，造出一个全新的大脑。

105
00:10:18,657 --> 00:10:25,340
成本数千万到上亿，全球有能力做这件事的公司，一只手数得过来还有富余。

106
00:10:25,340 --> 00:10:32,888
如果饭局上有人轻描淡写地说自己干了这个，你大概率正在见证一个传说，或者一个段子。

107
00:10:32,888 --> 00:10:37,840
饭局上九成所谓的训模型，都发生在最下面两层。

108
00:10:37,980 --> 00:10:39,829
来做个对号入座。

109
00:10:39,779 --> 00:10:44,238
第一句，我用某个对话产品训了个懂我们公司的模型。

110
00:10:44,238 --> 00:10:51,449
多半是第一层或第二层，在对话产品里能做的，基本就是写提示词、传资料这两件事。

111
00:10:51,449 --> 00:10:55,980
有用，值得肯定，但离训模型还差着两层楼。

112
00:10:55,980 --> 00:10:59,430
第二句，我们微调了开源模型做客服。

113
00:10:59,430 --> 00:11:06,377
这句反而实诚，他准确说出了自己在哪一层，动了参数，底座用的开源模型。

114
00:11:06,377 --> 00:11:09,971
能这么说话的人，通常真的干过活。

115
00:11:09,971 --> 00:11:14,334
第三句，我天天用，它被我训得越来越懂我了。

116
00:11:14,334 --> 00:11:16,401
这连第一层都算不上。

117
00:11:16,401 --> 00:11:25,175
日常聊天改变不了模型的任何参数，你感觉它越来越懂你，多半来自记忆功能，或者你自己提问变熟练了。

118
00:11:25,175 --> 00:11:28,336
第四句，我们自研了行业大模型。

119
00:11:28,336 --> 00:11:35,728
这个词的弹性极大，从头预训练叫自研，微调开源模型也有人叫自研，必须追问。

120
00:11:35,728 --> 00:11:39,562
第五句，我给它写了一套人设和工作流程。

121
00:11:39,562 --> 00:11:43,577
这是第一层，而且说得很清楚，值得表扬。

122
00:11:43,577 --> 00:11:48,024
他没有借用训练这个大词，老老实实描述了自己干的事。

123
00:11:48,024 --> 00:11:51,593
分不清对方在哪一层，不用猜，直接问。

124
00:11:51,593 --> 00:11:58,649
三个问题分别卡住成本、数据、底座三个要害，答不上来的人自己会往下滑层。

125
00:11:58,649 --> 00:12:04,274
第一问，花了多少算力，说不出成本量级的训练，多半没发生过。

126
00:12:04,274 --> 00:12:14,610
第二问，多少条数据，跑了几轮，几百份文档丢进检索库是第二层，几千上万条标好的问答对、还得跑上几轮才是第三层。

127
00:12:14,610 --> 00:12:21,726
第三问，底座是什么模型，含糊其辞说核心技术不便透露的，可以默认停在第一层。

128
00:12:21,726 --> 00:12:27,771
最后说句公道话，改提示词毫不丢人，它是四层里性价比最高的一层。

129
00:12:27,771 --> 00:12:33,336
丢人的从来只有一件事，明明在第一层，非说自己在第四层。

130
00:12:33,490 --> 00:12:38,055
最后我们把发布会和朋友圈里最常见的几句话翻个面。

131
00:12:38,005 --> 00:12:48,606
每张卡配一个含金量档位，足金是词和事对得上，镀金是事真的但词夸大了，看情况是弹性极大，纯话术是不含有效信息。

132
00:12:48,606 --> 00:12:53,882
提前剧透一句，这里足金很少见，现实中它就是这么少见。

133
00:12:53,882 --> 00:12:56,911
自主研发了大模型，看情况。

134
00:12:56,911 --> 00:13:04,736
从头预训练、二次训练、微调、接接口，都有人管自己叫自研，成本差着几个数量级。

135
00:13:04,736 --> 00:13:07,813
基于深度自研的技术架构，镀金。

136
00:13:07,813 --> 00:13:15,325
通常指基于开源模型做了改造，改造是真实工作，但深度二字改多改少没人知道。

137
00:13:15,325 --> 00:13:18,317
绝对没做套壳产品，看情况。

138
00:13:18,317 --> 00:13:28,678
壳没有原罪，你天天用的很多好产品都是壳，壳的厚度才是本事，真正该警惕的只有一种，壳很薄还非说自己有底层技术。

139
00:13:28,678 --> 00:13:31,755
已上线一百个数字员工，镀金。

140
00:13:31,755 --> 00:13:43,269
一般等于配好了一百套提示词和工作流程的智能体，活是真的能干，但员工的叫法容易让人以为有一百个独立大脑，实际共用同一个模型。

141
00:13:43,269 --> 00:13:46,659
全面拥抱智能体时代，纯话术。

142
00:13:46,659 --> 00:13:57,296
智能体就是能自己动手干活的人工智能，概念本身有真东西，但全面拥抱四个字没有任何具体承诺，放在哪年哪家都能用。

143
00:13:57,296 --> 00:14:01,274
用人工智能为业务深度赋能，纯话术。

144
00:14:01,274 --> 00:14:10,349
大概率是某个环节接了接口，比如客服加了自动回复，接接口是正经事，但深度两个字建议先打个问号。

145
00:14:10,349 --> 00:14:13,450
人工智能原生应用，看情况。

146
00:14:13,450 --> 00:14:25,757
这个词有真含义，整个产品围绕它重新设计，去掉就没法用了，但也经常被拿来包装老产品加了个按钮，判断方法很简单，把它关掉，产品还剩什么。

147
00:14:25,757 --> 00:14:36,478
最后，全面押注人工智能，纯话术，战略口号，口号本身不含信息量，要看的是招了多少人、上线了什么、用户用没用。

148
00:14:36,630 --> 00:14:40,774
最后给你一份可以马上用的判断清单，一共四条。

149
00:14:40,724 --> 00:14:43,477
第一条，听到缩写先归圈。

150
00:14:43,477 --> 00:14:54,498
人工智能是最大的圈，里面是自然语言处理，再往里是大语言模型，生成式预训练变换器是造它的一种做法，同时也是一个产品名。

151
00:14:54,498 --> 00:15:02,371
生成式内容是行为，智能体是应用形态，通用人工智能是尚未实现的目标，多模态是能力。

152
00:15:02,371 --> 00:15:08,392
新缩写先问它归哪个圈，是模型、是应用形态，还是一种行为能力。

153
00:15:08,392 --> 00:15:11,169
第二条，记住卖铲人这条链。

154
00:15:11,169 --> 00:15:18,909
人工智能训练要的是海量简单算术，显卡赢在并行，铲子人人都得买，生态才是护城河。

155
00:15:18,909 --> 00:15:24,594
你每次对话、每张图的价格里，都摊着显卡的折旧和机房的电费。

156
00:15:24,594 --> 00:15:33,441
第三条，听到训了个模型，先在心里放一把四层梯子，改提示词、挂知识库、微调、从头预训练。

157
00:15:33,441 --> 00:15:37,792
判断标准只有一个，动没动参数，动了多少。

158
00:15:37,792 --> 00:15:44,402
追问三连随身携带，花了多少算力，多少条数据跑了几轮，底座是什么模型。

159
00:15:44,402 --> 00:15:52,635
第四条，听宣传抓三件事，模型底座、训练数据、成本量级，三个都含糊的可以直接换台。

160
00:15:52,635 --> 00:15:59,114
壳不丢人，吹牛才丢人，好产品大多是厚壳，要警惕的是薄壳配大词。

161
00:15:59,114 --> 00:16:05,484
口号不含信息量，听到深度赋能、全面拥抱这类词，自动静音即可。

162
00:16:05,484 --> 00:16:10,820
这套东西的用法是默默翻译、礼貌追问，把判断留在心里。

163
00:16:10,820 --> 00:16:14,570
真话术不攻自破，真本事也藏不住。

