1
00:00:00,100 --> 00:00:06,432
本内容改编自小山学堂《学 AI 产品，从入门到精通》，为二次演绎配音版。

2
00:00:06,382 --> 00:00:12,812
这一集我们一次讲清八个词，它们几乎出现在每一场关于人工智能的会议里。

3
00:00:12,812 --> 00:00:15,192
先说本集解决什么问题。

4
00:00:15,192 --> 00:00:26,670
你大概有过这种体验，会上大家都在点头，但你其实没听懂百万词元、上下文窗口、深度思考、微调这几个词，也不敢在那种气氛里举手问。

5
00:00:26,670 --> 00:00:31,322
散会以后自己去搜，搜到的又是一堆互相引用的文章。

6
00:00:31,322 --> 00:00:37,968
这一集把这八个词按一条线排好，让你知道它们各自管什么、彼此怎么连起来。

7
00:00:37,968 --> 00:00:40,805
再说为什么产品经理要关心。

8
00:00:40,805 --> 00:00:45,552
这八个词不是技术细节，它们直接对应四件你躲不开的事。

9
00:00:45,552 --> 00:00:50,673
第一件是预算，按词元计费意味着你每一次提问都在花钱。

10
00:00:50,673 --> 00:00:58,665
第二件是方案边界，模型能记住多少、能不能看图、要不要重新训练，决定了你能承诺什么。

11
00:00:58,665 --> 00:01:02,247
第三件是选型，参数大不等于划算。

12
00:01:02,247 --> 00:01:10,649
第四件是和供应商对话，对方说要给你微调一个专属模型，你得知道那是多少钱、多久、值不值。

13
00:01:10,649 --> 00:01:13,040
还有一层更现实的考虑。

14
00:01:13,040 --> 00:01:19,098
现在很多人对人工智能的判断，来自发布会上的数字和朋友圈的截图。

15
00:01:19,098 --> 00:01:26,213
参数从千亿到万亿，看着热闹，但那些数字和你手上的任务之间，隔着好几层。

16
00:01:26,213 --> 00:01:33,449
这一集想帮你把这好几层补上，以后再看到大数字，你能自己判断它跟你到底有没有关系。

17
00:01:33,600 --> 00:01:36,675
最常出场的模型公司有六家。

18
00:01:36,625 --> 00:01:45,050
美国的开放人工智能公司，代表作是那款全球用户量最大的聊天应用，视频模型索拉也出自它家。

19
00:01:45,050 --> 00:01:53,872
做克劳德的那家公司，由前团队出走创立，以安全和长文本见长，在编程和智能体场景的口碑尤其好。

20
00:01:53,872 --> 00:02:02,346
谷歌是老牌豪门，转换器架构就出自它的论文，双子星全家桶覆盖文字、图片、视频。

21
00:02:02,346 --> 00:02:08,536
脸书的母公司走开源路线，把强模型免费开放，深刻改变了行业生态。

22
00:02:08,536 --> 00:02:12,682
马斯克旗下那家公司风格生猛、更新极快。

23
00:02:12,682 --> 00:02:16,853
法国的米斯特拉尔是小团队做出大能量的典型。

24
00:02:16,853 --> 00:02:21,060
但只认识这六家还不够，你还得分清两类角色。

25
00:02:21,060 --> 00:02:24,437
一类是造模型的，一类是卖水的。

26
00:02:24,437 --> 00:02:28,367
卖水的三位是英伟达、微软和亚马逊。

27
00:02:28,367 --> 00:02:39,401
英伟达的芯片几乎所有模型都要用，微软是最大的金主之一，办公全家桶都接了人工智能，亚马逊既做云服务也投了模型公司。

28
00:02:39,401 --> 00:02:44,798
他们不一定做出最强的模型，但整个行业都建在他们的地基上。

29
00:02:44,798 --> 00:02:47,526
这个区分对产品经理有什么用。

30
00:02:47,526 --> 00:02:48,764
很有用。

31
00:02:48,764 --> 00:02:55,603
模型公司打架，你换模型的成本在变低，因为能力越来越接近，接口越来越像。

32
00:02:55,603 --> 00:03:02,286
卖水的人涨价的时候，你的成本底线在抬高，而且这一层你基本没有议价权。

33
00:03:02,286 --> 00:03:10,074
所以看新闻要分开看，模型层的消息影响你能做什么，基础设施层的消息影响你要花多少。

34
00:03:10,074 --> 00:03:11,673
还有一句提醒。

35
00:03:11,673 --> 00:03:18,548
这个行业变化极快，名单会变，但模型公司加卖水人这个结构会长期存在。

36
00:03:18,548 --> 00:03:21,516
记住结构，比记住名单耐用。

37
00:03:21,516 --> 00:03:28,211
这些公司各有性格，有人闭源做产品，把能力直接做成你打开就能用的应用。

38
00:03:28,211 --> 00:03:34,365
有人开源做生态，把强模型免费开放给所有人，让别人替它想落地场景。

39
00:03:34,365 --> 00:03:37,935
对产品经理来说，这个选择有实际含义。

40
00:03:37,935 --> 00:03:44,305
闭源路线的能力更新由厂商节奏决定，你跟着走就行，但议价空间小。

41
00:03:44,305 --> 00:03:50,915
开源路线意味着你可以自己部署、自己改，效果调优和运维也得自己扛起来。

42
00:03:50,915 --> 00:03:56,661
再加上国产主力那一批，人工智能新闻里的名字你基本都认识了。

43
00:03:56,810 --> 00:03:58,707
第二个词是词元。

44
00:03:58,657 --> 00:04:03,464
它是人工智能读写文字的最小单位，大约是一小块词。

45
00:04:03,464 --> 00:04:16,169
为什么按它收费，道理和出租车按里程计价一样，车每跑一公里都实打实地烧油，模型每读一颗、每吐一颗词元，机房里的显卡都在做一轮运算、耗一份电。

46
00:04:16,169 --> 00:04:18,633
关键是账单两头都算。

47
00:04:18,633 --> 00:04:25,496
你发给它的，每一个字、每一段贴进去的资料，它都要一颗颗读进去，读也要钱。

48
00:04:25,496 --> 00:04:34,005
它回给你的，每一个字也是一颗颗算出来的，写同样要钱，而且单价通常更贵，因为写比读费劲。

49
00:04:34,005 --> 00:04:40,219
所以贴一大段没用的资料，或者放任它写一堆车轱辘话，两头都在烧钱。

50
00:04:40,219 --> 00:04:45,123
提示词里的废话，最后都会被一颗一颗放大成账单。

51
00:04:45,123 --> 00:04:48,633
有个细节值得记住，字数不等于词元数。

52
00:04:48,633 --> 00:04:57,719
数字、符号、生僻词会被切得特别碎，一个带井号的编号可能就占三颗，而七个字的一句话只要五颗。

53
00:04:57,719 --> 00:05:06,337
另外表达同样的意思，中文往往比英文更费，因为模型对英文见得多、切得熟，对汉字只能切得更碎。

54
00:05:06,337 --> 00:05:09,859
别拿字数直接估账单，量级会差不少。

55
00:05:09,859 --> 00:05:14,330
第三个词是上下文窗口，也就是它为什么会忘事。

56
00:05:14,330 --> 00:05:21,072
想象它面前有一张桌子，你们每聊一轮，就往桌上放一张写着这轮内容的纸条。

57
00:05:21,072 --> 00:05:29,510
它回答时只低头看桌上现有的纸条，桌子就那么大，放满之后每来一张新的，最旧的就被推下桌。

58
00:05:29,510 --> 00:05:33,621
掉在地上的纸条，它看不见，也捡不回来。

59
00:05:33,621 --> 00:05:36,361
知道原理，做法就清楚了。

60
00:05:36,361 --> 00:05:42,803
关键设定聊了十几轮之后不妨再说一次，等于把纸条重新放回台面最上层。

61
00:05:42,803 --> 00:05:47,887
台面满了就直接开一个新对话，新对话就是一张空台面。

62
00:05:47,887 --> 00:05:54,137
但长任务别裸开，先让它总结当前进展，把摘要贴进新对话再接着干。

63
00:05:54,137 --> 00:06:04,222
发现它忘了也别跟它吵，它翻不回去掉在地上的纸条，直接把关键信息重新发一遍，比连问三句你忘了吗有用得多。

64
00:06:04,370 --> 00:06:09,896
第四个词是推理模型，也就是很多应用里那个深度思考开关。

65
00:06:09,846 --> 00:06:14,919
打开它，回答变慢了、账单变贵了，换来的到底是什么。

66
00:06:14,919 --> 00:06:19,257
它做的事是先在草稿纸上一步步演算，再交答案。

67
00:06:19,257 --> 00:06:23,801
普通模式像抢答，题目一出凭第一反应张口就说。

68
00:06:23,801 --> 00:06:33,993
深度思考像考试里的大题，先在草稿纸上列条件、试几种解法，发现不对就划掉重来，最后才把答案誊到答题卡上。

69
00:06:33,993 --> 00:06:37,262
所谓思考，就是多写了几页草稿。

70
00:06:37,262 --> 00:06:42,178
草稿也是一个字一个字生成的，所以更慢，也更花钱。

71
00:06:42,178 --> 00:06:44,402
来一道小题感受一下。

72
00:06:44,402 --> 00:06:55,628
家庭聚餐安排一排五个座位，爷爷怕吵要坐最边上，两个小孩不能挨着，妈妈要坐在小明旁边帮忙夹菜，爸爸负责倒茶要坐正中间，怎么排。

73
00:06:55,628 --> 00:07:02,887
这种题答案不会一眼看出来，得先假定一种坐法，再检查有没有犯规，犯规就退回换一种。

74
00:07:02,887 --> 00:07:09,907
秒答模式常常张口就给一个看着挺合理的排列，仔细一查就有条件被漏掉。

75
00:07:09,907 --> 00:07:15,976
深度思考模式会把几种可能摆出来逐个验，慢是慢在验，不是慢在想。

76
00:07:15,976 --> 00:07:23,260
判断标准一句话，答案需要一步步推出来的值得开，查一下或一眼能看出的不值得。

77
00:07:23,260 --> 00:07:33,392
有个省钱的习惯，默认用普通模式，遇到它答错了，或者你自己都觉得这题有点绕的时候，再打开重问一次，性价比最高。

78
00:07:33,392 --> 00:07:37,875
简单问题也开深度思考，属于高射炮打蚊子。

79
00:07:37,875 --> 00:07:39,774
第五个词是参数。

80
00:07:39,774 --> 00:07:42,647
参数像大脑里旋钮的数量。

81
00:07:42,647 --> 00:07:51,878
训练一个模型，就像调一台带海量旋钮的机器，每喂一批资料，就把一些旋钮拧一点点，让它的回答更像样。

82
00:07:51,878 --> 00:07:58,753
等训练结束，这几十亿、几千亿个旋钮的位置，合起来就存下了它学到的一切。

83
00:07:58,753 --> 00:08:04,101
所以参数量可以粗略理解成，这台机器能装下多少见识。

84
00:08:04,101 --> 00:08:06,697
但大就一定好吗，不一定。

85
00:08:06,697 --> 00:08:10,303
小模型在三个场景经常打赢大块头。

86
00:08:10,303 --> 00:08:19,354
第一是速度，参数少算得快，实时字幕、输入法联想这类要秒回的场景，大模型再有学问也等不起。

87
00:08:19,354 --> 00:08:27,779
第二是成本，同样一件事，小模型的电费和算力开销低一大截，量大的活儿一年下来省出的钱很可观。

88
00:08:27,779 --> 00:08:36,096
第三是专精，比如客服系统里判断用户是想退货还是查物流，一个调教好的小模型又快又准。

89
00:08:36,096 --> 00:08:42,551
选模型像选车，跑长途拉重货上卡车，市区买个菜一辆小电驴就够了。

90
00:08:42,551 --> 00:08:48,945
先想清楚任务有多难，再决定用多大吨位，账单和体验都会舒服很多。

91
00:08:48,945 --> 00:08:57,443
新闻里的参数竞赛听听就好，你真正要关心的只有一件事，这个任务它干得好不好、划不划算。

92
00:08:57,580 --> 00:08:59,645
第六个词是多模态。

93
00:08:59,595 --> 00:09:05,496
你可能遇到过，给人工智能发照片，它回一句抱歉，请用文字描述。

94
00:09:05,496 --> 00:09:08,886
也见过能把照片里的菜谱都认出来的。

95
00:09:08,886 --> 00:09:11,422
同样都是它，差在哪。

96
00:09:11,422 --> 00:09:14,992
因为会说话和会看是两套独立的本事。

97
00:09:14,992 --> 00:09:20,701
语言模型天生只认文字，想让它看图，得额外给它装一双眼睛。

98
00:09:20,701 --> 00:09:25,617
装了的叫多模态模型，没装的就只能对图片说抱歉。

99
00:09:25,617 --> 00:09:27,516
小实验很直观。

100
00:09:27,516 --> 00:09:30,617
给两个模型各发一张猫的照片。

101
00:09:30,617 --> 00:09:37,672
没装眼睛的那个回，抱歉我无法查看图片，你可以描述一下图片内容，我来帮你分析。

102
00:09:37,672 --> 00:09:47,660
装了眼睛的那个回，一只橘猫趴在飘窗上晒太阳，右前爪压着一个毛线球，看它的体型，这位可能需要控制一下饮食了。

103
00:09:47,660 --> 00:09:51,987
同样一张图，一个有内容，一个只有一句抱歉。

104
00:09:51,987 --> 00:09:54,006
眼睛的原理分两步。

105
00:09:54,006 --> 00:10:03,850
第一步把图切碎，视觉编码器把图片切成许多小方块，每块转译成模型认识的词，一张图就变成了一段特殊的文字。

106
00:10:03,850 --> 00:10:10,941
第二步当话来接，转译完成后，图片对模型来说就和一段话没区别，照常接话茬。

107
00:10:10,941 --> 00:10:14,967
所以看图能力的本质，还是那台接话机器。

108
00:10:14,967 --> 00:10:16,722
为什么不都装上。

109
00:10:16,722 --> 00:10:23,092
装眼睛要用海量图文配对数据重新训练，成本高、模型更大更贵。

110
00:10:23,092 --> 00:10:28,477
很多场景根本用不到看图，纯文本模型反而更快更便宜。

111
00:10:28,477 --> 00:10:31,951
所以不装眼睛不是落后，是取舍。

112
00:10:31,951 --> 00:10:37,576
顺带说清一个常见的混淆，看懂图和画出图也是两回事。

113
00:10:37,576 --> 00:10:44,174
能看图的模型不一定能生成图片，前者是眼睛，后者是完全不同的画手。

114
00:10:44,174 --> 00:10:50,592
你用的应用如果既能看又能画，那是它在幕后同时接了好几个不同的模型。

115
00:10:50,592 --> 00:10:58,453
这一点做方案时很关键，你要为每一项能力单独确认支持情况，不能默认买了一个全能的。

116
00:10:58,590 --> 00:11:00,535
第七个词是微调。

117
00:11:00,485 --> 00:11:09,403
老板说把公司资料喂给人工智能，供应商说给你们微调一个专属模型，听着像一回事，报价能差出几百倍。

118
00:11:09,403 --> 00:11:13,586
微调是送它重新上课，把知识练进它身体里。

119
00:11:13,586 --> 00:11:17,191
喂资料是让它开卷考试，随用随查。

120
00:11:17,191 --> 00:11:22,901
前者周期以周计、花费以万计，后者当天生效、花费小得多。

121
00:11:22,901 --> 00:11:28,009
一句话总结，改性格才需要上课，查知识开卷就够了。

122
00:11:28,009 --> 00:11:30,028
这里有个关键差别。

123
00:11:30,028 --> 00:11:34,691
微调改变的是模型本身，像把知识练成了肌肉记忆。

124
00:11:34,691 --> 00:11:39,030
喂资料完全没动模型，只是考试时允许它翻书。

125
00:11:39,030 --> 00:11:45,316
所以资料一更新，开卷这边换本书就行，上课那边就得重新读一遍。

126
00:11:45,316 --> 00:11:48,105
这个差别摊开看是四个维度。

127
00:11:48,105 --> 00:11:52,852
生效速度上，上课要几天到几周，开卷当天就能用。

128
00:11:52,852 --> 00:12:00,881
成本量级上，上课几万到几十万起步，还要专人伺候，开卷低一到两个量级，普通团队就能搭。

129
00:12:00,881 --> 00:12:07,961
知识更新上，上课资料变了要重新训练一遍，开卷换个文件就行，随换随用。

130
00:12:07,961 --> 00:12:17,708
各自适合上，上课适合改风格、改口吻、学专业语感，开卷适合会变的知识，比如制度、价格、文档问答。

131
00:12:17,708 --> 00:12:23,646
这个差别直接决定了后续的维护成本，签合同之前一定要问清楚。

132
00:12:23,646 --> 00:12:25,533
那到底该怎么选。

133
00:12:25,533 --> 00:12:31,470
给你一个省钱的顺序，先试提示词，再挂知识库，最后才考虑微调。

134
00:12:31,470 --> 00:12:36,362
很多所谓必须微调的需求，认真写一段提示词就解决了。

135
00:12:36,362 --> 00:12:39,535
再不够，挂上知识库让它开卷。

136
00:12:39,535 --> 00:12:43,970
两样都试过还差口气，那才轮到花大钱送它上课。

137
00:12:43,970 --> 00:12:46,002
还有一个实用信号。

138
00:12:46,002 --> 00:12:53,369
如果你的需求里有查这个字，例如查制度、查价格、查文档，那基本就是知识库的活。

139
00:12:53,369 --> 00:13:01,134
反过来，如果是要它学会你公司的说话口吻、学会某个专业领域的语感，那才可能真需要微调。

140
00:13:01,134 --> 00:13:11,482
顺便提醒一句，饭局上有人说我们训了个模型，多数时候他做的只是前两步，知道这一层，你就能听懂他到底干了啥。

141
00:13:11,620 --> 00:13:16,906
第八个词是知识库，开会总听到的那个接一下检索增强。

142
00:13:16,856 --> 00:13:24,452
其实它就是给人工智能配了一个随用随查的书架，考试可以开卷了，还得把翻到的那页指给你看。

143
00:13:24,452 --> 00:13:26,147
运转就三步。

144
00:13:26,147 --> 00:13:32,253
第一步收集文件，制度手册、产品文档、会议纪要，都是普通文件。

145
00:13:32,253 --> 00:13:42,349
第二步切成小块并建索引，长文件切成一段一段的卡片，一块讲一件事，每块都登记好讲的是什么，方便日后按意思查找。

146
00:13:42,349 --> 00:13:52,890
第三步有人提问时先查书架，按意思相近找出相关的几段，和问题拼在一起交给它，它照着资料作答，顺手把出处标给你看。

147
00:13:52,890 --> 00:13:57,024
为什么不直接把全部文件发给它，两个原因。

148
00:13:57,024 --> 00:14:04,068
一是台面装不下，人工智能一次能看在眼里的内容有限，几百份文件根本摊不开。

149
00:14:04,068 --> 00:14:12,036
二是按词元收费，每次提问都附上全部文件，等于每次都把整个图书馆搬一遍，钱包先受不了。

150
00:14:12,036 --> 00:14:20,113
所以知识库的思路很聪明，书都留在架上，每次只把最相关的几页带上考场，省钱还装得下。

151
00:14:20,113 --> 00:14:23,358
但它有软肋，你做方案时必须知道。

152
00:14:23,358 --> 00:14:28,070
知识库让它拿着资料说话，可它分辨真伪的能力有限。

153
00:14:28,070 --> 00:14:31,856
书架上的文件过时了，它照着旧文件答。

154
00:14:31,856 --> 00:14:35,402
两份文件互相矛盾，它可能各抄一半。

155
00:14:35,402 --> 00:14:39,909
它保证的是有据可查，管不了那个据是否靠谱。

156
00:14:39,909 --> 00:14:46,303
所以建知识库，一半功夫要花在整理文件上，删掉过时的、合并矛盾的。

157
00:14:46,303 --> 00:14:48,851
书架干净，答案才干净。

158
00:14:48,851 --> 00:14:56,520
验收的时候也别只看回答得顺不顺，要看出处标得对不对、相关段落有没有被找回来。

159
00:14:56,670 --> 00:15:00,946
最后给你一份可以马上用的判断清单，一共五条。

160
00:15:00,896 --> 00:15:05,392
第一条，听到任何一个新名词，先问它落在哪一层。

161
00:15:05,392 --> 00:15:09,057
是在讲谁能做，还是在讲要花多少。

162
00:15:09,057 --> 00:15:15,223
模型层的消息影响你能做什么，基础设施层的消息影响你的成本底线。

163
00:15:15,223 --> 00:15:19,743
分不清这两层，就容易被发布会上的数字牵着走。

164
00:15:19,743 --> 00:15:22,603
第二条，把账单拆成两半看。

165
00:15:22,603 --> 00:15:28,156
你发出去的和被回过来的，都在按词元计费，后者通常更贵。

166
00:15:28,156 --> 00:15:31,894
中文往往比英文更费，字数也不等于词元数。

167
00:15:31,894 --> 00:15:36,389
写提示词时删掉的每一个废字，都是直接省钱。

168
00:15:36,389 --> 00:15:43,276
长对话里，重要设定要重申，台面满了就开新对话，长任务先要一份摘要带走。

169
00:15:43,276 --> 00:15:49,490
第三条，默认用普通模式，把深度思考留给需要一步步推的问题。

170
00:15:49,490 --> 00:15:54,310
参数不是越大越好，选模型像选车，看任务定吨位。

171
00:15:54,310 --> 00:16:00,356
实时响应、量大、任务单一这三类场景，小模型常常更划算。

172
00:16:00,356 --> 00:16:06,077
第四条，遇到把公司资料喂给人工智能这类需求，先把它翻译一遍。

173
00:16:06,077 --> 00:16:08,709
带查字的，做知识库。

174
00:16:08,709 --> 00:16:13,685
要改口吻、改风格、学专业语感的，才考虑微调。

175
00:16:13,685 --> 00:16:19,082
顺序永远是先试提示词，再挂知识库，最后才送它上课。

176
00:16:19,082 --> 00:16:25,187
签合同之前问清楚，方案到底是改了模型本身，还是只挂了个书架。

177
00:16:25,187 --> 00:16:29,334
第五条，验收知识库不要只看回答得顺不顺。

178
00:16:29,334 --> 00:16:35,344
要看出处标得对不对、相关段落有没有被找回来、文件本身是不是干净的。

179
00:16:35,344 --> 00:16:41,594
它保证的是有据可查，管不了据是否靠谱，所以整理文件的功夫省不掉。

180
00:16:41,594 --> 00:16:46,461
这五条的共同点，是把技术名词翻译成成本和边界。

181
00:16:46,461 --> 00:16:55,115
听懂这八个词，你不需要会写代码，你需要的只是知道每个词背后，是你能承诺什么，以及你要花多少。

