1
00:00:00,100 --> 00:00:06,432
本内容改编自小山学堂《学 AI 产品，从入门到精通》，为二次演绎配音版。

2
00:00:06,382 --> 00:00:19,819
这一集我们来解决一个几乎所有人都纳闷过的矛盾，同一个时代，聊天的人工智能已经聪明得像个靠谱同事，可你点开购物软件的客服，对面那位还在一本正经地装傻。

3
00:00:19,819 --> 00:00:24,603
本集把这个问题拆到底，顺带回答一串跟它同源的疑问。

4
00:00:24,603 --> 00:00:41,590
老一代语音助手和现在的聊天产品是不是一种东西，免费版到底够不够用，接口和开会员有什么区别，为什么生成一张图比聊一次天贵几十倍，为什么视频要按秒收费，还有那些三折接口的广告到底能不能碰。

5
00:00:41,590 --> 00:00:43,922
为什么产品经理要关心。

6
00:00:43,922 --> 00:00:48,633
因为这一串问题的答案都指向同一件事，成本结构。

7
00:00:48,633 --> 00:01:00,953
你看到的每一个产品决策，客服为什么这么死板，音箱为什么还这么笨，生图为什么要限次数、要用积分，高清放大为什么要单独收费，背后都是同一本账。

8
00:01:00,953 --> 00:01:03,777
这对做产品的人特别有用。

9
00:01:03,777 --> 00:01:10,917
你在评审会上听到的很多体验抱怨，其实不是模型能力问题，而是成本约束下的取舍。

10
00:01:10,917 --> 00:01:21,566
看懂这本账，你才知道哪些体验问题是技术不行，哪些其实是商家在账本上做的选择，也才知道自己手里的预算该往哪一层投。

11
00:01:21,566 --> 00:01:25,977
这一集听下来，你会多出一双看成本的眼睛。

12
00:01:26,140 --> 00:01:27,652
先看客服。

13
00:01:27,602 --> 00:01:37,338
同一句话，我上周买的鞋开胶了，想换货但发票丢了，发给聊天的人工智能和发给商家客服机器人，待遇差很多。

14
00:01:37,338 --> 00:01:43,047
因为你平时聊的智能助手和商家的客服机器人，多半没用同一个脑子。

15
00:01:43,047 --> 00:01:46,604
它蠢，通常出于三个很现实的原因。

16
00:01:46,604 --> 00:01:48,047
第一是省钱。

17
00:01:48,047 --> 00:01:53,143
客服每天要接的消息量大得吓人，每一条都要花钱处理。

18
00:01:53,143 --> 00:01:58,503
很多商家算完账，选了便宜的小模型，或者干脆沿用旧系统。

19
00:01:58,503 --> 00:02:03,491
你享受到的聪明程度，和商家愿意付的账单直接挂钩。

20
00:02:03,491 --> 00:02:05,330
第二是护栏锁死。

21
00:02:05,330 --> 00:02:11,436
人工智能聊天时随口说一句可以给您全额退款，商家可能就真得赔。

22
00:02:11,436 --> 00:02:17,374
所以很多客服被规定只准念审核过的稿子，超纲一律装没听见。

23
00:02:17,374 --> 00:02:20,547
对商家来说，宁可蠢，不能错。

24
00:02:20,547 --> 00:02:22,518
蠢是被规定出来的。

25
00:02:22,518 --> 00:02:24,177
第三是冒充。

26
00:02:24,177 --> 00:02:31,857
还有一大批客服，压根就是上一代的关键词机器人，在你的话里找关键词，命中哪条答哪条。

27
00:02:31,857 --> 00:02:38,708
这两年它们纷纷贴上了智能客服的标签继续营业，锅却让新的人工智能背了。

28
00:02:38,708 --> 00:02:45,643
刚才那位很可能只是在你的话里扫到了发票两个字，然后掏出库存里唯一相关的答案。

29
00:02:45,643 --> 00:02:47,037
怎么对付它。

30
00:02:47,037 --> 00:02:52,277
客服系统里通常留着几条升级通道，命中了就会转真人。

31
00:02:52,277 --> 00:02:58,131
直接说人工、转人工，这是最经典的暗号，一次没用就多发几次。

32
00:02:58,131 --> 00:03:04,777
用上投诉、维权这类词，商家最怕纠纷升级，这些词往往被设成高优先级。

33
00:03:04,777 --> 00:03:13,395
把问题描述得具体一点，带上订单细节和明确诉求，就算机器人接不住，转到人工后对方一眼能看懂。

34
00:03:13,395 --> 00:03:18,059
好消息是，接了大模型的新一代客服确实在变多。

35
00:03:18,059 --> 00:03:21,544
分辨方法很简单，换个说法再问一遍。

36
00:03:21,544 --> 00:03:30,907
把发票丢了能换货吗换成购物小票找不着了，还能给我换吗，老式机器人立刻露馅，接了大模型的客服能稳稳接住。

37
00:03:30,907 --> 00:03:39,910
所以下次遇到装傻的客服，先别急着对人工智能失望，你面前的很可能是一台省钱模式的旧机器。

38
00:03:40,060 --> 00:03:46,079
第二个问题，手机里的语音助手和现在的聊天产品，是不是一种东西。

39
00:03:46,029 --> 00:03:52,904
都叫助手，一个陪了我们十几年，敬业地重复着抱歉我没听懂，一个什么都能聊。

40
00:03:52,904 --> 00:03:56,474
答案是，它们用的其实是两代技术。

41
00:03:56,474 --> 00:03:59,250
老一代语音助手靠命令匹配。

42
00:03:59,250 --> 00:04:04,731
你说明天要是下雨的话，提前半小时叫我，它去命令库里找匹配。

43
00:04:04,731 --> 00:04:13,457
这条路线有个绕不开的天花板，人类的说法无穷无尽，命令库里的条目却是工程师一条条写进去的。

44
00:04:13,457 --> 00:04:22,796
叫我起床、设个闹钟、明早喊我，每一种说法都得有人预先想到、预先登记，漏了哪种，助手就听不懂哪种。

45
00:04:22,796 --> 00:04:27,063
这就是为什么这些年语音助手看起来在原地踏步。

46
00:04:27,063 --> 00:04:31,342
工程师再加十倍，也穷举不完人类的说话方式。

47
00:04:31,342 --> 00:04:34,827
路线的天花板，加人是顶不破的。

48
00:04:34,827 --> 00:04:48,024
一个好记的比喻，老助手是电话按键菜单，查话费请按一，办业务请按二，选项预先定好，你只能在菜单里挑，想说点菜单外的事，它只会礼貌地重播一遍菜单。

49
00:04:48,024 --> 00:04:58,746
生成式人工智能是真人接线员，你怎么说都行，绕着弯说、带着条件说、说一半改主意都行，它理解你的意思再决定怎么办。

50
00:04:58,746 --> 00:05:01,919
它们之间不是版本新旧，是代差。

51
00:05:01,919 --> 00:05:07,964
就像按键电话和智能手机，给按键电话换个铃声，它还是按键电话。

52
00:05:07,964 --> 00:05:20,488
好消息是这两年各家的语音助手陆续开始换脑子，把老的命令匹配系统换成大模型，或者两套并用，你家里的设备可能同时住着新旧两代。

53
00:05:20,488 --> 00:05:22,508
那音箱为什么还蠢。

54
00:05:22,508 --> 00:05:30,536
音箱要卖得便宜、答得飞快，跑大模型又费算力又慢半拍，所以很多音箱还留着老脑子。

55
00:05:30,536 --> 00:05:33,265
这和客服装傻是同一本账。

56
00:05:33,265 --> 00:05:44,767
想知道任何一个助手是新脑子还是老脑子，还是那一招，换个说法再说一遍，明早七点叫我换成明天我得七点起，还接得住的就是新的。

57
00:05:44,910 --> 00:05:49,054
第三个问题，免费的够用吗，什么时候值得付费。

58
00:05:49,004 --> 00:05:51,925
先说免费版悄悄打折的地方。

59
00:05:51,925 --> 00:06:02,237
界面和付费版长得一模一样，差别全藏在看不见的地方，通常是小一号的模型，再加上次数限制，长文放不下，高峰还要排队。

60
00:06:02,237 --> 00:06:05,915
它是试用装，不是同一件商品的小号包装。

61
00:06:05,915 --> 00:06:10,254
要付费吗，答案只和一件事有关，你的使用频率。

62
00:06:10,254 --> 00:06:12,850
偶尔用，免费版完全够。

63
00:06:12,850 --> 00:06:17,550
每天都靠它干活，付费版的差距会越用越明显。

64
00:06:17,550 --> 00:06:20,146
靠它吃饭的，就上顶配。

65
00:06:20,146 --> 00:06:24,317
这里有一个简单的升级判断法，记住一条就够。

66
00:06:24,317 --> 00:06:32,249
连续一周，只要碰到今天次数用完了，或者内容太长放不下这类提示，就到了该付费的时候。

67
00:06:32,249 --> 00:06:36,456
这说明你的用法已经装不进免费版的天花板了。

68
00:06:36,456 --> 00:06:43,103
反过来，一个月都没碰到过限制，说明免费版对你绰绰有余，别急着掏钱。

69
00:06:43,103 --> 00:06:47,153
再多说一句，先把免费版用满再考虑付费。

70
00:06:47,153 --> 00:06:54,100
很多人付了钱才发现，自己的用量连免费额度都填不满，等于花钱买了个心理安慰。

71
00:06:54,100 --> 00:07:03,355
价钱方面给你一个量级，主流产品的会员费大致在同一个量级，一个月一顿饭到几顿饭的钱，国产产品普遍更便宜。

72
00:07:03,355 --> 00:07:10,098
你付费买的其实是模型档位和稳定性，界面长得一样，里子完全是两回事。

73
00:07:10,250 --> 00:07:17,099
第四个问题，总看到有人说充钥匙、调接口，这和你每月订的会员有什么区别。

74
00:07:17,049 --> 00:07:21,147
其实都是在给人工智能付钱，只是两种方式。

75
00:07:21,147 --> 00:07:25,967
会员是包月自助餐，交一次月费，在官方应用里随便聊。

76
00:07:25,967 --> 00:07:32,890
菜是人家做好端上桌的，界面、聊天记录、联网搜索都配齐了，你只管张嘴吃。

77
00:07:32,890 --> 00:07:40,919
限制也很像自助餐，只能在店里吃，没法打包带走给别的软件用，吃太猛还会被提示歇一会儿。

78
00:07:40,919 --> 00:07:46,676
接口是按克称重的散称食材，按实际用量付钱，用多少称多少。

79
00:07:46,676 --> 00:07:54,344
买回来的是生食材，一个接口地址加一把钥匙，得自己接进程序或工具里才做得成菜。

80
00:07:54,344 --> 00:07:57,662
自由度大，代价是你得会开火。

81
00:07:57,662 --> 00:08:00,017
为什么有人要充钥匙。

82
00:08:00,017 --> 00:08:07,553
你在教程里看到的这类说法，几乎都发生在同一个场景，某个第三方工具要用人工智能的能力。

83
00:08:07,553 --> 00:08:18,479
翻译插件、写作软件、自动化脚本，这些工具自己没有智能，得由你递给它一把钥匙，它拿着钥匙去调用模型，费用记在你的账上。

84
00:08:18,479 --> 00:08:21,387
那把钥匙说白了就是一串密码。

85
00:08:21,387 --> 00:08:26,267
谁拿到这串字符，谁就能用你的额度、花你的钱。

86
00:08:26,267 --> 00:08:31,207
别把它发到群里、贴到帖子里、存进公开的在线文档。

87
00:08:31,207 --> 00:08:35,931
万一泄露了，第一时间去官网把它作废，再重新生成一把。

88
00:08:35,931 --> 00:08:41,604
买钥匙认准官方渠道，模型厂商的官网，或者大厂云平台。

89
00:08:41,604 --> 00:08:51,183
一个简单的分法，你只是想用人工智能聊天干活，开会员；你要让某个软件或程序替你调人工智能，才需要接口。

90
00:08:51,183 --> 00:08:54,272
多数人一辈子只需要前者。

91
00:08:54,430 --> 00:09:00,425
第五个问题，很多应用聊天随便聊，一到生图就要收费、限次数。

92
00:09:00,375 --> 00:09:04,870
不是产品小气，是图片在成本上真的是另一个物种。

93
00:09:04,870 --> 00:09:06,433
先看数字。

94
00:09:06,433 --> 00:09:12,863
一次文字问答的成本是几厘到几分钱，一张图片是两三毛钱，差几十倍。

95
00:09:12,863 --> 00:09:18,043
换算一下，一块钱大约等于两百次问答，约等于三张图。

96
00:09:18,043 --> 00:09:20,832
为什么差这么多，三个原因。

97
00:09:20,832 --> 00:09:23,344
第一，信息量大得多。

98
00:09:23,344 --> 00:09:33,344
一段一百字的回答就是一百来个词，一张高清图有上百万个像素，哪怕压缩打包后，要处理的数据量也远超一段话。

99
00:09:33,344 --> 00:09:35,592
第二，要画几十遍。

100
00:09:35,592 --> 00:09:43,428
主流生图方式是从一片雪花噪点开始，一轮一轮地去噪细化，几十步之后图才成形。

101
00:09:43,428 --> 00:09:48,380
相当于同一张画反复画几十遍，每一遍都在烧算力。

102
00:09:48,380 --> 00:09:50,724
第三，显卡被独占。

103
00:09:50,724 --> 00:10:01,529
文字生成像窗口排队，一台机器同时服务很多人；生图期间显卡被你的任务大块占用好几秒，独占的时间就是独享的账单。

104
00:10:01,529 --> 00:10:05,375
理解了成本，你就能看懂很多产品设计。

105
00:10:05,375 --> 00:10:12,455
为什么生图要用积分，为什么先给你小尺寸的预览图，为什么高清放大要单独收费。

106
00:10:12,455 --> 00:10:17,058
都是在帮你，也帮他们自己，省那块被独占的显卡。

107
00:10:17,058 --> 00:10:24,125
对你来说最实用的一条是，先用文字把需求打磨清楚再出图，一次成功最省钱。

108
00:10:24,260 --> 00:10:27,010
第六个问题，视频更夸张。

109
00:10:26,960 --> 00:10:32,309
一张图两三毛，视频按秒计价，一秒一块五到五块钱。

110
00:10:32,309 --> 00:10:37,200
生成一条十秒的短视频，够你和人工智能聊上万句。

111
00:10:37,200 --> 00:10:45,049
因为视频不是一张图，是每秒二十几张必须连贯的图，还要配上同步的声音、合理的物理运动。

112
00:10:45,049 --> 00:10:49,184
生成量是图片的几十倍，难度还不止翻几十倍。

113
00:10:49,184 --> 00:10:51,227
你可以这样算一笔账。

114
00:10:51,227 --> 00:10:56,335
按每秒二十四帧算，一条五秒的视频就是一百二十帧。

115
00:10:56,335 --> 00:11:06,455
也就是说，你以为在生成一条视频，实际是在生成一百二十张图，而且它们不能各画各的，必须像连环画一样严丝合缝。

116
00:11:06,455 --> 00:11:10,337
这么一换算，按秒计价就不难理解了。

117
00:11:10,337 --> 00:11:11,948
贵在三件事。

118
00:11:11,948 --> 00:11:15,193
第一，帧和帧必须记得住彼此。

119
00:11:15,193 --> 00:11:21,095
人物的衣服颜色、背景里的杯子、光线的方向，每一帧都不能变卦。

120
00:11:21,095 --> 00:11:32,128
模型要同时记住几百帧的内容互相对齐，这比独立画几百张图难得多，也是早期人工智能视频里人物走着走着会变脸的原因。

121
00:11:32,128 --> 00:11:34,268
第二，物理要合理。

122
00:11:34,268 --> 00:11:39,003
苹果要往下掉、水要往低处流、头发要跟着风飘。

123
00:11:39,003 --> 00:11:45,842
模型得从海量视频里悟出物理规律才能不穿帮，这部分能力最烧训练成本。

124
00:11:45,842 --> 00:11:48,402
第三，声音还要对上口型。

125
00:11:48,402 --> 00:12:00,974
新一代模型直接生成配音和音效，嘴型、脚步声、环境音都要和画面同步，等于同时在做视频和音频两份工作，所以带声音的比无声的贵一截。

126
00:12:00,974 --> 00:12:07,729
好消息是价格一直在往下走，就在两年前，同样质量的视频还要贵好几倍。

127
00:12:07,729 --> 00:12:17,285
顺序也值得记住，先用便宜的文字打磨脚本，再用两三毛的图片确定画面感觉，最后才动用按秒计费的视频。

128
00:12:17,285 --> 00:12:20,277
专业团队都是这么省钱的。

129
00:12:20,420 --> 00:12:22,076
最后一个问题。

130
00:12:22,026 --> 00:12:28,529
如果你开始折腾工具，早晚会看到这样的广告，某某接口三折起，即买即用。

131
00:12:28,529 --> 00:12:30,163
它们叫中转站。

132
00:12:30,163 --> 00:12:36,582
先说清楚，不是说卖家都是坏人，而是这个结构本身有几个你值得先了解的风险。

133
00:12:36,582 --> 00:12:40,704
中转站是夹在你和官方之间的二道贩子。

134
00:12:40,704 --> 00:12:43,529
它批量拿到接口再转卖给你。

135
00:12:43,529 --> 00:12:52,195
便宜是真的，但你的每一句话都要先经过它的服务器，模型是不是正品、明天还在不在，都只能靠它自觉。

136
00:12:52,195 --> 00:12:55,872
三个结构性风险，和卖家人品无关。

137
00:12:55,872 --> 00:12:58,997
第一，你的内容对它完全透明。

138
00:12:58,997 --> 00:13:05,512
你发的合同、简历、公司数据、私密问题，都会原文经过中转站的服务器。

139
00:13:05,512 --> 00:13:09,887
它存不存、看不看、卖不卖，你无从验证。

140
00:13:09,887 --> 00:13:15,788
官方大厂有隐私协议和监管约束，中转站往往连主体是谁都查不到。

141
00:13:15,788 --> 00:13:18,757
第二，模型可能被悄悄换货。

142
00:13:18,757 --> 00:13:28,360
你以为在用旗舰模型，它可能在背后换成便宜好几倍的轻量模型来赚差价，回答变笨了你还以为是自己提示词没写好。

143
00:13:28,360 --> 00:13:34,346
这类掺假测评在社区里屡见不鲜，而普通用户几乎无法分辨。

144
00:13:34,346 --> 00:13:37,591
第三，充值余额可能一夜清零。

145
00:13:37,591 --> 00:13:43,072
低价往往来自不可持续的来源，批量注册、盗刷、灰色渠道。

146
00:13:43,072 --> 00:13:48,300
上游一封号，站长一关站，你充的钱没有任何地方可以讨。

147
00:13:48,300 --> 00:13:51,377
这个圈子里跑路不是小概率事件。

148
00:13:51,377 --> 00:13:53,072
那正路是什么。

149
00:13:53,072 --> 00:14:05,872
普通用户直接用官方应用，豆包、Kimi、通义这些，免费额度足够日常用，你的数据只经过官方一家，价格、隐私政策和模型版本都白纸黑字可查。

150
00:14:05,872 --> 00:14:11,870
开发者走官方接口或大厂云平台，火山方舟、阿里云百炼这一类。

151
00:14:11,870 --> 00:14:19,057
而且国产模型官方价本来就便宜，有的百万字才一两块钱，真没多少差价可省。

152
00:14:19,057 --> 00:14:22,375
把两条路线放在一起看就很清楚。

153
00:14:22,375 --> 00:14:32,555
官方直连是你到官方，中间没有别人；中转站是你到中转站服务器，再到某个来源不明的接口，多了两个你无法核实的环节。

154
00:14:32,555 --> 00:14:37,291
三折价格背后你付出的，正是这两层不可验证。

155
00:14:37,440 --> 00:14:41,716
最后给你一份可以马上用的判断清单，一共五条。

156
00:14:41,666 --> 00:14:46,318
第一条，遇到蠢的人工智能，先分清它是哪一种蠢。

157
00:14:46,318 --> 00:14:53,049
是没用同一个脑子，是被护栏锁死，还是压根就是上一代关键词机器人换了标签。

158
00:14:53,049 --> 00:14:58,085
判断方法就一招，换个说法再问一遍，接不住的就是旧的。

159
00:14:58,085 --> 00:15:03,277
召唤人工时直接说人工，带上订单细节和明确诉求。

160
00:15:03,277 --> 00:15:06,546
第二条，分清代差和版本新旧。

161
00:15:06,546 --> 00:15:13,806
命令匹配和生成式理解是两代技术，按键菜单加十个选项也变不成真人接线员。

162
00:15:13,806 --> 00:15:20,272
你家里的音箱和客服装傻，多半是同一本账，舍不得算力，或者压根没换脑子。

163
00:15:20,272 --> 00:15:23,313
第三条，付费只跟频率有关。

164
00:15:23,313 --> 00:15:30,657
先把免费版用满，连续一周碰到次数用完或内容太长放不下，才是该升级的信号。

165
00:15:30,657 --> 00:15:35,825
你付费买的是模型档位和稳定性，不是那个长得一样的界面。

166
00:15:35,825 --> 00:15:38,469
第四条，记住成本量级。

167
00:15:38,469 --> 00:15:43,734
问答几厘钱，图片两三毛，视频一秒一块五到五块。

168
00:15:43,734 --> 00:15:50,645
看到积分制、先预览后高清、放大单独收费，就知道那是显卡被独占的账单。

169
00:15:50,645 --> 00:15:57,424
做事的顺序也跟着成本走，文字打磨脚本，图片定画面，最后才动视频。

170
00:15:57,424 --> 00:16:02,231
第五条，钥匙就是一串密码，谁拿到谁就能花你的钱。

171
00:16:02,231 --> 00:16:09,455
买接口认准官方渠道，三折卡的便宜背后是对话被看光和余额一夜清零两个代价。

172
00:16:09,455 --> 00:16:14,142
国产官方价本来就便宜，没多少差价值得你冒这个险。

173
00:16:14,142 --> 00:16:22,340
这五条的共同点是，别只看表面体验，往下看一层成本，很多不合理的设计立刻就合理了。

