1
00:00:00,100 --> 00:00:06,432
本内容改编自小山学堂《学 AI 产品，从入门到精通》，为二次演绎配音版。

2
00:00:06,382 --> 00:00:14,531
前面几章我们分别练了看出哪里丑、看出哪里难用，这一集换一个视角，讲 AI 产品的心理学。

3
00:00:14,531 --> 00:00:16,911
先说本集解决什么问题。

4
00:00:16,911 --> 00:00:21,802
前面两章管的都是界面上的东西，看得见、改得动。

5
00:00:21,802 --> 00:00:30,480
这一集管的是用户心里的东西，它决定了用户会不会再来、会不会推荐、会不会在第一次出错之后就把你拉黑。

6
00:00:30,480 --> 00:00:39,110
三节课，分别讲用户怎么记住一段体验、信任该怎么校准、以及为什么模型犯一次错就被永久拉黑。

7
00:00:39,110 --> 00:00:41,947
再说为什么产品经理要关心。

8
00:00:41,947 --> 00:00:45,444
因为这三件事都有一个反直觉的结论。

9
00:00:45,444 --> 00:00:56,298
用户记得的不是平均水平，而是峰值和结尾；信任的目标值不是满分，而是校准；用户对模型的容错率，远低于对人。

10
00:00:56,298 --> 00:01:00,156
你如果按常识做决策，三条都会做反。

11
00:01:00,156 --> 00:01:01,983
顺便交代结构。

12
00:01:01,983 --> 00:01:14,338
第一节讲记忆的算法，以及推理预算该往哪儿花；第二节讲信任校准，以及三件能亲手拨弄的工具；第三节讲算法厌恶，以及怎么把弃用的用户救回来。

13
00:01:14,338 --> 00:01:19,855
最后提醒一句，这一集的数据和实验都有出处，可以放心引用。

14
00:01:19,855 --> 00:01:22,475
别人问起，你答得上来。

15
00:01:22,636 --> 00:01:24,328
先看一个发现。

16
00:01:24,278 --> 00:01:35,384
一位诺奖得主心理学家发现，人对一段体验的记忆评分，几乎只由最强烈的那一刻和最后一刻决定，和平均水平、持续时长关系都不大。

17
00:01:35,384 --> 00:01:37,295
这就是峰终定律。

18
00:01:37,295 --> 00:01:45,084
原始证据来自一篇标题就很挑衅的论文，翻译过来是，偏爱更多的痛苦，只因结尾好了一点。

19
00:01:45,084 --> 00:01:49,471
实验是这样的，被试要经历两场泡冷水试验。

20
00:01:49,471 --> 00:01:56,286
试验 A，一只手泡进十四度的冷水里整整六十秒，然后结束，拿毛巾擦手。

21
00:01:56,286 --> 00:02:05,949
试验 B，同样先泡六十秒十四度的冷水，接着再泡三十秒，水温悄悄升到十五度，依旧难受，只是没那么刺骨。

22
00:02:05,949 --> 00:02:12,235
两场都亲身泡过之后，被试要回答一个问题，如果必须再来一次，你选哪场。

23
00:02:12,235 --> 00:02:14,350
你猜多数人选哪场。

24
00:02:14,350 --> 00:02:18,389
答案是 B，那场客观上多受了三十秒罪的。

25
00:02:18,389 --> 00:02:19,531
为什么。

26
00:02:19,531 --> 00:02:28,557
因为承受每一秒的是经验自我，而做决定的只有记忆自我，记忆自我只拿峰值和结尾两帧存档打分。

27
00:02:28,557 --> 00:02:34,555
B 的结尾是十五度，比 A 的十四度好一点点，这一点点就把整段记忆改写了。

28
00:02:34,555 --> 00:02:37,788
这个现象有个专名，叫时长忽视。

29
00:02:37,788 --> 00:02:52,079
后来有人又在真实的肠镜检查病人身上重复了结论，术程从四分钟到六十九分钟不等，事后的痛苦评分和时长几乎无关，和峰值疼痛、最后三分钟的疼痛高度相关。

30
00:02:52,079 --> 00:03:00,636
这套分工在卡尼曼的书里占了整整两章，一章讲经验自我和记忆自我，一章专讲时长忽视。

31
00:03:00,636 --> 00:03:05,468
所以它不是个冷门发现，是被反复验证过的底层机制。

32
00:03:05,468 --> 00:03:10,552
结论可以压成一句话，经验自我过日子，记忆自我做决定。

33
00:03:10,552 --> 00:03:15,360
打分、续费、向朋友推荐，签字的都是记忆自我。

34
00:03:15,360 --> 00:03:20,540
你的日活曲线量的是前者，你的净推荐值归后者管。

35
00:03:20,692 --> 00:03:23,478
素材做了一个很直观的演示。

36
00:03:23,428 --> 00:03:31,757
一次十轮的模型会话，每轮体验打零到十分，四个剧本轮流点开，看平均分和记忆分怎么背离。

37
00:03:31,757 --> 00:03:40,592
平均分是工程视角，十轮的算术平均；记忆分是用户脑子里存的，近似算法是峰值加结尾再除以二。

38
00:03:40,592 --> 00:03:46,817
四个剧本里有一个特别有意思，它的平均分是四个里最高的，记忆分却垫底。

39
00:03:46,817 --> 00:03:51,529
原因很简单，它全程平稳，没有峰，结尾也平淡。

40
00:03:51,529 --> 00:03:55,051
素材还给了一个亲手造曲线的练习。

41
00:03:55,051 --> 00:04:03,440
十个节点，每个可以切好、中、差，挑战目标是造一条平均分低于零、记忆分却拉满的曲线。

42
00:04:03,440 --> 00:04:09,041
你想明白一件事，这题十秒就能解，因为记忆分只看两个位置。

43
00:04:09,041 --> 00:04:16,914
造出来之后你会发现，工程仪表盘上会亮红灯，用户却会把这段体验当成好体验讲给同事听。

44
00:04:16,914 --> 00:04:22,430
反过来同样成立，仪表盘一片绿的会话，可能正在被用户遗忘。

45
00:04:22,430 --> 00:04:29,005
监控平均值的团队，和只存峰终两帧的用户，看的从来是两张成绩单。

46
00:04:29,005 --> 00:04:34,005
既然记忆分只认峰和终，推理预算就该按记忆权重发钱。

47
00:04:34,005 --> 00:04:40,387
素材给了个一百元预算分配器，三个滑块分给首次交互、中段、收尾。

48
00:04:40,387 --> 00:04:48,296
有一条暗规则要先交代，中段挂着语义缓存，质量有五分兜底，这正是它能省的原因。

49
00:04:48,296 --> 00:04:53,656
试试三种分法，平均发钱、全押收尾、两头重中间轻。

50
00:04:53,656 --> 00:04:57,298
你会发现最划算的是两头重中间轻。

51
00:04:57,298 --> 00:05:07,683
原理是，首次交互决定第一印象，收尾决定记忆的最后一帧，这两个位置值得用好模型；中段有缓存兜底，放心省。

52
00:05:07,683 --> 00:05:14,329
这套分层路由和语义缓存，成本那一章已经铺过底座，这里直接拿来用。

53
00:05:14,329 --> 00:05:16,108
预算说完说流程。

54
00:05:16,108 --> 00:05:21,805
同一个智能体任务，生成季度报告并对外发布，两种收官编排。

55
00:05:21,805 --> 00:05:30,808
方案 A 把外部发布留到第十步压轴，结果第十步调外部接口失败，整个会话结果没保存，请重新运行任务。

56
00:05:30,808 --> 00:05:45,111
方案 B 把权限校验挪到第一步，中间产物随做随落盘，第十步只做打包交付加摘要，产出是报告已存入你的空间，共十二页，两处标注待确认，对外发布是可选的后续动作。

57
00:05:45,111 --> 00:05:48,043
哪一个记忆分更高，显然是 B。

58
00:05:48,043 --> 00:05:54,317
它的原则是一句话，最后一步永远别做全链路里最容易失败的动作。

59
00:05:54,460 --> 00:05:58,484
前两节都在给体验挣分，这一节踩一脚刹车。

60
00:05:58,434 --> 00:06:02,256
信任这个指标，目标值从来就没定在满分。

61
00:06:02,256 --> 00:06:11,259
模型会出错是改不掉的物理现实，所以健康的用户长这样，该信的场景放心用，该查的场景留个心眼。

62
00:06:11,259 --> 00:06:13,494
往哪边偏都要交学费。

63
00:06:13,494 --> 00:06:18,458
信高了叫误用，信低了叫弃用，两头各有各的账单。

64
00:06:18,458 --> 00:06:20,573
先看过度信任的账。

65
00:06:20,573 --> 00:06:34,035
有一年纽约有一起真实案件，执业律师用对话模型检索判例，把六个查无此案的编造判例原样抄进法庭文书，法官逐个核实后，律师吃了罚单、上了全球新闻。

66
00:06:34,035 --> 00:06:46,631
这件事的可怕之处在于，模型的输出流畅、自信、格式规范，每一个表面特征都在诱导它很靠谱这个判断，而这些特征和内容真伪互不相干。

67
00:06:46,631 --> 00:06:49,876
再看信任不足的账，它安静得多。

68
00:06:49,876 --> 00:06:59,047
企业买了工具，员工试了一次撞上错误，从此每条输出都逐句复核，复核成本超过自己写，最后干脆不用了。

69
00:06:59,047 --> 00:07:02,244
采购的钱照付，效率一分没涨。

70
00:07:02,244 --> 00:07:07,797
信任不足不上新闻，只出现在工具活跃率百分之八的内部复盘里。

71
00:07:07,797 --> 00:07:13,290
横轴是系统真的有多靠谱，纵轴是用户以为它有多靠谱。

72
00:07:13,290 --> 00:07:18,674
产品设计的任务，是把落在两个角落里的用户，往对角线上拉。

73
00:07:18,674 --> 00:07:24,816
判断口诀先给你，盯着风险和可核验性看，别盯着模型强大与否看。

74
00:07:24,816 --> 00:07:30,273
同样是全盘采纳，用在周报上是校准，用在法庭上是过度。

75
00:07:30,273 --> 00:07:33,061
素材里还有个很贴身的例子。

76
00:07:33,061 --> 00:07:38,518
有人问，试用期第二个月被公司口头辞退，我能主张赔偿吗。

77
00:07:38,518 --> 00:07:42,004
模型回答可以主张，还挂了三条角标。

78
00:07:42,004 --> 00:07:45,898
你得逐个点开比对，才发现其中一条对不上原文。

79
00:07:45,898 --> 00:07:53,614
这就是可核验性的价值，它把信任从一个态度问题，变成了一个可以动手核对的动作。

80
00:07:53,764 --> 00:07:57,680
第一件工具，来源引用，要能点开的那种。

81
00:07:57,630 --> 00:08:07,642
想核实的用户一键到原文，压住过度信任；懒得核实的用户看到有出处，也建立了合理的底气，补上信任不足。

82
00:08:07,642 --> 00:08:14,649
一举两得的前提是引用真实可点，装饰性的假引用被戳穿一次，比没有引用糟糕十倍。

83
00:08:14,649 --> 00:08:20,142
素材里给了三条引用，其中一条对不上原文，就是让你练这个手感。

84
00:08:20,142 --> 00:08:22,498
第二件工具，置信度。

85
00:08:22,498 --> 00:08:27,257
前面讲过，模型不知道自己不知道，让它自报把握靠不住。

86
00:08:27,257 --> 00:08:37,233
但产品层有诚实的代理信号，检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。

87
00:08:37,233 --> 00:08:45,851
素材里同一条用药回答，三组开关对应三个产品决策，你拨一拨，看用户的信任校准度怎么变。

88
00:08:45,851 --> 00:08:50,863
问题很日常，布洛芬和对乙酰氨基酚，发烧能不能交替吃。

89
00:08:50,863 --> 00:08:58,495
三条来源分别是临床用药指南、药典的非甾体抗炎药条目、三甲医院的用药问答库。

90
00:08:58,495 --> 00:09:03,483
你把引用开关打开，用户的信任校准度当场就往上走。

91
00:09:03,483 --> 00:09:11,115
第三件工具管的就一件事，那行模型可能出错、请核实重要信息的小字，到底有没有人在看。

92
00:09:11,115 --> 00:09:21,500
心理学的答案叫横幅盲视，有研究者用眼动实验发现，恒定出现在固定位置的元素，会被大脑当成背景纹理直接滤掉。

93
00:09:21,500 --> 00:09:26,644
素材里连点五条回答，你会亲眼看到这行小字怎么消失。

94
00:09:26,644 --> 00:09:30,442
所以正确做法是让警告有条件地出现。

95
00:09:30,442 --> 00:09:36,524
恒定免责三天就隐形，低置信时带着原因弹出才会被读。

96
00:09:36,676 --> 00:09:42,082
上一节讲信任要校准，这一节讲校准路上最大的一块石头。

97
00:09:42,032 --> 00:09:45,566
人对模型的容错率，远低于对人。

98
00:09:45,566 --> 00:09:50,386
同样犯一次错，人类同事会被原谅，模型会被弃用。

99
00:09:50,386 --> 00:09:52,777
素材先让你做个选择。

100
00:09:52,777 --> 00:10:02,020
你是销售负责人，手上有两个销量预测来源，上季度它俩犯了一模一样的错，同样的数字、同样的原因。

101
00:10:02,020 --> 00:10:09,003
人这边是跟了你三年的分析师，复盘会上他说竞品突然降价，这个真没料到。

102
00:10:09,003 --> 00:10:16,888
模型这边是用了两个季度的预测系统，日志显示竞品降价数据未纳入本次预测模型。

103
00:10:16,888 --> 00:10:22,982
两个都预测华东区销量五千万，实际四千四百万，高估了百分之十二。

104
00:10:22,982 --> 00:10:25,626
你下季度打算继续用哪个。

105
00:10:25,626 --> 00:10:30,470
这题没有标准答案，但它有一个名字，叫算法厌恶。

106
00:10:30,470 --> 00:10:40,133
有一年，几位研究者做了个实验，让被试预测学生的学业表现，可以自己预测，也可以交给统计模型，预测得准有奖金。

107
00:10:40,133 --> 00:10:44,797
关键设计是先让一部分被试亲眼看到模型犯错。

108
00:10:44,797 --> 00:10:55,518
结果，看过模型犯错的被试大面积弃用模型，宁可用自己更差的判断，哪怕数据摆在眼前，模型的整体成绩比人高一截。

109
00:10:55,518 --> 00:10:58,234
论文标题就叫算法厌恶。

110
00:10:58,234 --> 00:11:03,342
一句话总结，人们不是嫌算法不准，是嫌算法犯过错。

111
00:11:03,342 --> 00:11:09,112
准不准是统计问题，犯没犯过错是记忆问题，用户拿记忆做决定。

112
00:11:09,112 --> 00:11:11,660
偏心的根子在归因方式。

113
00:11:11,660 --> 00:11:16,684
同一种错误，用户脑子里给人和给模型记的账本不一样。

114
00:11:16,684 --> 00:11:24,797
人的错误被归因给情境，这次意外、他会改；机器的错误被归因给能力，它就这水平、以后还这样。

115
00:11:24,797 --> 00:11:29,701
人的预期自带误差条，机器的预期是计算器式的全对。

116
00:11:29,701 --> 00:11:34,244
对人你能吵能催，对模型只有接受和不接受两个按钮。

117
00:11:34,244 --> 00:11:44,244
三个根源，期望里的完美机器、归因不对称、没有控制感，条条指向同一个结论，模型的第一次犯错比人的贵十倍。

118
00:11:44,380 --> 00:11:45,676
那怎么解。

119
00:11:45,626 --> 00:11:54,580
研究者接着做了后续实验，还是那个会犯错的模型，但这次允许被试微调模型的预测值，哪怕只允许改一点点。

120
00:11:54,580 --> 00:12:02,765
结果很惊人，仅仅允许微调，选择用模型的人数比例翻倍，而且多数人几乎没动那个滑块。

121
00:12:02,765 --> 00:12:10,013
实验界面长这样，系统给出学生四十七号的学业百分位预测六十二，旁边留一个你的调整框。

122
00:12:10,013 --> 00:12:16,864
不让改的设定下，只有百分之三十二的被试选择用模型，百分之六十八宁可自己来。

123
00:12:16,864 --> 00:12:20,722
允许微调之后，选择用模型的人数翻倍。

124
00:12:20,722 --> 00:12:26,972
这个结论我觉得是整集最值钱的一句，用户要的是权利，用不用另说。

125
00:12:26,972 --> 00:12:31,599
素材还把这个实验搬回产品，做了一个弃用率仪表盘。

126
00:12:31,599 --> 00:12:41,936
场景是，智能体报销审核助手上线一个月，刚在一批新用户面前算错了一笔账，这批用户的预期弃用率是百分之五十八。

127
00:12:41,936 --> 00:12:51,167
当前状态是，模型算错一笔差旅费，用户在只读结果页里干瞪眼，改不了、撤不了，问客服说模型偶尔会这样。

128
00:12:51,167 --> 00:12:55,505
右边有四个工程杠杆，挨个拨开看指针怎么动。

129
00:12:55,505 --> 00:13:04,556
其中一个特别有效，就是让用户亲手改，错误处一键修正，系统记住这条规则并展示已记住、下次生效。

130
00:13:04,556 --> 00:13:11,347
另外三个是，新手期走最稳的链路、给用户控制权、以及第二次不在原地翻车。

131
00:13:11,347 --> 00:13:15,950
所以用户刚被模型的错误坑了一次，最该给他什么。

132
00:13:15,950 --> 00:13:21,599
不是弹窗道歉，不是发一个月会员补偿，也不是连夜换上更强的模型。

133
00:13:21,599 --> 00:13:24,087
最有效的是让他亲手改。

134
00:13:24,087 --> 00:13:29,520
因为道歉和补偿都在解释，只有改的入口在把控制权还给他。

135
00:13:29,520 --> 00:13:31,371
还要提醒反方向。

136
00:13:31,371 --> 00:13:35,950
算法厌恶有个反向的孪生兄弟，叫自动化偏见。

137
00:13:35,950 --> 00:13:40,962
另一批用户会无条件接受模型输出，连显错的都照抄。

138
00:13:40,962 --> 00:13:48,198
同一个产品里两种人都有，厌恶者需要控制权和稳定性，盲信者需要摩擦和警告。

139
00:13:48,198 --> 00:13:53,510
信任校准是双向工程，只往一头使劲，另一头就出事。

140
00:13:53,668 --> 00:13:57,944
最后给你一份可以马上用的判断清单，一共五条。

141
00:13:57,894 --> 00:14:02,077
第一条，按记忆权重花预算，不按平均分。

142
00:14:02,077 --> 00:14:05,491
用户存档的只有峰值和结尾两帧。

143
00:14:05,491 --> 00:14:14,565
旗舰模型花在新手期和高价值时刻，中段用便宜模型加语义缓存兜底，省下的钱挪去两头买记忆分。

144
00:14:14,565 --> 00:14:17,113
第二条，护住最后一步。

145
00:14:17,113 --> 00:14:24,529
校验前置，中间产物随做随落盘，最后一步永远别做全链路里最容易失败的动作。

146
00:14:24,529 --> 00:14:27,870
结尾好一点点，整段记忆就被改写。

147
00:14:27,870 --> 00:14:32,029
第三条，把信任目标定在校准，不是满分。

148
00:14:32,029 --> 00:14:37,161
全信的出事故，不信的白花钱，产品要把用户往对角线上拉。

149
00:14:37,161 --> 00:14:42,101
判断时盯着风险和可核验性，别盯着模型强大与否。

150
00:14:42,101 --> 00:14:45,394
第四条，三件校准工具用起来。

151
00:14:45,394 --> 00:14:57,209
引用做成能点开的，把信我换成你可以验；置信度用代理信号说，比如检索命中数和来源一致性；警告有条件地出现，恒定免责三天就隐形。

152
00:14:57,209 --> 00:15:00,238
第五条，把控制权还给用户。

153
00:15:00,238 --> 00:15:09,084
首错之后最有效的补救不是道歉、不是补偿、不是换更强的模型，是让他亲手改，并且记住这条规则。

154
00:15:09,084 --> 00:15:16,693
另外，新用户走最稳的链路，实验性功能只对老用户开；同一个坑只能掉一次。

155
00:15:16,693 --> 00:15:19,385
这五条背后是同一个视角。

156
00:15:19,385 --> 00:15:28,399
你的仪表盘量的是平均值，用户脑子里存的只有峰值和结尾；你的目标是准确率，用户的目标是敢不敢用。

157
00:15:28,399 --> 00:15:31,128
这一集讲的是后面那一半。

