CHAPTER 6 · EP 41

等待与过程设计 · 信任与防御

第 6 章 · 第 41 讲 · 15:31

时长 15:31音色 云健 · 男声章节 6

同步字幕

章节导航(点击跳转)

0:00开场 · 从交互工程,走到用户心里1:22
1:22一 · 峰终定律与那盆冷水1:58
3:20二 · 记忆分不等于平均分2:33
5:54三 · 信任校准,两端各有账单1:59
7:53四 · 三件校准工具1:42
9:36五 · 算法厌恶与归因不对称2:07
11:44六 · 解药是控制权2:09
13:53可带走的判断清单1:37
解读全文

ep41 · 等待与过程设计 · 信任与防御 —— 解读与音频稿件

  • 模块:M6 产品手感
  • 课节:3 节(峰终定律 / 信任校准 / 算法厌恶)
  • 音频时长:约 15 分钟
  • 来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)

一、本集在能力地图上的位置

前面两章练的是「看出哪里丑」「看出哪里难用」,管的都是界面上看得见、改得动的东西。这一集换了一条线:用户心里的东西。它决定的是三个更靠后的结果——用户会不会再来、会不会推荐、会不会在第一次出错之后就把你拉黑。

能力地图上,这一集落在「产品手感」的深水区。它不再问「这个按钮放哪儿」,而是问「用户脑子里到底存了什么」。三节课其实是三个不同层面的心理学接口:

课心理机制对应的产品决策
峰终定律记忆自我只存峰值与结尾两帧推理预算往哪儿花
信任校准信任目标值是校准,不是满分引用、置信度、警告怎么设计
算法厌恶容错率不对称,AI 的错被记给能力首错之后怎么把用户救回来

这三件事有一个共同的反直觉特征:按常识做决策,三条都会做反。用户记得的不是平均水平,而是峰值和结尾;信任的目标值不是满分,而是校准;用户对模型的容错率,远低于对人。产品经理的日常直觉,在这三处恰好都是错的。

二、三节课的核心结论

第一课:记忆分不等于平均分

诺奖得主卡尼曼发现,人对一段体验的记忆评分,几乎只由最强烈的那一刻(峰)和最后一刻(终)决定,和平均水平、持续时长关系都不大。原始证据来自 1993 年那篇标题就很挑衅的论文《偏爱更多的痛苦,只因结尾好了一点》——被试泡两场冷水,B 场客观上多受 30 秒罪,却因为结尾水温悄悄从 14 度升到 15 度,反而更愿意再来一次。

承受每一秒的是经验自我,做决定的只有记忆自我。打分、续费、向朋友推荐,签字的都是记忆自我。这个现象有个专名:时长忽视。1996 年 Redelmeier 与卡尼曼在真实肠镜病人身上重复了结论:术程从 4 分钟到 69 分钟,事后痛苦评分和时长几乎无关,和峰值疼痛、最后三分钟的疼痛高度相关。

产品侧的推论只有一句话:推理预算按记忆权重发钱。首次交互决定第一印象,收尾决定记忆的最后一帧,这两个位置值得用好模型;中段挂着语义缓存、质量有兜底,放心省。收官编排上,最后一步永远别做全链路里最容易失败的动作——校验前置、中间产物随做随落盘,最后一步只做打包交付。

第二课:信任的目标值是校准

信任这个指标,目标值从来就没定在满分。模型会出错是改不掉的物理现实,所以健康的用户长这样:该信的场景放心用,该查的场景留个心眼。往哪边偏都要交学费——信高了叫误用,信低了叫弃用,两头各有各的账单。

过度信任的账:纽约真实案件里,执业律师把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单。可怕之处在于,模型的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。

信任不足的账安静得多:员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨——它不上新闻,只出现在「工具活跃率 8%」的内部复盘里。

判断口诀:盯着风险 × 可核验性看,别盯着「模型强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。

第三课:算法厌恶与它的解药

人对模型的容错率,远低于对人。2015 年宾大沃顿的实验:先让一部分被试亲眼看到模型犯错,结果看过模型犯错的被试大面积弃用模型,宁可用自己更差的判断,哪怕模型的整体成绩比人高一截。论文标题就叫《算法厌恶》。

一句话总结:人们不是嫌算法不准,是嫌算法犯过错。准不准是统计问题,犯没犯过错是记忆问题,用户拿记忆做决定。

偏心的根子在归因方式:人的错误被归因给情境(这次意外、他会改),机器的错误被归因给能力(它就这水平、以后还这样)。人的预期自带误差条,机器的预期是计算器式的全对;对人你能吵能催,对模型只有接受和不接受两个按钮。三个根源指向同一个结论——模型的第一次犯错比人的贵十倍。

解药是控制权。2018 年的后续实验:不让改的设定下,只有 32% 的被试选择用模型,68% 宁可自己来;仅仅允许微调之后,选择用模型的人数翻倍,而且多数人几乎没动那个滑块。要的是权利,用不用另说。

三、三个反直觉结论的深层机制

把三节课放在一起看,会发现它们其实在讲同一件事的三张面孔:用户的心理账本,和工程仪表盘记的从来不是同一本账。

第一层错位:平均分 vs 记忆分。 工程团队优化的是平均值——延迟、准确率、成功率,这些都是可测的、连续的、可以画成曲线的量。但用户的记忆是稀疏的:它只存两个采样点,峰值和结尾。于是出现一个荒谬但真实的现象:一条平均分四平八稳的曲线,在用户那里可能毫无存在感;而一条平均分为负、却有一处高光和一处好结尾的曲线,会被用户当成好体验讲给同事听。这不是用户不理性,而是记忆本身就是一个压缩算法——它必须丢掉细节,只留下最能预测「下次还要不要来」的两帧。

第二层错位:准确率 vs 敢用率。 产品团队盯着的是模型准不准,用户心里装的是「我敢不敢把这件事交给它」。这两者的关系不是线性的:准确率从 90% 提到 95%,用户的敢用率可能一点不动;但一次在用户眼皮底下犯的错,能让敢用率腰斩。原因在于信任不是对能力的事后评估,而是对风险的事前预算。用户不是在问「它有多强」,而是在问「如果它错了,我兜得住吗」。这就是为什么「风险 × 可核验性」这个口诀比「模型强大与否」有用得多——它问的是兜底能力,不是上限能力。

第三层错位:统计错误 vs 记忆错误。 模型犯错,在统计上是一个概率事件,可以摊平、可以平均、可以用整体成绩抵消。但在用户的记忆里,犯错是一个事件,它会被贴上标签、归因、存档,而且几乎不会被后续的正确稀释。更麻烦的是归因不对称:人的错会被归到情境(这次意外、他会改),机器的错会被归到能力(它就这水平)。这意味着同样一次错误,人和 AI 在用户账本上的记账金额相差十倍。产品经理如果只从统计视角看错误率,就永远理解不了为什么用户会因为「只错了一次」就永久弃用。

理解了这三层错位,三个看起来互不相关的结论就有了统一解释:它们都在提醒你,用户不是用你的仪表盘在做决定,而是用他自己的记忆在投票。

四、审查清单

拿到一个 AI 功能,按下面清单逐项过一遍,每一条都能在本集找到对应的机制:

  • 峰位检查:这段体验的峰值在哪?有没有刻意造峰(旗舰模型用在新手期与高价值时刻)?
  • 终位检查:最后一步是什么动作?它是不是全链路里最容易失败的那一个?
  • 中段检查:中段有没有兜底机制(缓存 / 便宜模型)?省下的预算挪去两头了吗?
  • 信任定位:这个场景下用户应该「信」还是「查」?风险 × 可核验性的坐标在哪?
  • 引用可点:引用是装饰性的还是真能点开核对?假引用被戳穿一次,比没有引用糟糕十倍。
  • 置信度信号:有没有用检索命中数、相关度、来源一致性这些代理信号,而不是让模型自报把握?
  • 警告条件化:免责小字是恒定出现,还是低置信时带原因弹出?恒定免责三天就隐形。
  • 控制权入口:用户能不能亲手改?改完之后系统有没有记住并展示「已记住,下次生效」?
  • 首错位置:新用户是不是走最稳的链路?实验性功能是不是只对老用户开?
  • 反方向检查:有没有考虑自动化偏见那一头——盲信者需要摩擦和警告。

提示1:清单的用法

这份清单不要一次性全勾。先用「峰位 / 终位 / 中段」三刀切预算,再用「信任定位」定基调,最后用剩下六条查设计细节。顺序错了会怎样?先纠结引用要不要做,结果整个会话的最后一步还是最容易失败的动作——预算花错了位置,细节做得再精致也救不回记忆分。

提示2:预算分配的三条暗规则

  1. 中段能省的前提是有兜底。语义缓存质量有 5.0 分兜底,这是它敢省的原因;没有兜底的中段直接砍预算,就是拿平均分换记忆分,两头都不讨好。
  2. 两头重不是两头平。首次交互要「接住」新手的迷茫,收尾要「兑现」整段会话的价值,两者的优化手法不同——前者靠信息密度,后者靠确定性。
  3. 缓存也算一个峰。秒回的响应本身就是一个体验峰值,别把它只当成成本优化。

提示3:信任校准是双向工程

只往一头使劲,另一头就出事。同一个产品里,厌恶者需要控制权和稳定性,盲信者需要摩擦和警告。如果你只做「让用户更敢用」,盲信那一头会出事故;如果你只做「让用户更警惕」,信任不足那一头会把工具用成昂贵的摆设。产品设计任务是把落在两个角落里的用户,往对角线上拉,而不是把所有人推到某一个角。

提示4:首错的修复动作排序

用户刚被 AI 的错误坑过一次,四个常见动作的效果排序是:

动作问题所在
弹窗道歉在解释,没在解决问题
发放补偿在解释,且把错误货币化
连夜换更强模型用准确率赢信任,但用户要的不是准确率
让他亲手改 + 记住规则把控制权还给他,唯一有效的方向

同一个坑只能掉一次:用户纠正过的错误要进记忆并展示「已记住」,第二次在原地翻车,厌恶叠加失望,基本救不回来。

五、约束说明

  • 口播稿约束:本集口播稿 8 段、正文净 4615 字符,落在 4600–5300 的硬区间内;全程未使用半角冒号、括号、方括号、井号等禁用符号;无 emoji;人名与论文名一律做了中文化处理(如「一位诺奖得主心理学家」「几位研究者」),避免直接口播英文专名。
  • 题库剔除:本集无 quizFiles,无需执行题库剔除门禁。
  • 取材纪律:全部内容来自本集 3 节课节素材(峰终定律 / 信任校准 / 算法厌恶),未跨集取材、未虚构数据。文中出现的数字(14 度 / 60 秒 / 30 秒、4 分钟到 69 分钟、8%、32% / 68%、12%)均直接来自素材原文。
  • 音频规格:32kbps / 24000Hz / 单声道,SRT 与音频逐条对齐,末条时间戳偏差小于 2 秒。

六、延伸与来源

  • 冷水实验:Kahneman, Fredrickson, Schreiber & Redelmeier (1993), *When More Pain Is Preferred to Less: Adding a Better End*, Psychological Science
  • 肠镜研究:Redelmeier & Kahneman (1996), Pain
  • 记忆自我与经验自我、时长忽视:卡尼曼《思考,快与慢》第 35、36 章
  • 信任校准奠基综述:Lee & See (2004), *Trust in Automation: Designing for Appropriate Reliance*;误用与弃用的提法出自 Parasuraman & Riley (1997)
  • 横幅盲视:Benway & Lane (1998) 眼动研究
  • 算法厌恶:Dietvorst, Simmons & Massey, *Algorithm Aversion* (2015) 与 *Overcoming Algorithm Aversion* (2018)
  • 产品侧衔接:第 2 课(等待心理学)讲结束那一下的感受权重,第 10 课(蜜月悬崖)讲第一印象的预算怎么接住,成本篇的分层路由与语义缓存是本课预算分配器的工程底座。

七、常见误区与反例

误区一:把峰终定律理解成「只做两头、砍掉中间」。 这是最常见的误读。峰终定律说的是记忆权重,不是功能权重。中段可以省钱,但前提是有兜底——素材里的预算分配器明确交代,中段挂着语义缓存、质量有 5.0 分兜底,这才是它能省的原因。没有兜底的中段直接砍预算,用户在中段就会流失,根本走不到那个你精心设计的结尾。

误区二:把信任校准理解成「让用户更信任 AI」。 信任的目标值从来不是满分。全信的出事故,不信的白花钱,产品设计的任务是把落在两个角落里的用户往对角线上拉。如果你把「提升用户信任度」当成 KPI,方向就错了——你可能会做出「隐藏错误」「淡化警告」这类动作,短期信任上去了,长期事故率也上去了。

误区三:把算法厌恶理解成「用户不理性」。 用户的偏心其实有内在逻辑:他对 AI 的预期是计算器式的全对,而计算器是不该出错的。这个预期确实不合理,但它是既成事实,产品要做的不是教育用户「AI 也会错」,而是在设计上承认这个预期并给它出口——控制权就是那个出口。

误区四:用道歉和补偿修复首错。 弹窗道歉在解释,发放补偿在解释,连夜换更强的模型还是在解释。用户要的不是解释,是把控制权还给他。素材里那个四选一的题,正确答案是「让他亲手改,系统记住这条规则并展示已记住、下次生效」——因为只有这个动作,同时解决了控制感和「不会在同一个坑掉两次」两个焦虑。

误区五:只做一头,忽略自动化偏见。 算法厌恶有个反向的孪生兄弟叫自动化偏见:另一批用户会无条件接受 AI 输出,连显错的都照抄。同一个产品里两种人都有,厌恶者需要控制权和稳定性,盲信者需要摩擦和警告。信任校准是双向工程,只往一头使劲,另一头就出事。

八、动手练习:把三节课串成一条链

选一个你手上真实在做的 AI 功能,按下面四步走一遍,限时 30 分钟:

  1. 画一条体验曲线(10 分钟)。把用户完成这个任务的路径拆成 8 到 10 个节点,每个节点打 -2 到 +2。然后分别算两个分数:算术平均(工程视角)和(峰值 + 结尾)÷ 2(用户视角)。两个分数的差,就是你被仪表盘骗走的那部分。
  2. 定位终位风险(5 分钟)。看最后一个节点,问一句:它是不是全链路里最容易失败的动作?如果是,把它挪到前面,把最确定、最不可能失败的动作放到最后。
  3. 画一张信任坐标(10 分钟)。横轴是这个场景下系统真实的可靠性,纵轴是用户以为的可靠性。把你现有的用户标上去——他们落在对角线上,还是落在两个角落里?落在过度信任那一角的,加引用和警告;落在信任不足那一角的,加控制权和可核验性。
  4. 设计首错预案(5 分钟)。假设明天就出一次错,用户看到的第一个界面是什么?如果答案是「只读结果页 + 客服话术」,那你现在就该改。

练完之后你会发现,这四步没有一步需要新数据、新模型或者新预算。它们改的都是编排顺序和交互出口——这正是「产品手感」和「工程能力」的分界线。

九、适用边界

本集的三节课最适合这样的产品:任务有一定复杂度、用户会重复使用、且错误有可感知的代价。对于一次性的、低风险的、用完即走的小工具,峰终定律仍然成立,但信任校准和算法厌恶的权重会低很多——用户根本来不及形成信任或厌恶,就已经走了。

反过来,如果你的产品是高价值、低频、高风险的(比如法律、医疗、财务),那么第二课和第三课的权重要往上调,第一课的权重可以下调。因为在这种场景里,用户的核心焦虑不是「体验好不好」,而是「错了怎么办」。


内容来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)