第 6 章 · 第 41 讲 · 15:31
前面两章练的是「看出哪里丑」「看出哪里难用」,管的都是界面上看得见、改得动的东西。这一集换了一条线:用户心里的东西。它决定的是三个更靠后的结果——用户会不会再来、会不会推荐、会不会在第一次出错之后就把你拉黑。
能力地图上,这一集落在「产品手感」的深水区。它不再问「这个按钮放哪儿」,而是问「用户脑子里到底存了什么」。三节课其实是三个不同层面的心理学接口:
| 课 | 心理机制 | 对应的产品决策 |
|---|---|---|
| 峰终定律 | 记忆自我只存峰值与结尾两帧 | 推理预算往哪儿花 |
| 信任校准 | 信任目标值是校准,不是满分 | 引用、置信度、警告怎么设计 |
| 算法厌恶 | 容错率不对称,AI 的错被记给能力 | 首错之后怎么把用户救回来 |
这三件事有一个共同的反直觉特征:按常识做决策,三条都会做反。用户记得的不是平均水平,而是峰值和结尾;信任的目标值不是满分,而是校准;用户对模型的容错率,远低于对人。产品经理的日常直觉,在这三处恰好都是错的。
诺奖得主卡尼曼发现,人对一段体验的记忆评分,几乎只由最强烈的那一刻(峰)和最后一刻(终)决定,和平均水平、持续时长关系都不大。原始证据来自 1993 年那篇标题就很挑衅的论文《偏爱更多的痛苦,只因结尾好了一点》——被试泡两场冷水,B 场客观上多受 30 秒罪,却因为结尾水温悄悄从 14 度升到 15 度,反而更愿意再来一次。
承受每一秒的是经验自我,做决定的只有记忆自我。打分、续费、向朋友推荐,签字的都是记忆自我。这个现象有个专名:时长忽视。1996 年 Redelmeier 与卡尼曼在真实肠镜病人身上重复了结论:术程从 4 分钟到 69 分钟,事后痛苦评分和时长几乎无关,和峰值疼痛、最后三分钟的疼痛高度相关。
产品侧的推论只有一句话:推理预算按记忆权重发钱。首次交互决定第一印象,收尾决定记忆的最后一帧,这两个位置值得用好模型;中段挂着语义缓存、质量有兜底,放心省。收官编排上,最后一步永远别做全链路里最容易失败的动作——校验前置、中间产物随做随落盘,最后一步只做打包交付。
信任这个指标,目标值从来就没定在满分。模型会出错是改不掉的物理现实,所以健康的用户长这样:该信的场景放心用,该查的场景留个心眼。往哪边偏都要交学费——信高了叫误用,信低了叫弃用,两头各有各的账单。
过度信任的账:纽约真实案件里,执业律师把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单。可怕之处在于,模型的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。
信任不足的账安静得多:员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨——它不上新闻,只出现在「工具活跃率 8%」的内部复盘里。
判断口诀:盯着风险 × 可核验性看,别盯着「模型强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。
人对模型的容错率,远低于对人。2015 年宾大沃顿的实验:先让一部分被试亲眼看到模型犯错,结果看过模型犯错的被试大面积弃用模型,宁可用自己更差的判断,哪怕模型的整体成绩比人高一截。论文标题就叫《算法厌恶》。
一句话总结:人们不是嫌算法不准,是嫌算法犯过错。准不准是统计问题,犯没犯过错是记忆问题,用户拿记忆做决定。
偏心的根子在归因方式:人的错误被归因给情境(这次意外、他会改),机器的错误被归因给能力(它就这水平、以后还这样)。人的预期自带误差条,机器的预期是计算器式的全对;对人你能吵能催,对模型只有接受和不接受两个按钮。三个根源指向同一个结论——模型的第一次犯错比人的贵十倍。
解药是控制权。2018 年的后续实验:不让改的设定下,只有 32% 的被试选择用模型,68% 宁可自己来;仅仅允许微调之后,选择用模型的人数翻倍,而且多数人几乎没动那个滑块。要的是权利,用不用另说。
把三节课放在一起看,会发现它们其实在讲同一件事的三张面孔:用户的心理账本,和工程仪表盘记的从来不是同一本账。
第一层错位:平均分 vs 记忆分。 工程团队优化的是平均值——延迟、准确率、成功率,这些都是可测的、连续的、可以画成曲线的量。但用户的记忆是稀疏的:它只存两个采样点,峰值和结尾。于是出现一个荒谬但真实的现象:一条平均分四平八稳的曲线,在用户那里可能毫无存在感;而一条平均分为负、却有一处高光和一处好结尾的曲线,会被用户当成好体验讲给同事听。这不是用户不理性,而是记忆本身就是一个压缩算法——它必须丢掉细节,只留下最能预测「下次还要不要来」的两帧。
第二层错位:准确率 vs 敢用率。 产品团队盯着的是模型准不准,用户心里装的是「我敢不敢把这件事交给它」。这两者的关系不是线性的:准确率从 90% 提到 95%,用户的敢用率可能一点不动;但一次在用户眼皮底下犯的错,能让敢用率腰斩。原因在于信任不是对能力的事后评估,而是对风险的事前预算。用户不是在问「它有多强」,而是在问「如果它错了,我兜得住吗」。这就是为什么「风险 × 可核验性」这个口诀比「模型强大与否」有用得多——它问的是兜底能力,不是上限能力。
第三层错位:统计错误 vs 记忆错误。 模型犯错,在统计上是一个概率事件,可以摊平、可以平均、可以用整体成绩抵消。但在用户的记忆里,犯错是一个事件,它会被贴上标签、归因、存档,而且几乎不会被后续的正确稀释。更麻烦的是归因不对称:人的错会被归到情境(这次意外、他会改),机器的错会被归到能力(它就这水平)。这意味着同样一次错误,人和 AI 在用户账本上的记账金额相差十倍。产品经理如果只从统计视角看错误率,就永远理解不了为什么用户会因为「只错了一次」就永久弃用。
理解了这三层错位,三个看起来互不相关的结论就有了统一解释:它们都在提醒你,用户不是用你的仪表盘在做决定,而是用他自己的记忆在投票。
拿到一个 AI 功能,按下面清单逐项过一遍,每一条都能在本集找到对应的机制:
这份清单不要一次性全勾。先用「峰位 / 终位 / 中段」三刀切预算,再用「信任定位」定基调,最后用剩下六条查设计细节。顺序错了会怎样?先纠结引用要不要做,结果整个会话的最后一步还是最容易失败的动作——预算花错了位置,细节做得再精致也救不回记忆分。
只往一头使劲,另一头就出事。同一个产品里,厌恶者需要控制权和稳定性,盲信者需要摩擦和警告。如果你只做「让用户更敢用」,盲信那一头会出事故;如果你只做「让用户更警惕」,信任不足那一头会把工具用成昂贵的摆设。产品设计任务是把落在两个角落里的用户,往对角线上拉,而不是把所有人推到某一个角。
用户刚被 AI 的错误坑过一次,四个常见动作的效果排序是:
| 动作 | 问题所在 |
|---|---|
| 弹窗道歉 | 在解释,没在解决问题 |
| 发放补偿 | 在解释,且把错误货币化 |
| 连夜换更强模型 | 用准确率赢信任,但用户要的不是准确率 |
| 让他亲手改 + 记住规则 | 把控制权还给他,唯一有效的方向 |
同一个坑只能掉一次:用户纠正过的错误要进记忆并展示「已记住」,第二次在原地翻车,厌恶叠加失望,基本救不回来。
误区一:把峰终定律理解成「只做两头、砍掉中间」。 这是最常见的误读。峰终定律说的是记忆权重,不是功能权重。中段可以省钱,但前提是有兜底——素材里的预算分配器明确交代,中段挂着语义缓存、质量有 5.0 分兜底,这才是它能省的原因。没有兜底的中段直接砍预算,用户在中段就会流失,根本走不到那个你精心设计的结尾。
误区二:把信任校准理解成「让用户更信任 AI」。 信任的目标值从来不是满分。全信的出事故,不信的白花钱,产品设计的任务是把落在两个角落里的用户往对角线上拉。如果你把「提升用户信任度」当成 KPI,方向就错了——你可能会做出「隐藏错误」「淡化警告」这类动作,短期信任上去了,长期事故率也上去了。
误区三:把算法厌恶理解成「用户不理性」。 用户的偏心其实有内在逻辑:他对 AI 的预期是计算器式的全对,而计算器是不该出错的。这个预期确实不合理,但它是既成事实,产品要做的不是教育用户「AI 也会错」,而是在设计上承认这个预期并给它出口——控制权就是那个出口。
误区四:用道歉和补偿修复首错。 弹窗道歉在解释,发放补偿在解释,连夜换更强的模型还是在解释。用户要的不是解释,是把控制权还给他。素材里那个四选一的题,正确答案是「让他亲手改,系统记住这条规则并展示已记住、下次生效」——因为只有这个动作,同时解决了控制感和「不会在同一个坑掉两次」两个焦虑。
误区五:只做一头,忽略自动化偏见。 算法厌恶有个反向的孪生兄弟叫自动化偏见:另一批用户会无条件接受 AI 输出,连显错的都照抄。同一个产品里两种人都有,厌恶者需要控制权和稳定性,盲信者需要摩擦和警告。信任校准是双向工程,只往一头使劲,另一头就出事。
选一个你手上真实在做的 AI 功能,按下面四步走一遍,限时 30 分钟:
练完之后你会发现,这四步没有一步需要新数据、新模型或者新预算。它们改的都是编排顺序和交互出口——这正是「产品手感」和「工程能力」的分界线。
本集的三节课最适合这样的产品:任务有一定复杂度、用户会重复使用、且错误有可感知的代价。对于一次性的、低风险的、用完即走的小工具,峰终定律仍然成立,但信任校准和算法厌恶的权重会低很多——用户根本来不及形成信任或厌恶,就已经走了。
反过来,如果你的产品是高价值、低频、高风险的(比如法律、医疗、财务),那么第二课和第三课的权重要往上调,第一课的权重可以下调。因为在这种场景里,用户的核心焦虑不是「体验好不好」,而是「错了怎么办」。
内容来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)