第 5 章 · 第 25 讲 · 15:33
本内容改编自小山学堂《学 AI 产品,从入门到精通》,为二次演绎配音版。
来源 xueai.miyang.cn(小山学堂 · 洛小山)
动手实战篇的收官集。这一集回答一个问题,从演示到产品到底差了什么。答案不在模型能力,而在分工、权限、连接这三件事上。
课程里有一句话说得很重,做人工智能产品最难的不是调接口,难的是在用户看不见的地方做出一百个正确的产品决策。用户看到的只是冰山一角,一个聊天框、几次回复,水面之下是产品经理要做的一百个决策。这一篇把口播里点到的每一个决策点,展开成可以直接拿去做评审的材料。
| 主题 | 核心问题 | 判断规则 | 关键量级 |
|---|---|---|---|
| 多智能体 | 什么时候真的需要分工 | 只有并行加速、角色制衡、风险隔离三种需求时才值得 | 新闻简报案例,二十五秒降到五秒 |
| 并发 | 谁能同时跑 | 看可以并行,改必须排队 | 三次搜索加一次写入,并行约四秒,串行约八秒 |
| 脑暴 | 怎么产生分歧 | 独立回答,主持人只提炼共识与分歧 | 总时间等于最慢那一个,不翻三倍 |
| 定时任务 | 上下文累积还是重建 | 每次新建会话,不复用旧会话 | 复用会话第二十四次约四万八千词元,成本差十倍 |
| 权限 | 给多大的自由 | 可逆性、出错代价、用户信任度三维度 | 从完全自主到每步审批的五档光谱 |
| 风险分级 | 弹不弹窗 | 低风险自动执行,高风险必须确认 | 无分级每步弹窗,有分级只弹高危 |
| 可观测性 | 它干了什么你知道吗 | 总耗时、循环次数、工具调用、词元消耗四项必备 | 词元消耗分布可反推用户真实使用路径 |
| 协议连接 | 单向还是双向 | 双向才能形成生态 | 作为客户端消费能力,作为服务端提供能力 |
| 懒连接 | 注册要不要等于连接 | 注册不等于连接,用到再连 | 启动从三十秒降到零点二秒 |
| 自配置 | 缺工具怎么办 | 能力发现、用户授权、即时生效、安全边界 | 门槛从会配置降到会说话 |
先说一个反直觉的结论,不是越多智能体越好,大多数时候一个就够了。真正需要分工的只有三种场景。
并行加速。 用户要整理今天的人工智能新闻,一个智能体依次搜索五个网站,总耗时二十五秒。改成五个子智能体同时去搜,每个负责一个来源,最后主智能体汇总,总耗时五秒。关键在于这些搜索互不干扰,天然适合并行。
角色分工。 让同一个智能体写完代码再审自己的代码,它很难发现自己的错误,就像自己检查自己的作文。分成两个,一个写代码,一个审代码。审查的那一方不知道写代码的那一方在想什么,只看最终产物,反而更容易发现问题。角色隔离让审查真正有效。
风险隔离。 主智能体在整理一份五十页的报告,其中需要解析几个附件。如果附件解析出错,格式损坏或者超时,直接在主智能体里做会导致整个任务崩溃。分出一个子智能体单独处理附件,成功了汇报结果,失败了报一句这个文件有问题,主智能体继续工作不受影响。
加第二个之前的三个问题。 一个智能体真的做不到吗,很多时候只是提示词没写好。增加的复杂度值得吗,更多智能体意味着更多协调成本和更多出错可能,你要维护的不再是一条链路,而是好几条链路之间的交接。有没有更简单的方案,比如用工具并行调用就能解决,不必真的分智能体。
可并行的只读操作:搜索网页、读取文件、查询接口、数据分析、数据库查询、读取笔记。这些操作不修改任何东西,十个智能体同时搜索也不会冲突。
必须串行的写操作:写入文件、发送邮件、执行命令、删除资源、支付操作、编辑笔记。这些操作会改变外部状态,两个智能体同时改同一个文件,结果就是数据覆盖、内容丢失。
判断规则只有一句:这个操作执行完,世界有没有变。没变就可以并行,变了就必须排队。补充一点,两个写操作如果改的是不同的东西,不同的文件、不同的数据表,也可以并行。冲突只发生在多个操作修改同一个资源的时候。
时间线对比:同一个任务是三次搜索加一次写入。三次搜索并行、写入排在最后,总耗时大约四秒;所有操作依次执行,总耗时大约八秒。
所以设计多智能体系统的第一步,是把工具分成读和写两类。这一步做对了,并行才有意义。反过来说,如果任务里大部分是写操作,并行带来的收益会非常有限,加再多智能体也只是把排队时间拉长。这个判断要在动手之前做。
和人类开会一样,一个人想到死,不如多个人独立思考再汇总。脑暴模式就是把同一个问题扔给多个智能体,让它们各自回答,最后由主持人整合共识与分歧。
以「如何提高用户留存率」为例,产品视角主张优化新手引导、增加个性化推荐;数据视角主张分析流失节点,锁定第三天和第七天设计召回;用户视角指出用户反馈最多的是不知道能干什么,核心问题是价值传递不到位。
主持人整合的结果是两条共识,核心问题是价值传递,新手引导是最高优先级改进点;两条分歧,用数据驱动还是用户访谈来确定改进方向,先做个性化推荐还是先简化核心流程。
为什么比一个智能体想到底更好,四条理由。避免思维定式,一个智能体会沿着一条线想下去。发现盲区,它想不到的另一个可能正好擅长。分歧即价值,三个意见一致说明方向明确,有分歧说明值得深挖。并行高效,三个同时思考,总时间等于最慢那一个,不会翻三倍。
硬性要求:每个智能体必须独立思考,不能看到其他智能体的答案。如果后一个能看到前一个的答案,它会被带偏,脑暴就失去意义了。主持人不负责再想一遍,只负责提炼共识、标注分歧,把分歧原样交给人类决策。
让智能体每小时整理一次新闻,听起来很简单。但如果复用旧会话,上下文每次都在增长,二十四小时之后成本会爆炸。
累积过程:第一次约两千词元,第二次约四千,第十次约两万,第二十四次约四万八千。每一次请求都要为这些历史词元付费。
新建会话:第二十四次的成本和第一次一模一样,因为不带任何历史上下文。而定时任务本来也不需要记忆,每次整理当前的新闻就够了,不需要知道昨天整理过什么。
结论:定时任务每次新建会话,别复用旧的。这个选择之差可以让月账单差十倍,而且新建会话不只是便宜,还更稳定,因为不依赖上一次留下了什么状态。
五个维度的光谱:从完全自主到每步审批,中间还有三种选择。选择取决于三个维度,操作的可逆性(发消息不可逆,读文件可逆)、出错的代价(删除数据代价高,搜索信息代价低)、用户的信任度(新用户谨慎,老用户信任)。
风险分级解决弹窗矛盾。无分级每步弹窗,用户点五次允许就想卸载;有分级只弹高危。低风险自动执行,包括读取文件、搜索信息、查看日历、格式化文本,不改变任何状态,出错也没有代价。高风险必须确认,包括删除文件、发送消息、执行支付、修改权限,不可逆或影响大。
谁来判断高危还是低危。三条路,产品经理在设计阶段预定义,最常用;让智能体根据上下文自己判断,更灵活但不一定准;让用户自己设置,最灵活但增加配置成本。
本质问题:给智能体多大的自由,本质上是在回答一个产品问题,这件事出错了,谁来负责。同一个产品里不同功能可以用不同的权限模式,一致性是给界面用的,不是给风险用的。
智能体在后台跑了三分钟,调了几个工具,花了多少词元,中间有没有出错。回答不了这些问题,你的智能体就是个黑盒。
执行报告必备项:总耗时、循环次数、工具调用次数、总词元消耗、执行时间线、工具调用统计、词元消耗分布。
对开发者的价值:定位智能体在哪一步出了问题,发现无效循环和浪费掉的词元,优化工具调用链路。
对产品经理的价值:理解用户真实的使用路径,量化每一个功能的成本,为下一版迭代提供数据。词元消耗分布这一项几乎是刚需,它能告诉你用户真正在用的到底是哪一个功能,而不是你以为的那一个。
一个没有仪表盘的智能体,就像一辆没有仪表盘的车,不知道油量,不知道转速,不知道什么时候会抛锚。可观测性不是给工程师的玩具,它是产品化的基本功。
作为客户端(消费者):连接外部服务,调用别人提供的能力,日历、邮件、数据库、浏览器,主动发起请求,获取外部能力。
作为服务端(提供者):把自己的能力通过同一套协议暴露出去,被编程工具调用,被桌面端调用,被自动化脚本定时触发,被动接收请求,提供自身能力。
为什么双向重要:单向集成只是工具调用,跟普通接口没有本质区别。双向集成意味着它不仅能用工具,还能成为工具。当多个智能体都能互相调用的时候,一个生态就自然形成了。这是从工具到平台的关键跨越。
懒连接三原则:注册不等于连接,启动时只声明我有哪些工具可用;首次使用时连接,大多数工具可能一整天都用不到;故障隔离,某个服务挂了只影响那一个工具。真实数据是启动从三十秒降到零点二秒,用户感受到的是秒开。
自配置四要点:能力发现,它得知道有哪些工具可以加;用户授权,不能偷偷连接新服务,必须明确告知并等用户同意;即时生效,配完就能用,不用重启,当前对话无缝继续;安全边界,涉及敏感数据的工具需要更严格的审批。这一下把门槛从会配置降到了会说话。
在加第二个之前先问三个问题,一个真的做不到吗,复杂度值得吗,有没有更简单的方案。只有并行加速、角色制衡、风险隔离这三种明确需求时才值得引入。很多团队一上手就设计一堆角色,结果协调成本比收益还大。
判断规则只有一句,这个操作执行完,世界有没有变。没变就可以并行,变了就必须排队。两个写操作改不同的东西也可以并行,冲突只发生在修改同一个资源的时候。这一步要在动手之前做完。
复用旧会话会让上下文滚雪球,第二十四次就到四万八千词元。每次新建会话,成本恒定,也更稳定。一个选择差十倍成本,这是所有收官章节里性价比最高的一条。
低风险自动执行,高风险必须确认。先想清楚出错之后谁负责,再决定弹不弹窗。同一个产品不同功能可以用不同档位,一致性是给界面用的,不是给风险用的。
总耗时、循环次数、工具调用、词元消耗这四项看不见,你的智能体就是黑盒。词元消耗分布还能反推用户真实使用路径,这是产品经理最容易低估的一项。
让它从会说变成会做,只需要接上一个真工具。一次工具调用的完整闭环只有四段。
最容易被忘掉的是第四段。少了它,用户看到的就是一坨原始文本,而不是一句人话。
挑工具的三个标准:高频,你的场景里几乎每次都用得上;低风险,只读优先,查天气、搜文档都比发邮件安全;输入输出清楚,参数两三个,返回结构固定。挑不出来就选「搜索我的某某资料」,它几乎适配所有场景。
工具描述写成三行:第一行写什么时候该用,也写清什么时候不该用;第二行写每个参数的含义、格式和示例值;第三行写返回什么、拿到之后该怎么用。检验标准是把描述发给一个没看过你代码的人,他能正确说出什么情况下会用、传什么参数。
验收标准:正常问题四段全通,答案是人话而不是原始文本;破坏性问题你能指出卡在第几段、为什么。跑通一次之后要故意搞一次破坏,问一个参数含糊的问题。卡死那一条记录最值钱,下一章的评测就从它开始。
误区一,角色越多越专业。 多智能体带来的是协调成本和交接风险,不是能力叠加。大多数时候一个就够了。
误区二,并行一定更快。 如果任务主体是写操作,并行收益非常有限,只是把排队时间换个地方浪费。
误区三,脑暴就是多问几次。 关键在于独立,一旦互相可见,就退化成同一个智能体的连续输出。
误区四,复用会话更聪明。 定时任务不需要记忆,复用只会让上下文滚雪球。
误区五,权限要不就全放要不就全收。 风险分级才是答案,而且是按功能分别定档,不是全局一把尺。
误区六,协议只是调工具的接口。 双向才是价值所在,能被调用意味着你的产品有机会成为别人的能力来源。
来源 xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)