CHAPTER 5 · EP 25

多 Agent · 权限与安全 · MCP 实战 · 实战收官 · 你现在能做什么

第 5 章 · 第 25 讲 · 15:33

时长 15:33音色 云健 · 男声章节 5

同步字幕

章节导航(点击跳转)

0:00开场 · 这一集解决什么问题1:13
1:13第一层 · 什么时候才需要多个智能体2:06
3:20第二层 · 并发的代价,看可以并行,改必须排队1:36
4:57第三层 · 脑暴,让多个智能体吵架2:04
7:01第四层 · 定时任务的成本陷阱1:16
8:17第五层 · 该给多大的自由1:51
10:09第六层 · 它干了什么,你知道吗1:13
11:22第七层 · 连接这件事,双向才叫生态2:04
13:27可带走的判断清单2:06
解读全文

ep25 · 多 Agent · 权限与安全 · MCP 实战 · 实战收官 · 你现在能做什么

本内容改编自小山学堂《学 AI 产品,从入门到精通》,为二次演绎配音版。
来源 xueai.miyang.cn(小山学堂 · 洛小山)

本集定位

动手实战篇的收官集。这一集回答一个问题,从演示到产品到底差了什么。答案不在模型能力,而在分工、权限、连接这三件事上。

课程里有一句话说得很重,做人工智能产品最难的不是调接口,难的是在用户看不见的地方做出一百个正确的产品决策。用户看到的只是冰山一角,一个聊天框、几次回复,水面之下是产品经理要做的一百个决策。这一篇把口播里点到的每一个决策点,展开成可以直接拿去做评审的材料。


一、能力地图

主题核心问题判断规则关键量级
多智能体什么时候真的需要分工只有并行加速、角色制衡、风险隔离三种需求时才值得新闻简报案例,二十五秒降到五秒
并发谁能同时跑看可以并行,改必须排队三次搜索加一次写入,并行约四秒,串行约八秒
脑暴怎么产生分歧独立回答,主持人只提炼共识与分歧总时间等于最慢那一个,不翻三倍
定时任务上下文累积还是重建每次新建会话,不复用旧会话复用会话第二十四次约四万八千词元,成本差十倍
权限给多大的自由可逆性、出错代价、用户信任度三维度从完全自主到每步审批的五档光谱
风险分级弹不弹窗低风险自动执行,高风险必须确认无分级每步弹窗,有分级只弹高危
可观测性它干了什么你知道吗总耗时、循环次数、工具调用、词元消耗四项必备词元消耗分布可反推用户真实使用路径
协议连接单向还是双向双向才能形成生态作为客户端消费能力,作为服务端提供能力
懒连接注册要不要等于连接注册不等于连接,用到再连启动从三十秒降到零点二秒
自配置缺工具怎么办能力发现、用户授权、即时生效、安全边界门槛从会配置降到会说话

二、什么时候才需要多个智能体

先说一个反直觉的结论,不是越多智能体越好,大多数时候一个就够了。真正需要分工的只有三种场景。

并行加速。 用户要整理今天的人工智能新闻,一个智能体依次搜索五个网站,总耗时二十五秒。改成五个子智能体同时去搜,每个负责一个来源,最后主智能体汇总,总耗时五秒。关键在于这些搜索互不干扰,天然适合并行。

角色分工。 让同一个智能体写完代码再审自己的代码,它很难发现自己的错误,就像自己检查自己的作文。分成两个,一个写代码,一个审代码。审查的那一方不知道写代码的那一方在想什么,只看最终产物,反而更容易发现问题。角色隔离让审查真正有效。

风险隔离。 主智能体在整理一份五十页的报告,其中需要解析几个附件。如果附件解析出错,格式损坏或者超时,直接在主智能体里做会导致整个任务崩溃。分出一个子智能体单独处理附件,成功了汇报结果,失败了报一句这个文件有问题,主智能体继续工作不受影响。

加第二个之前的三个问题。 一个智能体真的做不到吗,很多时候只是提示词没写好。增加的复杂度值得吗,更多智能体意味着更多协调成本和更多出错可能,你要维护的不再是一条链路,而是好几条链路之间的交接。有没有更简单的方案,比如用工具并行调用就能解决,不必真的分智能体。


三、并发的代价,看可以并行,改必须排队

可并行的只读操作:搜索网页、读取文件、查询接口、数据分析、数据库查询、读取笔记。这些操作不修改任何东西,十个智能体同时搜索也不会冲突。

必须串行的写操作:写入文件、发送邮件、执行命令、删除资源、支付操作、编辑笔记。这些操作会改变外部状态,两个智能体同时改同一个文件,结果就是数据覆盖、内容丢失。

判断规则只有一句:这个操作执行完,世界有没有变。没变就可以并行,变了就必须排队。补充一点,两个写操作如果改的是不同的东西,不同的文件、不同的数据表,也可以并行。冲突只发生在多个操作修改同一个资源的时候。

时间线对比:同一个任务是三次搜索加一次写入。三次搜索并行、写入排在最后,总耗时大约四秒;所有操作依次执行,总耗时大约八秒。

所以设计多智能体系统的第一步,是把工具分成读和写两类。这一步做对了,并行才有意义。反过来说,如果任务里大部分是写操作,并行带来的收益会非常有限,加再多智能体也只是把排队时间拉长。这个判断要在动手之前做。


四、脑暴模式,让多个智能体吵架

和人类开会一样,一个人想到死,不如多个人独立思考再汇总。脑暴模式就是把同一个问题扔给多个智能体,让它们各自回答,最后由主持人整合共识与分歧。

以「如何提高用户留存率」为例,产品视角主张优化新手引导、增加个性化推荐;数据视角主张分析流失节点,锁定第三天和第七天设计召回;用户视角指出用户反馈最多的是不知道能干什么,核心问题是价值传递不到位。

主持人整合的结果是两条共识,核心问题是价值传递,新手引导是最高优先级改进点;两条分歧,用数据驱动还是用户访谈来确定改进方向,先做个性化推荐还是先简化核心流程。

为什么比一个智能体想到底更好,四条理由。避免思维定式,一个智能体会沿着一条线想下去。发现盲区,它想不到的另一个可能正好擅长。分歧即价值,三个意见一致说明方向明确,有分歧说明值得深挖。并行高效,三个同时思考,总时间等于最慢那一个,不会翻三倍。

硬性要求:每个智能体必须独立思考,不能看到其他智能体的答案。如果后一个能看到前一个的答案,它会被带偏,脑暴就失去意义了。主持人不负责再想一遍,只负责提炼共识、标注分歧,把分歧原样交给人类决策。


五、定时任务的成本陷阱

让智能体每小时整理一次新闻,听起来很简单。但如果复用旧会话,上下文每次都在增长,二十四小时之后成本会爆炸。

累积过程:第一次约两千词元,第二次约四千,第十次约两万,第二十四次约四万八千。每一次请求都要为这些历史词元付费。

新建会话:第二十四次的成本和第一次一模一样,因为不带任何历史上下文。而定时任务本来也不需要记忆,每次整理当前的新闻就够了,不需要知道昨天整理过什么。

结论:定时任务每次新建会话,别复用旧的。这个选择之差可以让月账单差十倍,而且新建会话不只是便宜,还更稳定,因为不依赖上一次留下了什么状态。


六、权限与安全

五个维度的光谱:从完全自主到每步审批,中间还有三种选择。选择取决于三个维度,操作的可逆性(发消息不可逆,读文件可逆)、出错的代价(删除数据代价高,搜索信息代价低)、用户的信任度(新用户谨慎,老用户信任)。

风险分级解决弹窗矛盾。无分级每步弹窗,用户点五次允许就想卸载;有分级只弹高危。低风险自动执行,包括读取文件、搜索信息、查看日历、格式化文本,不改变任何状态,出错也没有代价。高风险必须确认,包括删除文件、发送消息、执行支付、修改权限,不可逆或影响大。

谁来判断高危还是低危。三条路,产品经理在设计阶段预定义,最常用;让智能体根据上下文自己判断,更灵活但不一定准;让用户自己设置,最灵活但增加配置成本。

本质问题:给智能体多大的自由,本质上是在回答一个产品问题,这件事出错了,谁来负责。同一个产品里不同功能可以用不同的权限模式,一致性是给界面用的,不是给风险用的。


七、可观测性

智能体在后台跑了三分钟,调了几个工具,花了多少词元,中间有没有出错。回答不了这些问题,你的智能体就是个黑盒。

执行报告必备项:总耗时、循环次数、工具调用次数、总词元消耗、执行时间线、工具调用统计、词元消耗分布。

对开发者的价值:定位智能体在哪一步出了问题,发现无效循环和浪费掉的词元,优化工具调用链路。

对产品经理的价值:理解用户真实的使用路径,量化每一个功能的成本,为下一版迭代提供数据。词元消耗分布这一项几乎是刚需,它能告诉你用户真正在用的到底是哪一个功能,而不是你以为的那一个。

一个没有仪表盘的智能体,就像一辆没有仪表盘的车,不知道油量,不知道转速,不知道什么时候会抛锚。可观测性不是给工程师的玩具,它是产品化的基本功。


八、连接,双向才叫生态

作为客户端(消费者):连接外部服务,调用别人提供的能力,日历、邮件、数据库、浏览器,主动发起请求,获取外部能力。

作为服务端(提供者):把自己的能力通过同一套协议暴露出去,被编程工具调用,被桌面端调用,被自动化脚本定时触发,被动接收请求,提供自身能力。

为什么双向重要:单向集成只是工具调用,跟普通接口没有本质区别。双向集成意味着它不仅能用工具,还能成为工具。当多个智能体都能互相调用的时候,一个生态就自然形成了。这是从工具到平台的关键跨越。

懒连接三原则:注册不等于连接,启动时只声明我有哪些工具可用;首次使用时连接,大多数工具可能一整天都用不到;故障隔离,某个服务挂了只影响那一个工具。真实数据是启动从三十秒降到零点二秒,用户感受到的是秒开。

自配置四要点:能力发现,它得知道有哪些工具可以加;用户授权,不能偷偷连接新服务,必须明确告知并等用户同意;即时生效,配完就能用,不用重启,当前对话无缝继续;安全边界,涉及敏感数据的工具需要更严格的审批。这一下把门槛从会配置降到了会说话。


提示1 · 先别急着加第二个智能体

在加第二个之前先问三个问题,一个真的做不到吗,复杂度值得吗,有没有更简单的方案。只有并行加速、角色制衡、风险隔离这三种明确需求时才值得引入。很多团队一上手就设计一堆角色,结果协调成本比收益还大。

提示2 · 把工具分成读和写两类

判断规则只有一句,这个操作执行完,世界有没有变。没变就可以并行,变了就必须排队。两个写操作改不同的东西也可以并行,冲突只发生在修改同一个资源的时候。这一步要在动手之前做完。

提示3 · 定时任务一定新建会话

复用旧会话会让上下文滚雪球,第二十四次就到四万八千词元。每次新建会话,成本恒定,也更稳定。一个选择差十倍成本,这是所有收官章节里性价比最高的一条。

提示4 · 权限用风险分级,不要一刀切

低风险自动执行,高风险必须确认。先想清楚出错之后谁负责,再决定弹不弹窗。同一个产品不同功能可以用不同档位,一致性是给界面用的,不是给风险用的。

提示5 · 上线之前先把仪表盘做出来

总耗时、循环次数、工具调用、词元消耗这四项看不见,你的智能体就是黑盒。词元消耗分布还能反推用户真实使用路径,这是产品经理最容易低估的一项。


九、接上第一个真工具

让它从会说变成会做,只需要接上一个真工具。一次工具调用的完整闭环只有四段。

  1. 模型开口要,输出一段结构化文本,说明调哪个工具、参数是什么
  2. 框架校验参数,格式对不对、值合不合法,不合法就打回重来
  3. 真实执行,查数据库、发请求、写文件,这一步才碰真实世界
  4. 结果回喂,把执行结果塞回对话,模型消化之后再组织成人话

最容易被忘掉的是第四段。少了它,用户看到的就是一坨原始文本,而不是一句人话。

挑工具的三个标准:高频,你的场景里几乎每次都用得上;低风险,只读优先,查天气、搜文档都比发邮件安全;输入输出清楚,参数两三个,返回结构固定。挑不出来就选「搜索我的某某资料」,它几乎适配所有场景。

工具描述写成三行:第一行写什么时候该用,也写清什么时候不该用;第二行写每个参数的含义、格式和示例值;第三行写返回什么、拿到之后该怎么用。检验标准是把描述发给一个没看过你代码的人,他能正确说出什么情况下会用、传什么参数。

验收标准:正常问题四段全通,答案是人话而不是原始文本;破坏性问题你能指出卡在第几段、为什么。跑通一次之后要故意搞一次破坏,问一个参数含糊的问题。卡死那一条记录最值钱,下一章的评测就从它开始。


十、审查清单

  1. 这个场景真的需要第二个智能体吗?三种需求有没有对上?
  2. 工具清单有没有分成读和写两类?写操作的排队机制做了吗?
  3. 脑暴模式里各智能体是否真的互相独立?有没有被前一个答案带偏?
  4. 定时任务是不是每次新建会话?二十四小时成本有没有算过?
  5. 权限档位是按可逆性、代价、信任度三个维度定的吗?
  6. 哪些操作定义为高危?判断权在产品、模型还是用户手里?
  7. 仪表盘四项指标是否齐备?词元消耗分布能不能按功能拆开?
  8. 连接是单向还是双向?懒连接的故障隔离验证过吗?
  9. 自配置的授权流程有没有?敏感数据工具是不是走了更严格的审批?
  10. 第一个工具的闭环四段是否全通?破坏测试做过吗?

十一、常见误区

误区一,角色越多越专业。 多智能体带来的是协调成本和交接风险,不是能力叠加。大多数时候一个就够了。

误区二,并行一定更快。 如果任务主体是写操作,并行收益非常有限,只是把排队时间换个地方浪费。

误区三,脑暴就是多问几次。 关键在于独立,一旦互相可见,就退化成同一个智能体的连续输出。

误区四,复用会话更聪明。 定时任务不需要记忆,复用只会让上下文滚雪球。

误区五,权限要不就全放要不就全收。 风险分级才是答案,而且是按功能分别定档,不是全局一把尺。

误区六,协议只是调工具的接口。 双向才是价值所在,能被调用意味着你的产品有机会成为别人的能力来源。


十二、约束说明

  • 本集只讨论多智能体、权限、连接的判断框架,不提供任何具体平台或框架的配置代码。
  • 所有耗时、词元量级、启动时间均为课程给出的演示数据,真实数值随服务数量、网络状况、任务结构变化,实施前须用自家数据复测。
  • 并行与并发会带来一致性风险,只读可并行的结论以「目标资源不同」为前提,同一资源的写操作必须串行。
  • 风险分级的高危清单必须由产品经理在设计阶段明确,不能完全交给模型动态判断。
  • 自配置必须保留用户授权环节,不得默认开启,涉及敏感数据的工具应有管理员审批。

十三、可带走的判断清单

  1. 先别急着加第二个智能体,三种明确需求之外多半是提示词没写好。
  2. 把工具分成读和写两类,只读可以并行,写操作必须排队。
  3. 定时任务每次新建会话,一个选择差十倍成本。
  4. 权限用风险分级,先想清楚出错之后谁负责,再决定弹不弹窗。
  5. 上线之前先把仪表盘做出来,四项指标看不见就是黑盒。

来源 xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)