第 4 章 · 第 17 讲 · 16:06
pm17-m4-播客.mp3(时长见集页)pm17-m4-播客.srt本集改编自小山学堂《学 AI 产品,从入门到精通》,音频为二次演绎配音版。音频讲主线与判断,文字稿给结构、清单和可复用的模板。
很多产品经理对大模型的理解,是若干条各自正确的结论拼起来的:它很聪明但有幻觉,上下文有窗口,提示词要写得讲究,输出格式有取舍。这些都对,但它们之间没有连接,所以一到做判断的时候就用不上,只能凭感觉。
这一集给出一条主线,把原理串成可执行的判断链:
它是什么(概率预测机器)→ 它为什么会错(幻觉的四种类型与两条根因)→ 怎么压下去(四条缓解路径)→ 怎么选(决策框架)→ 资源约束(上下文是有限且有价的资源)→ 怎么交代清楚(提示词工程)→ 今天能动手做什么(需求收敛四段)。
对产品经理而言,这条主线直接决定三件事:你能承诺什么、你要花多少钱、你能不能验收。
| 层次 | 关键概念 | 它在回答什么 | 你该追问的问题 |
|---|---|---|---|
| 本质层 | 概率预测机器、参数冻结、词元 | 它凭什么产出这段话 | 这段话是「最可能的续写」还是「可承担责任的事实」 |
| 局限层 | 事实性 / 来源 / 推理 / 代码幻觉 | 它会在哪里出错 | 这个场景最可能踩哪一种幻觉 |
| 缓解层 | 提示词工程、检索增强、温度参数、人工审核 | 怎么把错误率压下去 | 出错位置在哪,对应哪一条路 |
| 资源层 | 上下文窗口、溢出策略、计费 | 一次调用装多少、花多少 | 五块构成各占多少,超了怎么办 |
| 表达层 | 系统提示词、角色、万能公式、输出格式 | 怎么把任务交代清楚 | 缺了六项里的哪一项 |
| 验收层 | 需求收敛四段、人机分界线 | 怎么算做对了 | 不了解你工作的人能否复述出交付物 |
读法两条。第一,自上而下是收敛过程:先接受它是概率机器,才谈得上缓解;先算清资源,才谈得上格式。第二,越往下越可控:本质层和局限层你改变不了,缓解层、资源层、表达层、验收层全部是你可以设计的。把精力放在下四层。
训练 = 在海量文本上反复预测下一个 Token,参数记住的是统计规律,不是理解。推理时参数冻结,只做条件概率计算。
两个推论必须记住:
词元与窗口:Token ≠ 字。中文约每字 1 颗,常用词更省,生僻字多占几颗;英文约每词 1 颗。上下文窗口是模型一次能看到的所有文字,超出就彻底忘了,连模糊印象都没有。二零二五年主流容量大约分三档:约二十万字、约三十二万字、约八十万字,个别可再扩展。
演进路径:Base(续写文字)→ SFT 指令微调(学会对话格式)→ Chat API(模拟多轮对话)。每次调用 API,本质是构造一个精心设计的 Message List,让模型续写出你想要的内容——所谓「调模型」,很多时候调的只是开头那段 System Prompt。
| 类型 | 表现 |
|---|---|
| 事实性幻觉 | 捏造不存在的事实、数据、引用 |
| 来源幻觉 | 引用不存在的论文 / 链接 / 作者 |
| 推理幻觉 | 前提正确,但推理步骤出错 |
| 代码幻觉 | 调用不存在的 API / 函数 |
根因两条:参数知识有误(训练数据本身有错 + 知识截止日期后一无所知)、上下文理解偏差(提示词不清晰只能猜意图;上下文矛盾时总选最可能的续写)。
看你的活儿会在哪儿出错,这不是四选一的偏好题:
一次请求的上下文由五块构成:系统提示词、对话历史、上传文档、当前问题、预留回复。这五块共享同一个额度。
额度不只是技术限制,它是钱。按输入 + 输出 Token 计费,放入一份一百页的文档(≈50K Token),每次对话额外多花约 ¥0.5。多轮对话后历史也会累积占满窗口。
溢出后的三种策略:
| 策略 | 做法 | 适用 | 代价 |
|---|---|---|---|
| 直接截断 | 丢掉最早的内容 | 前后轮次彼此独立(如问答式客服) | 关键信息可能就此消失 |
| 摘要压缩 | 历史压成摘要放回窗口 | 长任务 | 压缩可能漏掉关键数字 |
| 选择性保留 | 只留与当前任务相关部分 | 有明确主题的长对话 | 需额外写相关性判断,且该逻辑本身会出错 |
为什么是 Markdown:模型是纯文本模型,逐 Token 输出,不懂颜色 / 字号 / 对齐;但用户期望排版。推演下来——HTML 标签太重浪费 Token;Word / PDF 是二进制无法逐字输出;LaTeX 语法复杂容易出错;Markdown 文本自带排版标记(# 标题、** 加粗),只占几颗 Token,前端渲染成熟。这不是碰巧,是「纯文本模型 + 排版需求」的最优解。
角色 = 系统预设:所有 AI 产品本质上都是在 System Prompt 里写了不同的角色定义。换角色,就换产品。
万能公式:角色 + 任务 + 上下文 + 约束 + 示例 + 格式。缺任何一项,质量打折扣。把 Prompt 当代码写。
四个进阶技巧:少样本示例(给 2–3 个完整例子胜过百字描述)、让它一步步想(先写推理再给结论)、写清约束(边界、字数、禁止项)、任务拆解(分步执行比一次做完更稳)。
输出格式与流式:
| 格式 | 流式表现 | 适用场景 |
|---|---|---|
| JSON | 必须等全文到达才能解析,用户看到 loading | 后端程序处理、需要结构化字段 |
| Markdown | 逐字显示,有打字感,但无法可靠提取字段 | 面向用户的阅读体验 |
| XML 自定义标签 | 捕获到闭合标签即可渲染,流式 + 结构化两全 | 既要打字感又要提字段 |
大多数人给 AI 布置任务停在第一段就交卷了,比如「帮我处理一下周报」。这句话没错,只是没法验收。往下推三段才是真需求:
最常见的卡点是第二段:输入输出自己都没想清楚,后面两段根本没机会跑。「试了一下感觉不行」,原因通常就在这儿。
三档动手清单:
| 档位 | 动作 | 耗时 | 验收标准 |
|---|---|---|---|
| 第一档 | 把那件事写成四行(愿望 / 输入 / 输出 / 什么算对) | 15 分钟 | 念给不了解你工作的人听,他能复述出「AI 要交出什么」 |
| 第二档 | 用 5 个真实输入试一遍,提示词保持一模一样 | 1 小时 | 能说出「输入里一旦出现某某,它就开始编」,笼统的「有时候不太准」不算 |
| 第三档 | 划一条人机分界线,写清交接点长什么样 | 半天 | 能回答:如果 AI 那一半出错,你在哪一步、用什么方式会发现 |
实战主线分六个里程碑:想清楚它替你干什么 → 能稳定说人话 → 能动手干活 → 改好改坏能量化 → 长跑不失忆 → 过程可复现。
拿到任何一个基于大模型的方案,按顺序过这八条:
以下约束来自本集原始素材,属于使用这些能力时的边界条件:
动手之前先花十分钟做一个动作:把你的场景按四种幻觉类型过一遍,标出最可能踩的是哪一种。事实性幻觉高发的场景(引用数字、条款、外部事实)优先上检索增强;推理幻觉高发的场景(多步计算、条件判断)优先让它一步步想并输出中间步骤;代码幻觉高发的场景必须给一份真实可用的接口清单做约束。分型之后再选方案,比凭直觉选省得多,也更容易向业务方解释为什么这笔钱必须花。
长对话产品上线前,把系统提示词、对话历史、上传文档、当前问题、预留回复这五块的典型词元数估算出来,做成一张表。这张表有两个用处:一是直接换算成单次调用成本,二是提前暴露溢出风险——你会发现很多时候不是窗口不够大,而是系统提示词写得太长、或者历史里塞了一堆没用的客套话。很多成本问题在这一步就能解决,不需要改模型。
如果产品里没有温度这个开关,或者你不方便调它,有一个更有效的等价办法:同一句提示词连跑三遍,看三次输出是否稳定。不稳定本身就是信号,说明这个任务对模型而言歧义太大,需要从约束和示例上改,而不是从随机性上改。这个方法还有一个附加价值——它能暴露那些「看起来对但每次说法都不一样」的输出,这类输出在合规场景里风险最高。
把「一句愿望、输入是什么、输出长什么样、什么算对」这四行写在便签或备忘录里,必须是写下来的字,不能只是脑子里的想法。验收方法很硬:把这四行念给一个不了解你工作的人听,他能复述出模型要交出什么才算过。做不到,说明中间两段还太虚,此时开工只会得到一堆无法判断对错的输出,以及一轮又一轮无效的提示词调整。
这五条的共同点,是把对模型的期待,换成对流程的要求。模型负责生成,你负责让它可验收。
来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)