CHAPTER 4 · EP 17

篇章汇总 · 你现在能做什么 · 他们会这样考你 · 上下文工程 · Prompt 工程

第 4 章 · 第 17 讲 · 16:06

时长 16:06音色 云健 · 男声章节 4

同步字幕

章节导航(点击跳转)

0:00开场 · 从它到底是什么,到你今天能动手做什么1:34
1:34一 · 大模型到底是什么,为什么会幻觉2:01
3:36二 · 四种幻觉,和四条压下去的路2:04
5:41三 · 决策框架,以及四个最常见的误会1:43
7:25四 · 上下文是有限而且有价格的资源2:01
9:26五 · 提示词工程,从角色到输出格式2:27
11:54六 · 把那件事定下来,今天就能动手2:20
14:14可带走的判断清单1:51
解读全文

ep17 · 大模型本质与幻觉 · 上下文工程 · Prompt 工程

  • 模块:M4 Harness 核心
  • 课节:12 节
  • 配套音频:pm17-m4-播客.mp3(时长见集页)
  • 配套字幕:pm17-m4-播客.srt
  • 来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)
本集改编自小山学堂《学 AI 产品,从入门到精通》,音频为二次演绎配音版。音频讲主线与判断,文字稿给结构、清单和可复用的模板。

一、本集解决什么问题

很多产品经理对大模型的理解,是若干条各自正确的结论拼起来的:它很聪明但有幻觉,上下文有窗口,提示词要写得讲究,输出格式有取舍。这些都对,但它们之间没有连接,所以一到做判断的时候就用不上,只能凭感觉。

这一集给出一条主线,把原理串成可执行的判断链:

它是什么(概率预测机器)→ 它为什么会错(幻觉的四种类型与两条根因)→ 怎么压下去(四条缓解路径)→ 怎么选(决策框架)→ 资源约束(上下文是有限且有价的资源)→ 怎么交代清楚(提示词工程)→ 今天能动手做什么(需求收敛四段)。

对产品经理而言,这条主线直接决定三件事:你能承诺什么、你要花多少钱、你能不能验收。


二、能力地图

层次关键概念它在回答什么你该追问的问题
本质层概率预测机器、参数冻结、词元它凭什么产出这段话这段话是「最可能的续写」还是「可承担责任的事实」
局限层事实性 / 来源 / 推理 / 代码幻觉它会在哪里出错这个场景最可能踩哪一种幻觉
缓解层提示词工程、检索增强、温度参数、人工审核怎么把错误率压下去出错位置在哪,对应哪一条路
资源层上下文窗口、溢出策略、计费一次调用装多少、花多少五块构成各占多少,超了怎么办
表达层系统提示词、角色、万能公式、输出格式怎么把任务交代清楚缺了六项里的哪一项
验收层需求收敛四段、人机分界线怎么算做对了不了解你工作的人能否复述出交付物

读法两条。第一,自上而下是收敛过程:先接受它是概率机器,才谈得上缓解;先算清资源,才谈得上格式。第二,越往下越可控:本质层和局限层你改变不了,缓解层、资源层、表达层、验收层全部是你可以设计的。把精力放在下四层。


三、六个概念逐个拆开

1. 大模型本质:超大型概率预测机器

训练 = 在海量文本上反复预测下一个 Token,参数记住的是统计规律,不是理解。推理时参数冻结,只做条件概率计算。

两个推论必须记住:

  • 它产出的是最可能的续写,最可能 ≠ 最准确。
  • 训练结束参数冻结,知识不会自动更新——这是幻觉无法根除的根本原因。

词元与窗口:Token ≠ 字。中文约每字 1 颗,常用词更省,生僻字多占几颗;英文约每词 1 颗。上下文窗口是模型一次能看到的所有文字,超出就彻底忘了,连模糊印象都没有。二零二五年主流容量大约分三档:约二十万字、约三十二万字、约八十万字,个别可再扩展。

演进路径:Base(续写文字)→ SFT 指令微调(学会对话格式)→ Chat API(模拟多轮对话)。每次调用 API,本质是构造一个精心设计的 Message List,让模型续写出你想要的内容——所谓「调模型」,很多时候调的只是开头那段 System Prompt。

2. 幻觉:四种类型与两条根因

类型表现
事实性幻觉捏造不存在的事实、数据、引用
来源幻觉引用不存在的论文 / 链接 / 作者
推理幻觉前提正确,但推理步骤出错
代码幻觉调用不存在的 API / 函数

根因两条:参数知识有误(训练数据本身有错 + 知识截止日期后一无所知)、上下文理解偏差(提示词不清晰只能猜意图;上下文矛盾时总选最可能的续写)。

3. 四条缓解路径

  1. Prompt Engineering:角色 + 约束 + 示例 + CoT。成本最低,优先使用。局限是无法注入模型不知道的新知识。
  2. RAG 检索增强:分块 → Embedding → 向量检索 → 注入 Prompt。不是「让模型学」,是运行时临时给小抄。代价是延迟 + 检索质量 + 维护成本。
  3. Temperature / Top-P:T=0 每次一样,T=1 正常采样,T>1 更随机。控制的是随机性,不是智能。
  4. HITL 人工审核:AI 生成 → 人工审核 → 用户可见。高风险 / 强合规场景必备兜底。代价是人力成本 + 响应延迟。

4. 决策框架

看你的活儿会在哪儿出错,这不是四选一的偏好题:

  • Prompt 够用:知识已在训练数据里,问题出在格式 / 风格 / 语气。
  • 需要 RAG:私有知识库、实时数据、知识截止日期后的内容。
  • 需要微调:固定专业领域风格、推理范式需要改变。
  • 需要 HITL:高风险输出、品牌声誉、医疗 / 法律合规要求。

5. 上下文:有限且有价的资源

一次请求的上下文由五块构成:系统提示词、对话历史、上传文档、当前问题、预留回复。这五块共享同一个额度。

额度不只是技术限制,它是钱。按输入 + 输出 Token 计费,放入一份一百页的文档(≈50K Token),每次对话额外多花约 ¥0.5。多轮对话后历史也会累积占满窗口。

溢出后的三种策略:

策略做法适用代价
直接截断丢掉最早的内容前后轮次彼此独立(如问答式客服)关键信息可能就此消失
摘要压缩历史压成摘要放回窗口长任务压缩可能漏掉关键数字
选择性保留只留与当前任务相关部分有明确主题的长对话需额外写相关性判断,且该逻辑本身会出错

6. Prompt 工程与输出格式

为什么是 Markdown:模型是纯文本模型,逐 Token 输出,不懂颜色 / 字号 / 对齐;但用户期望排版。推演下来——HTML 标签太重浪费 Token;Word / PDF 是二进制无法逐字输出;LaTeX 语法复杂容易出错;Markdown 文本自带排版标记(# 标题、** 加粗),只占几颗 Token,前端渲染成熟。这不是碰巧,是「纯文本模型 + 排版需求」的最优解。

角色 = 系统预设:所有 AI 产品本质上都是在 System Prompt 里写了不同的角色定义。换角色,就换产品。

万能公式:角色 + 任务 + 上下文 + 约束 + 示例 + 格式。缺任何一项,质量打折扣。把 Prompt 当代码写。

四个进阶技巧:少样本示例(给 2–3 个完整例子胜过百字描述)、让它一步步想(先写推理再给结论)、写清约束(边界、字数、禁止项)、任务拆解(分步执行比一次做完更稳)。

输出格式与流式:

格式流式表现适用场景
JSON必须等全文到达才能解析,用户看到 loading后端程序处理、需要结构化字段
Markdown逐字显示,有打字感,但无法可靠提取字段面向用户的阅读体验
XML 自定义标签捕获到闭合标签即可渲染,流式 + 结构化两全既要打字感又要提字段

四、今天能动手做什么:需求收敛四段

大多数人给 AI 布置任务停在第一段就交卷了,比如「帮我处理一下周报」。这句话没错,只是没法验收。往下推三段才是真需求:

  1. 一句愿望 —— 想法有了,但也只是想法。
  2. 定输入输出 —— 进:一周的零碎记录;出:三段结论加一份下周计划。
  3. 定什么算对 —— 三段都能直接发给老板,一个字不用改。
  4. 挑压幻觉的方案 —— 要引具体数字,那就走 RAG,别让它凭记忆编。

最常见的卡点是第二段:输入输出自己都没想清楚,后面两段根本没机会跑。「试了一下感觉不行」,原因通常就在这儿。

三档动手清单:

档位动作耗时验收标准
第一档把那件事写成四行(愿望 / 输入 / 输出 / 什么算对)15 分钟念给不了解你工作的人听,他能复述出「AI 要交出什么」
第二档用 5 个真实输入试一遍,提示词保持一模一样1 小时能说出「输入里一旦出现某某,它就开始编」,笼统的「有时候不太准」不算
第三档划一条人机分界线,写清交接点长什么样半天能回答:如果 AI 那一半出错,你在哪一步、用什么方式会发现

实战主线分六个里程碑:想清楚它替你干什么 → 能稳定说人话 → 能动手干活 → 改好改坏能量化 → 长跑不失忆 → 过程可复现。


五、审查清单

拿到任何一个基于大模型的方案,按顺序过这八条:

  1. 默认前提:方案是否把幻觉当成默认前提?有没有「幻觉到达用户之前被发现」的机制?
  2. 出错定位:这个场景最可能踩哪一种幻觉(事实 / 来源 / 推理 / 代码)?
  3. 方案匹配:缓解路径是按出错位置选的,还是按团队熟悉程度选的?
  4. 顺序正确:提示词这一层是否真的试过了?有没有跳过它直接上微调?
  5. 资源预算:五块上下文各占多少?有没有溢出策略?策略对用户可见吗?
  6. 提示词完整性:角色、任务、上下文、约束、示例、格式,六项缺哪几项?
  7. 格式取舍:输出格式是按场景选的吗?流式体验有没有实测过?
  8. 可验收性:需求是否收敛到第四段?不了解项目的人能否复述出交付物?

六、约束说明

以下约束来自本集原始素材,属于使用这些能力时的边界条件:

  1. 幻觉不可完全消除。它是概率预测的必然产物,预训练后参数冻结、无法自动更新知识。正确做法是用工程手段缓解,不要指望模型更聪明后幻觉自己消失。
  2. 上下文窗口是硬边界。超出即截断,永久消失,没有模糊印象。窗口越大费用越高。
  3. 上下文容量数据有时效。文中容量对比为二零二五年数据,且不同模型差异很大,选型前需按当前实际情况复核。
  4. 检索增强解决的是「不知道」,不是「推理不对」。格式飘、语气不对属于提示词那一层,挂再多资料也没用。
  5. 温度参数并非所有产品都有。它是对话接口上的参数,ChatGPT、豆包这类对话产品里没有这个开关。四种缓解路径彼此独立,缺一个另外三个照样成立。
  6. 溢出策略本身会出错。压缩可能丢数字,相关性判断可能判错,必须有兜底与人工可见的补救路径。
  7. 「模型在调用接口」是误解。模型只是输出格式化文字,真正去调用的是你写的那层代码。
  8. 本集不含题库内容。本集的题库页(30 道灵魂拷问)仅作为集页下方的文字自测卡渲染,不进入音频与正文。

七、实践提示

提示一 · 给每个场景先做一次「幻觉分型」

动手之前先花十分钟做一个动作:把你的场景按四种幻觉类型过一遍,标出最可能踩的是哪一种。事实性幻觉高发的场景(引用数字、条款、外部事实)优先上检索增强;推理幻觉高发的场景(多步计算、条件判断)优先让它一步步想并输出中间步骤;代码幻觉高发的场景必须给一份真实可用的接口清单做约束。分型之后再选方案,比凭直觉选省得多,也更容易向业务方解释为什么这笔钱必须花。

提示二 · 把上下文的五块构成做成一张预算表

长对话产品上线前,把系统提示词、对话历史、上传文档、当前问题、预留回复这五块的典型词元数估算出来,做成一张表。这张表有两个用处:一是直接换算成单次调用成本,二是提前暴露溢出风险——你会发现很多时候不是窗口不够大,而是系统提示词写得太长、或者历史里塞了一堆没用的客套话。很多成本问题在这一步就能解决,不需要改模型。

提示三 · 用「同一句话跑三遍」代替拧参数

如果产品里没有温度这个开关,或者你不方便调它,有一个更有效的等价办法:同一句提示词连跑三遍,看三次输出是否稳定。不稳定本身就是信号,说明这个任务对模型而言歧义太大,需要从约束和示例上改,而不是从随机性上改。这个方法还有一个附加价值——它能暴露那些「看起来对但每次说法都不一样」的输出,这类输出在合规场景里风险最高。

提示四 · 需求四行写不下来,就不要开工

把「一句愿望、输入是什么、输出长什么样、什么算对」这四行写在便签或备忘录里,必须是写下来的字,不能只是脑子里的想法。验收方法很硬:把这四行念给一个不了解你工作的人听,他能复述出模型要交出什么才算过。做不到,说明中间两段还太虚,此时开工只会得到一堆无法判断对错的输出,以及一轮又一轮无效的提示词调整。


八、可带走的判断清单

  1. 把幻觉当成默认前提,而不是意外。要设计的不是消灭幻觉,而是让幻觉在到达用户之前被发现。
  2. 按出错位置选缓解方案,不按熟悉程度选。顺序永远是先提示词,成本差着一百倍。
  3. 把上下文当成预算来管。五块构成共享一个额度,每一颗词元都要付钱,长对话必须提前设计溢出策略。
  4. 把提示词当代码写。角色加任务加上下文加约束加示例加格式,缺一项掉一档;输出格式按场景选,要程序处理用键值格式,要打字感用标记语言,两个都要用标签格式。
  5. 需求不收敛到第四段就不要开工。验收看两句话:不了解你工作的人能不能复述出要交出什么,以及它出错时你在哪一步会发现。

这五条的共同点,是把对模型的期待,换成对流程的要求。模型负责生成,你负责让它可验收。


九、音频与文字稿说明

  • 音频为单人口播,面向非工程背景听众,全程不直接口播英文缩写,数字以中文读法呈现。
  • 文字稿按「能力地图—概念拆解—动手清单—审查清单—约束说明—实践提示」组织,可直接作为团队内部培训材料使用。
  • 音频的八段结构与本文第三、四节对应,建议先听音频建立主线,再回到本文查清单。

来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)