CHAPTER 1 · EP 11

小白三千问 · 会用篇 · 小白三千问 · 概念扫盲

第 1 章 · 第 11 讲 · 16:55

时长 16:55音色 云健 · 男声章节 1

同步字幕

章节导航(点击跳转)

0:00开场 · 八个词,决定你听不听得懂一场会1:33
1:33第一组 · 谁在造模型,谁在卖水2:23
3:56第二组 · 词元与工作台,钱和容量这两本账2:07
6:04第三组 · 深度思考与参数,慢和贵换来了什么2:53
8:57第四组 · 会看图和装眼睛,是两套独立的本事2:01
10:58第五组 · 上课与开卷,微调与喂资料2:13
13:11第六组 · 知识库怎么转,软肋又在哪里1:45
14:56可带走的判断清单1:58
解读全文

ep11 · 小白三千问 · 会用篇 · 概念扫盲

  • 模块:M1 认知地基
  • 课节:8 节
  • 配套音频:pm11-m1-播客.mp3(时长见集页)
  • 配套字幕:pm11-m1-播客.srt
  • 来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)
本集改编自小山学堂《学 AI 产品,从入门到精通》,音频为二次演绎配音版。文字稿与音频互为补充,音频讲判断,文字稿给结构和清单。

一、本集解决什么问题

几乎每一场关于人工智能的会议里,都会冒出这么几个词:百万词元、上下文窗口、深度思考、参数、多模态、微调、知识库。会上大家都在点头,很多人其实没听懂,但不敢在那个气氛里举手问。散会之后自己去搜,搜到的多半是一堆互相引用、互相转述的文章,读完只知道这些词很重要,仍然不知道它们彼此什么关系。

这一集把八个词按一条线排好:它们不是八个孤立术语,而是四本账。词元和上下文窗口是钱和容量的账;深度思考和参数是性能与成本的账;多模态是能力边界的账;微调和知识库是交付方式和维护成本的账。把这四本账分开看,你听到任何一个新名词,都能立刻判断它落在哪一层、由谁承担后果。

对产品经理而言,这八个词直接对应四件躲不开的事:预算、方案边界、选型、以及和供应商对话时的议价能力。


二、能力地图

下面这张图把八个词放进四个层。看新闻、听方案、写需求的时候,先定位它落在哪一层,再决定你要问什么问题。

层次包含的关键词它在回答什么你该追问的问题
生态层模型公司、卖水人谁在提供能力换模型的成本高不高,成本底线会不会抬
计费与容量层词元、上下文窗口一次调用花多少、能装多少输入输出分别怎么算,长对话怎么兜底
性能与选型层深度思考、参数慢和贵换来了什么这个任务需要多大吨位,值不值
能力与交付层多模态、微调、知识库能做什么、怎么交付、怎么维护改了模型本身,还是只挂了个书架

读法有两条。第一条,上层决定下限,下层决定上限:生态和基础设施层决定你的成本底线,性能与能力层决定你能承诺什么。第二条,从左往右是收敛过程:先知道谁在造模型,再算钱,再选吨位,最后才谈交付方式。跳过前面几层直接谈微调,是最常见的烧钱路径。


三、八个词逐个拆开

1. 谁在造模型,谁在卖水

国际上最常出场的模型公司有六家:美国的开放人工智能公司(代表作是全球用户量最大的那款聊天应用,视频模型索拉也出自它家)、做克劳德的那家公司(前团队出走创立,以安全和长文本见长,在编程和智能体场景口碑尤其好)、谷歌(老牌豪门,转换器架构就出自它的论文,双子星全家桶覆盖文字、图片、视频)、脸书的母公司(开源路线旗手,把强模型免费开放)、马斯克旗下那家公司(风格生猛、更新极快)、法国的米斯特拉尔(小团队做出大能量的典型)。

另一类是卖水人:英伟达(几乎所有模型都用它的芯片训练)、微软(最大的金主之一,办公全家桶都接了人工智能)、亚马逊(云服务加投资模型公司)。他们不一定做出最强的模型,但整个行业都建在他们的地基上。

这一层对 PM 的含义:模型公司打架,你换模型的成本在变低,因为能力越来越接近、接口越来越像;卖水人涨价,你的成本底线在抬高,而且这一层你基本没有议价权。所以看新闻要分开看——模型层的消息影响你能做什么,基础设施层的消息影响你要花多少。名单会变,但「模型公司加卖水人」这个结构会长期存在,记住结构比记住名单耐用。

2. 词元(Token)

词元是模型读写文字的最小单位,大约是一小块词。为什么按它收费,逻辑和出租车按里程计价一样:车每跑一公里都实打实烧油,模型每读一颗、每吐一颗词元,机房里的显卡都在做一轮运算、耗一份电。

三个容易踩的坑:

  • 两头都算钱。你发出去的(输入)要钱,它回过来的(输出)也要钱,后者通常更贵,因为写比读费劲。贴一大段没用的资料,或者放任它写一堆车轱辘话,两头都在烧钱。
  • 字数不等于词元数。数字、符号、生僻词会被切得特别碎。别拿字数直接估账单,量级会差不少。
  • 中文往往比英文更费。模型对英文见得多、切得熟,对汉字只能切得更碎,所以表达同样的意思,中文消耗的词元数常常更多。

这一层对 PM 的含义:提示词写得精炼,就是直接在省钱。每一句废话都会被一颗一颗放大成账单。

3. 上下文窗口(为什么聊久了它会忘事)

模型没有无限的记性。它每次回答只能看见「工作台」上放得下的最近内容;台面满了,最早的话就被挤掉,被挤掉的部分再也参与不了这次回答。

该怎么办:关键设定(过敏、预算、格式要求)聊了十几轮之后重讲一遍,等于把纸条重新放回台面最上层;台面满了直接开新对话,新对话就是一张空台面;长任务别裸开,先让它总结当前进展,把摘要贴进新对话再接着干;发现它忘了别跟它吵,直接把关键信息重发一遍,比连问三句「你忘了吗」有用得多。

4. 深度思考与推理模型

推理模型会先在草稿纸上一步步演算,再交答案。慢一点、贵一点,但复杂问题错得更少。所谓「思考」并不神秘,就是多生成了几页草稿文字——草稿也是一个字一个字生成的,所以更慢也更花钱。

判断标准一句话:答案需要一步步推出来的值得开,查一下或一眼能看出的不值得。默认用普通模式,遇到它答错了、或者你自己都觉得这题有点绕的时候,再打开重问一次,性价比最高。简单问题也开深度思考,属于高射炮打蚊子。

5. 参数

参数像大脑里旋钮的数量,粗略代表这台机器能装下多少见识。旋钮多的通常见识更广,但聪明程度还取决于训练数据的质量和训练方法;日常任务里,小模型常常反而更划算。

小模型赢在三个地方:速度(参数少算得快,实时字幕、输入法联想这类要秒回的场景,大模型再有学问也等不起)、成本(同样一件事开销低一大截,量大的活儿一年下来省出的钱很可观)、专精(比如客服系统里判断用户是想退货还是查物流,一个调教好的小模型又快又准)。

选模型像选车:跑长途拉重货上卡车,市区买个菜一辆小电驴就够了。新闻里的参数竞赛听听就好,你真正要关心的只有一件事——这个任务它干得好不好、划不划算。

6. 多模态

「会说话」和「会看」是两套独立的本事。语言模型天生只认文字;想让它看图,得额外给它装一双「眼睛」(视觉编码器)。装了的叫多模态模型,没装的只能对图片说抱歉。

原理两步:把图切碎(视觉编码器把图片切成许多小方块,每块转译成模型认识的词,一张图就变成一段特殊的文字),然后当话来接(转译完成后图片和一段话没区别,照常接话茬)。

两个常见混淆要分清:不装眼睛不是落后,装眼睛要用海量图文配对数据重新训练,成本高、模型更大更贵,很多场景根本用不到;看懂图和画出图是两回事,能看图的模型不一定能生成图片,全能应用背后是好几个模型在分工。

7. 微调

微调是送模型重新上课,把知识练进它身体里;喂资料(知识库、检索增强)是让它开卷考试,随用随查。

维度微调(上课)知识库(开卷)
生效速度几天到几周当天就能用
成本量级几万到几十万起步,还要专人伺候低一到两个量级,普通团队就能搭
知识更新资料变了要重新训练一遍换个文件就行,随换随用
各自适合改风格、改口吻、学专业语感会变的知识:制度、价格、文档问答

关键差别在于:微调改变的是模型本身,像把知识练成肌肉记忆;喂资料完全没动模型,只是考试时允许它翻书。所以资料一更新,开卷这边换本书就行,上课那边就得重新读一遍。

省钱顺序永远是:先试提示词,再挂知识库,最后才考虑微调。很多「必须微调」的需求,认真写一段提示词就解决了。实用信号:需求里带「查」这个字(查制度、查价格、查文档)的,基本就是知识库的活。

8. 知识库

知识库就是给模型配了一个随用随查的书架,运转三步:收集文件(制度手册、产品文档、会议纪要)、切成小块并建索引(长文件切成一段一段的卡片,一块讲一件事,登记好讲的是什么)、有人提问时先查书架(按意思相近找出相关几段,和问题拼在一起交给模型,模型照着资料作答并顺手标出处)。

为什么不直接把全部文件喂给它:台面装不下(一次能看在眼里的有限,几百份文件根本摊不开),按词元收费(每次提问都附上全部文件,等于每次把整个图书馆搬一遍)。所以知识库的思路是书都留在架上,每次只把最相关的几页带上考场。


四、常见误区

把高频误区单独列出来,是因为它们各自都会导向一次错误的采购或一次失败的上线:

  1. 把参数量当成能力排行榜。参数只是容量指标,等于旋钮的数量。旋钮多,拧得不好也白搭。真正该对齐的是任务表现和单位成本,不是发布会上的数字。
  2. 以为「忘了」是模型的态度问题。它不是敷衍,是台面满了。跟它争论「你刚才明明说过」没有意义,把信息重新放回台面才有意义。
  3. 以为深度思考开得越多越好。默认全开是最典型的浪费。判断标准只有一个:这道题的答案是要一步步推出来的,还是查一下就知道的。
  4. 以为买了一个「全能」模型。看图、画图、长文本、实时响应是相互独立的能力,背后常常是不同的模型在分工。必须为每一项单独确认支持情况与计价方式。
  5. 以为「训了个模型」就等于有技术壁垒。大多数时候对方做的只是写好提示词加挂了知识库。分不清这两者,就没法判断报价是否合理。
  6. 以为知识库建完就结束了。资料会过时、会互相矛盾,书架的干净程度直接决定答案质量。知识库是长期运营对象,不是一次性交付物。

五、审查清单

拿到任何一个人工智能方案,按顺序过这七条:

  1. 定位层级:这个名词落在生态、计费、性能、还是交付层?影响的是成本底线,还是能力上限?
  2. 拆账单:输入和输出分别怎么计价?输出单价是不是更高?中文场景有没有额外开销?
  3. 估容量:长对话怎么兜底?台面满了是重开还是摘要迁移?关键设定有没有重申机制?
  4. 定吨位:这个任务真需要最大档吗?换成小模型,速度、成本、准确率分别变化多少?
  5. 开关策略:深度思考默认关还是开?有没有按问题复杂度分级?
  6. 能力逐项确认:看图、画图、长文本、实时性,是不是逐项确认过,而不是默认「全能」?
  7. 交付方式:方案到底是改了模型本身,还是只挂了个书架?资料更新后谁来维护、多久生效?

六、约束说明

以下约束来自本集原始素材,属于使用这些能力时的边界条件,写方案和承诺时必须明确:

  1. 公司格局有时效:格局信息截至二零二六年八月。这个行业变化极快,名单会变,但结构长期存在。
  2. 知识库保证的是「有据可查」,不是「据是否靠谱」。书架上的文件过时了,它照着旧文件答;两份文件互相矛盾,它可能各抄一半。它分辨真伪的能力有限。
  3. 整理文件的功夫省不掉。建知识库一半功夫要花在整理上:删掉过时的、合并矛盾的。书架干净,答案才干净。
  4. 上下文窗口是硬边界。不同模型台面有大有小,但都有边界,放满就是放满了,加钱也变不出更多格子。
  5. 微调的维护成本是长期的。资料一变就要重新训练,签约前必须把维护责任和周期写清楚。
  6. 本集为零基础版本。切块策略、索引构建、召回率优化、上下文窗口的工程深入版,属于课程正篇范围,本集不展开。
  7. 本集不含题库内容。本集的题库页仅作为集页下方的文字自测卡渲染,不进入音频与正文。

七、实践提示

提示一 · 把「词元」翻译成人民币再开口

和供应商聊价格之前,先做一个最小测算:挑一个真实的高频任务,跑一百次,把输入词元数和输出词元数分别记下来,按报价算出单次成本,再乘以你预估的日调用量。绝大多数争论会在这一步结束——你会发现真正的成本大头往往不是模型单价,而是你塞进去的那些没用的上下文。带着这个数字去谈,比带着「感觉挺贵」去谈有用得多。

提示二 · 给长对话写一个「摘要迁移」的固定动作

不要指望用户自己记得开新对话。在产品里把这件事做成显式入口:当对话轮数或累计词元数超过阈值时,主动提示「要不要总结当前进展,开一张新台面」,并且提供一键把摘要带进新对话。这一步能显著减少「它怎么突然忘了」这类投诉,而且成本极低——本质上只是把用户本来要手动做的事产品化。

提示三 · 用「查」和「改」两个字给需求分诊

收到「把公司资料喂给人工智能」这类需求时,先做一次翻译。需求描述里带「查」的(查制度、查价格、查文档、查订单状态),走知识库路线,当天能见效。需求描述里带「改」的(改口吻、改风格、改成我们行业的说法),才可能真的需要微调。分完诊再按顺序走:先写提示词,再挂知识库,两样都不够再谈微调。这个顺序能挡掉绝大部分不必要的预算。

提示四 · 验收知识库,看出处而不是看流畅度

验收的时候最容易犯的错,是被一段通顺的回答说服。正确的验收动作是三个:随机抽二十个问题,看每个答案有没有标出处;点开出处核对,看召回的段落对不对;再故意放一份过时文件和一份矛盾文件进书架,看系统会怎么表现。第三个动作最能暴露问题——它会告诉你这套系统到底是「有据可查」,还是只是在流畅地猜。


八、可带走的判断清单

  1. 听到新名词,先问它落在哪一层:模型层影响你能做什么,基础设施层影响你要花多少。
  2. 把账单拆成两半看:发出去的和回过来的都按词元计费,后者通常更贵;中文往往更费;字数不等于词元数。
  3. 默认用普通模式,把深度思考留给需要一步步推的问题;参数不是越大越好,看任务定吨位。
  4. 带「查」字的需求做知识库,要改口吻风格才考虑微调;顺序是先提示词、再知识库、最后微调。
  5. 验收知识库要看三件事:出处标得对不对、相关段落有没有被找回来、文件本身是不是干净的。

这五条的共同点,是把技术名词翻译成成本和边界。听懂这八个词,你不需要会写代码,你需要的只是知道每个词背后,是你能承诺什么,以及你要花多少。


九、音频与文字稿说明

  • 音频为单人口播,面向非工程背景听众,全程不使用英文缩写直接口播,数字以中文读法呈现。
  • 文字稿按「能力地图—逐个拆解—审查清单—约束说明—实践提示」组织,可直接作为团队内部培训材料使用。
  • 音频中的八段结构与本文第三、四节对应,建议先听音频建立判断,再回到本文查清单。

来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)