CHAPTER 6 · EP 45

他们会这样考你 · 定价即架构 · 三大跳档陷阱

第 6 章 · 第 45 讲 · 16:14

时长 16:14音色 云健 · 男声章节 6

同步字幕

章节导航(点击跳转)

0:00开场 · 这一集解决什么问题1:54
1:54第一段 · 和用户对赌的生意2:19
4:14第二段 · 词元是怎么数出来的2:42
6:56第三段 · 报价表上的三个梯队2:28
9:24第四段 · 二百个词元的断崖2:47
12:12第五段 · 三万二这条红线2:14
14:27末段 · 可带走的判断清单1:46
解读全文

pm45-m6 解读与音频稿件 · 定价即架构 · 三大跳档陷阱

  • 模块:M6 产品手感
  • 课节:和用户对赌的生意 / Token 怎么数 / 报价表速览与三大梯队 / GLM 短输出博弈 / Qwen 阶梯逃逸
  • 配套音频:pm45-m6-播客.mp3
  • 配套字幕:pm45-m6-播客.srt

一、本集解决什么问题

AI 产品有一个让产品经理特别委屈的结构性矛盾:产品做得越好,用户用得越爽,利润反而越薄。

原因是收费模式与成本模式的错配——订阅制下收入是一条平线(会员费固定),而推理成本是一条上坡线(用量越大,成本越高)。两条线迟早交叉,交叉点之后,你最忠诚的那批用户,就成了成本表上最贵的一行。

本集从作者团队的内部分享《AI Token 降本增效策略分享》中,挑出与产品经理决策最相关的五节,回答三个问题:

  1. 成本到底是什么——为什么词元成本同时是账单、是延迟、也是质量
  2. 成本是怎么数出来的——子词分词、字节对编码,以及中文天然要交的词元税
  3. 成本在哪里漏掉的——报价表上的三个梯队,与两道最容易被踩的价格断崖
定价即架构。价格牌不是财务部门随手定的,它精确反映了推理算力的边际成本曲线。读懂定价结构,等价于读懂算力成本曲线,然后把应用架构设计到便宜的那一侧。

二、能力地图

层级能力具体表现验证方式
L1 成本归因三重身份把一笔开销同时读成账单、延迟、质量能说出同一笔浪费的三个后果
L2 分词认知词元是怎么数的讲清字符级 / 词级 / 子词级的取舍能解释中文为什么贵两倍以上
L3 报价识读三个梯队T0 旗舰 / T1 主力 / T2 走量分工明确给五个场景选出正确梯队
L4 边界识别跳档断崖认出输出分档与输入分档两类阈值能列出本任务的两条红线
L5 架构应对预算写进代码动态 Top-K、历史压缩、分段归并上线后有可观测的成本看板
L6 取舍判断四种策略任务拆分 / 字段分级 / 接受波动 / 模型降级能说出每种策略的代价

能力依赖关系:L1 认知错了,后面全偏——如果把成本只当财务问题,就不会去优化延迟和质量;L4 是 L5 的前提,不知道断崖在哪,代码里就没有预算可写;L6 必须建立在 L4 之上,因为策略选择完全取决于任务的输出或输入分布落在哪个区间。

提示1 · 先画分布直方图,再谈优化

这是本集最省钱的一条动作。上线前,把本任务的输出词元分布和输入词元分布各画一张直方图,看中位数离最近的价格断崖有多远。中位数压在断崖上的任务,必须在设计阶段解决,不能等账单出来再复盘。


三、成本的三重身份

身份机制产品经理能感知到的后果
账单每百万词元几元,乘调用量即月支出千万级调用下,10% 的浪费就是一个人的工资
延迟输入越长,Prefill 越久首字延迟升高,用户还没看到第一个字就已流失
质量上下文塞得越满,有效信息越容易被稀释高信噪比 = 高智能,省词元常常顺带提升效果

推理的两个阶段决定了输入价与输出价的差距:

  • Prefill(预填充):吃进输入,算力密集,但可以并行
  • Decode(解码):逐字吐出,无法并行,受显存带宽限制

所以输出通常比输入贵数倍——它占用的是更难并行的那一段资源。

提示2 · 省词元不是抠门,是同时优化三件事

把「降本」翻译成团队语言时,不要只讲钱。同一笔优化同时压低了账单、缩短了首字延迟、提升了回答质量。这句话是推动工程改造最有效的说服口径。


四、词元是怎么数出来的

早期 NLP 走过两个极端,现代大模型选了中间路线:

方案优点致命问题
词级别分词语义明确词表爆炸(词形变化),无法处理未登录词
字符级别分词什么都能拆序列过长、单字符信息量低、推理效率极差
子词分词常见词完整保留,罕见词拆成片段词表 32k–200k,平衡两端

BPE(字节对编码)的四步迭代:先按字节拆到最小单位 → 统计相邻字节对频次 → 合并最频繁的一对 → 迭代至词表达到预设大小。Llama 2 词表 32,000,GPT-4 的 cl100k_base 为 100,277。

词表越大、你的文本越「常见」,词元就越少,账单就越薄。所以选模型时,分词器效率也是一项成本参数。

隐形的「词元税」

主流分词器训练语料以英文为主,合并规则高度偏向英语:

语言示例词元数比率
英语Donald John Trump3~0.75 词元/词
中文唐纳德·约翰·特朗普6~1.5–2.5 词元/字
韩语도널드 존 트럼프7~1.5–3.0 词元/字

表达同样语义,中文用户要多消耗 2 倍以上词元,既多付钱,又变相缩短了上下文窗口。

中文的专属坑:没有空格的「裸奔」

英文在合并前先按空格做预分词,合并只发生在单词内部,边界符合语言学直觉。中文没有空格,BPE 只能完全依赖统计共现频率决定边界——哪怕是毫无逻辑的广告语,只要在语料里重复千万次,就会被合并成一个不可分割的最小单元。「给主人留下些什么吧」就是著名的故障词元。


五、报价表与三大梯队

梯队定位代表(折后,元/百万词元)适用任务
T0 旗舰能力天花板,输出昂贵Qwen3-Max 输入 1.6 / 输出 6.4;GLM-4.6 长输出档输出 7复杂推理、代码生成、多模型仲裁
T1 主力性价比均衡Qwen-Plus 输入 0.4 / 输出 1日常对话、RAG 问答、摘要归纳
T2 走量近乎免费Qwen-Flash 输入 0.075 / 缓存 0.015数据清洗、意图分类、高频监控

缓存价是标准价的 1/5 甚至更低(部分模型缓存输入直接为 0)。能否吃到这个折扣,取决于架构设计(前缀稳定、命中 KV Cache),而不是取决于你会不会砍价。

提示3 · 大部分成本事故,是用 T0 干 T2 的活

选型原则压成一句话:能用便宜的绝不用贵的,但答错代价大的别省。 判断标准不是「任务难不难」,而是「答错了损失有多大」。把三成以上的请求从旗舰降到主力,往往是最快、风险最小的一笔降本。


六、第一道断崖:GLM 的 200 词元输出分档

GLM-4.6 不按输入分档,按输出分档,分界线在 200 词元:

指标Output ≤ 200Output > 200变化
输出单价4 元/M7 元/M+75%
输入单价1 元/M1.5 元/M+50%

最容易忽略的一点:只要输出超过 200,前面传入的几千个词元输入也要回溯按高价重算。 多写两个字,整单涨价。

厂商为什么这么定:长输出会让 KV Cache 多占一份显存、Attention 多算一轮,成本非线性增长。价格杠杆传递的信号是——鼓励短平快,惩罚冗长生成。

真实冲突场景:从用户评论提取结构化 JSON(sentiment / aspects / pain_points / suggestions)。提示词已很规范,但无法预知每条评论会提取多少——简单评论 150,用户多吐槽两点就变 230。业务天然在 150–230 波动,断崖恰好画在 200。

策略做法代价
任务拆分拆成多次调用,每次提取 1–2 个字段调用次数增加、延迟上升
字段分级核心字段实时,次要字段异步或后处理架构复杂度上升
接受波动 + 监控允许偶发跳档,看整体分布成本可控但非最优
模型降级高频任务切到走量模型可能牺牲少量精度
核心判断点:这个任务的输出天然落在哪个区间?中位数在 100–150、偶发超 200,可接受;中位数压在 180–220,说明任务天然踩在断崖上——必须重切粒度,或换一个不按输出分档的模型。

七、第二道断崖:Qwen 的 32k 输入红线

Qwen 按输入长度分档,阈值在 32k 与 128k。最容易被忽略的计费细节是:越线后不是超出部分加价,而是整个请求全量按高价档结算。

输入长度(Qwen3-Max)单价(元/M,折后)相对基准
0 – 32k1.61x
32k – 128k3.22x
128k – 252k4.83x

输入 33,000,仅比 32k 多 1,000,全部 33k 都按 3.2 元/M 结算。多 1k,整单翻倍。

RAG 场景尤为尖锐:检索回 5 个片段,拼起来刚好 33k。问一句——第 5 个片段对最终回答的贡献有多大?如果只是网页页脚、版权声明、重复段落或多余换行符,粗放的 RAG 正在为垃圾付双倍的钱。

解法:预算感知的动态裁剪

不要无脑拼接,把 32k 写成代码里的预算约束:


def build_prompt_within_budget(system_prompt, context_chunks,
                               user_query, budget=32000):
    prompt = system_prompt + user_query
    current_tokens = count_tokens(prompt)
    selected_chunks = []
    for chunk in sort_by_relevance(context_chunks):  # 按相关性排序
        chunk_tokens = count_tokens(chunk)
        if current_tokens + chunk_tokens > budget:
            break                                    # 到预算即停
        selected_chunks.append(chunk)
        current_tokens += chunk_tokens
    return system_prompt + ''.join(selected_chunks) + user_query
场景策略说明
RAG 检索动态 Top-K不固定取 5 个,取到「快到 32k」为止
多轮对话历史压缩历史接近 30k 时触发 Summarization
长文档处理分段处理不一次性塞入,采用 Map-Reduce 模式

提示4 · 三大厂商定价策略对照

厂商跳档类型关键阈值应对策略
智谱 GLM-4.6输出长度跳档200 Tokens任务拆分,或切换到非输出分档模型
通义 Qwen输入长度跳档32k / 128k预算感知截断,动态裁剪上下文
DeepSeek思维链累积多轮膨胀上下文清洗,用完即弃

八、审查清单

上线前逐条自检,任一为「否」都需要回到设计阶段:

  • 梯队是否匹配:本任务是否用 T0 干了 T2 的活?答错代价是否真的需要旗舰?
  • 分布是否已知:输出与输入的词元分布直方图是否画过?中位数离断崖多远?
  • 预算是否进代码:拼 Prompt 是否有预算上限?是否按相关性排序后到预算即停?
  • 缓存是否命中:前缀是否稳定?是否刻意复用了系统提示词与固定上下文?
  • 中文是否折算:预算与上下文窗口估算,是否按中文的词元税上浮过?
  • 降级路径是否存在:高频且价格敏感的任务,是否已切到走量模型?
  • 监控是否可见:是否有按任务维度的成本看板,能看到整体分布而非单笔异常?
  • 熔断是否设置:Agent 循环或多轮对话,是否有轮次上限与成本上限?

九、约束说明

本集的判断与数字,均在以下约束边界内成立,脱离边界需重新核算:

  1. 价格时效性约束:文中所有价格均为作者团队当时拿到的折后协议价,仅用于演示计算方法。各家牌价与折扣随时在变,选型前必须核对智谱开放平台、阿里云百炼及各家官网的实时报价。
  2. 分词器依赖约束:词元税的具体倍数取决于所选模型的分词器与词表,切换模型后需重新实测,不可沿用本文比率。
  3. 任务分布约束:四种应对策略的优劣完全取决于任务自身的输出/输入分布。没有分布数据就选策略,等于拍脑袋。
  4. 精度权衡约束:模型降级必然伴随精度风险,价格敏感不等于精度不敏感,需按任务分别评估。
  5. 架构成本约束:字段分级、异步补充等策略会提升架构复杂度与维护成本,小规模业务可能不划算。

提示5 · 把降本当架构约束,而不是当运动

降本最容易做成的形态是运动:一紧张就全局限流、全员降级,用户体验先塌。正确的姿势是把它写进设计文档的第一页——定价即架构,价格牌上的每一道线,最终都会变成系统里的一个分支判断。


十、可带走的判断清单

  1. 先分梯队再选型:能用便宜的绝不用贵的,但答错代价大的别省。
  2. 真正要看的是边界线,不是单价:上线前把输出与输入分布各画一张直方图。
  3. 把预算写进代码,而不是写进复盘:按相关性排序、到预算即停,动态 Top-K 优于固定 Top-K。
  4. 中文天然多交一倍以上的词元税:估算预算、窗口与延迟时,别拿英文经验拍脑袋。
  5. 省词元的本质是提高信息密度:它同时优化账单、延迟与质量,高信噪比本身就是高智能。

十一、自测卡

本集配套的自测题(「AI 产品心理学 · 40 道灵魂拷问」题库节选)仅在集页下方的自测卡中呈现,不进入音频口播。建议你听完音频后,用自测卡检验以下判断是否能独立做出:

  • 给定五个业务场景,能否正确选出对应梯队?
  • 给定一段输出分布描述,能否判断该任务是否踩在 200 断崖上?
  • 给定 RAG 拼装逻辑,能否指出它在为哪一部分垃圾付双倍的钱?

内容来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》),本集取材于作者团队内部分享《AI Token 降本增效策略分享》,为二次演绎配音版。

自测卡 · AI 产品心理学 · 40 道灵魂拷问 · 不进入音频

自测卡 1 · AI 产品心理学 · 40 道灵魂拷问

他们会这样考你

AI 产品心理学 · 40 道灵魂拷问

心理学章学完了,能不能把「用户为什么这样反应」讲成可执行的方案,一问便知。这 40 个问题来自三个真实场景,先自己开口回答,再看框架。

一句话速览

每题附考察意图、答题框架与加分点:感知性能 / 峰终取舍 / 信任校准 / 防御拆除 / 算法厌恶 / 标签折扣 / 情感依恋 / 付费与定价 / 沉默偏差 / 体验指标怎么写进 OKR

怎么用这一页

每道题都标注了提问者。他们问同一块知识,想听的东西却不一样。

🎙 面试官 想验证你是真懂,还是在背效应名词

👔 老板 要的是投入产出的解释和可承诺的数字

🛠 技术同事 在试探你的需求有没有想过实现代价

每题给出三层: 对方在考察什么 → 答题框架 → 加分点 。答不上来的环节,点末尾的课程页回去补。