第 6 章 · 第 45 讲 · 16:14
AI 产品有一个让产品经理特别委屈的结构性矛盾:产品做得越好,用户用得越爽,利润反而越薄。
原因是收费模式与成本模式的错配——订阅制下收入是一条平线(会员费固定),而推理成本是一条上坡线(用量越大,成本越高)。两条线迟早交叉,交叉点之后,你最忠诚的那批用户,就成了成本表上最贵的一行。
本集从作者团队的内部分享《AI Token 降本增效策略分享》中,挑出与产品经理决策最相关的五节,回答三个问题:
定价即架构。价格牌不是财务部门随手定的,它精确反映了推理算力的边际成本曲线。读懂定价结构,等价于读懂算力成本曲线,然后把应用架构设计到便宜的那一侧。
| 层级 | 能力 | 具体表现 | 验证方式 |
|---|---|---|---|
| L1 成本归因 | 三重身份 | 把一笔开销同时读成账单、延迟、质量 | 能说出同一笔浪费的三个后果 |
| L2 分词认知 | 词元是怎么数的 | 讲清字符级 / 词级 / 子词级的取舍 | 能解释中文为什么贵两倍以上 |
| L3 报价识读 | 三个梯队 | T0 旗舰 / T1 主力 / T2 走量分工明确 | 给五个场景选出正确梯队 |
| L4 边界识别 | 跳档断崖 | 认出输出分档与输入分档两类阈值 | 能列出本任务的两条红线 |
| L5 架构应对 | 预算写进代码 | 动态 Top-K、历史压缩、分段归并 | 上线后有可观测的成本看板 |
| L6 取舍判断 | 四种策略 | 任务拆分 / 字段分级 / 接受波动 / 模型降级 | 能说出每种策略的代价 |
能力依赖关系:L1 认知错了,后面全偏——如果把成本只当财务问题,就不会去优化延迟和质量;L4 是 L5 的前提,不知道断崖在哪,代码里就没有预算可写;L6 必须建立在 L4 之上,因为策略选择完全取决于任务的输出或输入分布落在哪个区间。
这是本集最省钱的一条动作。上线前,把本任务的输出词元分布和输入词元分布各画一张直方图,看中位数离最近的价格断崖有多远。中位数压在断崖上的任务,必须在设计阶段解决,不能等账单出来再复盘。
| 身份 | 机制 | 产品经理能感知到的后果 |
|---|---|---|
| 账单 | 每百万词元几元,乘调用量即月支出 | 千万级调用下,10% 的浪费就是一个人的工资 |
| 延迟 | 输入越长,Prefill 越久 | 首字延迟升高,用户还没看到第一个字就已流失 |
| 质量 | 上下文塞得越满,有效信息越容易被稀释 | 高信噪比 = 高智能,省词元常常顺带提升效果 |
推理的两个阶段决定了输入价与输出价的差距:
所以输出通常比输入贵数倍——它占用的是更难并行的那一段资源。
把「降本」翻译成团队语言时,不要只讲钱。同一笔优化同时压低了账单、缩短了首字延迟、提升了回答质量。这句话是推动工程改造最有效的说服口径。
早期 NLP 走过两个极端,现代大模型选了中间路线:
| 方案 | 优点 | 致命问题 |
|---|---|---|
| 词级别分词 | 语义明确 | 词表爆炸(词形变化),无法处理未登录词 |
| 字符级别分词 | 什么都能拆 | 序列过长、单字符信息量低、推理效率极差 |
| 子词分词 | 常见词完整保留,罕见词拆成片段 | 词表 32k–200k,平衡两端 |
BPE(字节对编码)的四步迭代:先按字节拆到最小单位 → 统计相邻字节对频次 → 合并最频繁的一对 → 迭代至词表达到预设大小。Llama 2 词表 32,000,GPT-4 的 cl100k_base 为 100,277。
词表越大、你的文本越「常见」,词元就越少,账单就越薄。所以选模型时,分词器效率也是一项成本参数。
主流分词器训练语料以英文为主,合并规则高度偏向英语:
| 语言 | 示例 | 词元数 | 比率 |
|---|---|---|---|
| 英语 | Donald John Trump | 3 | ~0.75 词元/词 |
| 中文 | 唐纳德·约翰·特朗普 | 6 | ~1.5–2.5 词元/字 |
| 韩语 | 도널드 존 트럼프 | 7 | ~1.5–3.0 词元/字 |
表达同样语义,中文用户要多消耗 2 倍以上词元,既多付钱,又变相缩短了上下文窗口。
英文在合并前先按空格做预分词,合并只发生在单词内部,边界符合语言学直觉。中文没有空格,BPE 只能完全依赖统计共现频率决定边界——哪怕是毫无逻辑的广告语,只要在语料里重复千万次,就会被合并成一个不可分割的最小单元。「给主人留下些什么吧」就是著名的故障词元。
| 梯队 | 定位 | 代表(折后,元/百万词元) | 适用任务 |
|---|---|---|---|
| T0 旗舰 | 能力天花板,输出昂贵 | Qwen3-Max 输入 1.6 / 输出 6.4;GLM-4.6 长输出档输出 7 | 复杂推理、代码生成、多模型仲裁 |
| T1 主力 | 性价比均衡 | Qwen-Plus 输入 0.4 / 输出 1 | 日常对话、RAG 问答、摘要归纳 |
| T2 走量 | 近乎免费 | Qwen-Flash 输入 0.075 / 缓存 0.015 | 数据清洗、意图分类、高频监控 |
缓存价是标准价的 1/5 甚至更低(部分模型缓存输入直接为 0)。能否吃到这个折扣,取决于架构设计(前缀稳定、命中 KV Cache),而不是取决于你会不会砍价。
选型原则压成一句话:能用便宜的绝不用贵的,但答错代价大的别省。 判断标准不是「任务难不难」,而是「答错了损失有多大」。把三成以上的请求从旗舰降到主力,往往是最快、风险最小的一笔降本。
GLM-4.6 不按输入分档,按输出分档,分界线在 200 词元:
| 指标 | Output ≤ 200 | Output > 200 | 变化 |
|---|---|---|---|
| 输出单价 | 4 元/M | 7 元/M | +75% |
| 输入单价 | 1 元/M | 1.5 元/M | +50% |
最容易忽略的一点:只要输出超过 200,前面传入的几千个词元输入也要回溯按高价重算。 多写两个字,整单涨价。
厂商为什么这么定:长输出会让 KV Cache 多占一份显存、Attention 多算一轮,成本非线性增长。价格杠杆传递的信号是——鼓励短平快,惩罚冗长生成。
真实冲突场景:从用户评论提取结构化 JSON(sentiment / aspects / pain_points / suggestions)。提示词已很规范,但无法预知每条评论会提取多少——简单评论 150,用户多吐槽两点就变 230。业务天然在 150–230 波动,断崖恰好画在 200。
| 策略 | 做法 | 代价 |
|---|---|---|
| 任务拆分 | 拆成多次调用,每次提取 1–2 个字段 | 调用次数增加、延迟上升 |
| 字段分级 | 核心字段实时,次要字段异步或后处理 | 架构复杂度上升 |
| 接受波动 + 监控 | 允许偶发跳档,看整体分布 | 成本可控但非最优 |
| 模型降级 | 高频任务切到走量模型 | 可能牺牲少量精度 |
核心判断点:这个任务的输出天然落在哪个区间?中位数在 100–150、偶发超 200,可接受;中位数压在 180–220,说明任务天然踩在断崖上——必须重切粒度,或换一个不按输出分档的模型。
Qwen 按输入长度分档,阈值在 32k 与 128k。最容易被忽略的计费细节是:越线后不是超出部分加价,而是整个请求全量按高价档结算。
| 输入长度(Qwen3-Max) | 单价(元/M,折后) | 相对基准 |
|---|---|---|
| 0 – 32k | 1.6 | 1x |
| 32k – 128k | 3.2 | 2x |
| 128k – 252k | 4.8 | 3x |
输入 33,000,仅比 32k 多 1,000,全部 33k 都按 3.2 元/M 结算。多 1k,整单翻倍。
RAG 场景尤为尖锐:检索回 5 个片段,拼起来刚好 33k。问一句——第 5 个片段对最终回答的贡献有多大?如果只是网页页脚、版权声明、重复段落或多余换行符,粗放的 RAG 正在为垃圾付双倍的钱。
不要无脑拼接,把 32k 写成代码里的预算约束:
def build_prompt_within_budget(system_prompt, context_chunks,
user_query, budget=32000):
prompt = system_prompt + user_query
current_tokens = count_tokens(prompt)
selected_chunks = []
for chunk in sort_by_relevance(context_chunks): # 按相关性排序
chunk_tokens = count_tokens(chunk)
if current_tokens + chunk_tokens > budget:
break # 到预算即停
selected_chunks.append(chunk)
current_tokens += chunk_tokens
return system_prompt + ''.join(selected_chunks) + user_query
| 场景 | 策略 | 说明 |
|---|---|---|
| RAG 检索 | 动态 Top-K | 不固定取 5 个,取到「快到 32k」为止 |
| 多轮对话 | 历史压缩 | 历史接近 30k 时触发 Summarization |
| 长文档处理 | 分段处理 | 不一次性塞入,采用 Map-Reduce 模式 |
| 厂商 | 跳档类型 | 关键阈值 | 应对策略 |
|---|---|---|---|
| 智谱 GLM-4.6 | 输出长度跳档 | 200 Tokens | 任务拆分,或切换到非输出分档模型 |
| 通义 Qwen | 输入长度跳档 | 32k / 128k | 预算感知截断,动态裁剪上下文 |
| DeepSeek | 思维链累积 | 多轮膨胀 | 上下文清洗,用完即弃 |
上线前逐条自检,任一为「否」都需要回到设计阶段:
本集的判断与数字,均在以下约束边界内成立,脱离边界需重新核算:
降本最容易做成的形态是运动:一紧张就全局限流、全员降级,用户体验先塌。正确的姿势是把它写进设计文档的第一页——定价即架构,价格牌上的每一道线,最终都会变成系统里的一个分支判断。
本集配套的自测题(「AI 产品心理学 · 40 道灵魂拷问」题库节选)仅在集页下方的自测卡中呈现,不进入音频口播。建议你听完音频后,用自测卡检验以下判断是否能独立做出:
内容来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》),本集取材于作者团队内部分享《AI Token 降本增效策略分享》,为二次演绎配音版。
他们会这样考你
AI 产品心理学 · 40 道灵魂拷问
心理学章学完了,能不能把「用户为什么这样反应」讲成可执行的方案,一问便知。这 40 个问题来自三个真实场景,先自己开口回答,再看框架。
一句话速览
每题附考察意图、答题框架与加分点:感知性能 / 峰终取舍 / 信任校准 / 防御拆除 / 算法厌恶 / 标签折扣 / 情感依恋 / 付费与定价 / 沉默偏差 / 体验指标怎么写进 OKR
怎么用这一页
每道题都标注了提问者。他们问同一块知识,想听的东西却不一样。
🎙 面试官 想验证你是真懂,还是在背效应名词
👔 老板 要的是投入产出的解释和可承诺的数字
🛠 技术同事 在试探你的需求有没有想过实现代价
每题给出三层: 对方在考察什么 → 答题框架 → 加分点 。答不上来的环节,点末尾的课程页回去补。