第 1 章 · 第 14 讲 · 16:22
pm14-m1-播客.mp3(约 16 分钟)同一个时代,聊天 AI 聪明得像个靠谱同事,购物软件里的客服却在一本正经地装傻。为什么?
本集把这个问题拆到底,并回答一串同源疑问:老语音助手和现在的产品是不是一种东西、免费版够不够用、接口和会员有什么区别、生图为什么贵几十倍、视频为什么按秒收费、三折接口能不能碰。
这些问题的答案都指向同一件事:成本结构。 看懂这本账,很多"不合理"的设计立刻就合理了。
| 问题 | 表层现象 | 底层原因 |
|---|---|---|
| AI 客服为什么蠢 | 答非所问 | 省钱 + 怕赔 + 旧系统冒充 |
| Siri 和 ChatGPT 一样吗 | 都叫助手 | 两代技术:命令匹配 vs 生成式理解 |
| 免费够用吗 | 界面一模一样 | 小一号模型 + 次数/长度/排队限制 |
| API 和会员什么区别 | 都在付钱 | 包月自助餐 vs 按克称重散称 |
| 生图为什么贵几十倍 | 限次数、收积分 | 像素多 + 画几十遍 + 显卡独占 |
| 视频为什么按秒收费 | 一秒几块钱 | 每秒 24 帧 × 帧间连贯 × 物理 × 音画同步 |
| 三折接口能碰吗 | 便宜是真的 | 多两层不可验证的中间人 |
同一句话「我上周买的鞋开胶了,想换货但发票丢了」,发给聊天 AI 和发给商家客服机器人,待遇差很多——因为它们多半没用同一个脑子。
| 原因 | 机制 |
|---|---|
| 省钱 | 客服每天消息量巨大,每条都要花钱。很多商家算完账选了便宜的小模型,或干脆沿用旧系统。你享受的聪明程度,和商家愿意付的账单直接挂钩 |
| 护栏锁死 | AI 随口说「可以给您全额退款」,商家可能真得赔。所以只准念审核过的稿子,超纲一律装没听见。对商家来说,宁可蠢,不能错 |
| 冒充 | 一大批客服压根是上一代关键词机器人:找关键词,命中哪条答哪条。这两年贴上"AI 智能客服"标签继续营业,锅却让新 AI 背了 |
换个说法再问一遍。 把「发票丢了能换货吗」换成「购物小票找不着了,还能给我换吗」——老式机器人立刻露馅,接了大模型的客服能稳稳接住。
下次遇到装傻的客服,先别急着对 AI 失望:你面前的很可能是一台省钱模式的旧机器。
不是。它们用的是两代技术。
| 老一代语音助手 | 生成式 AI | |
|---|---|---|
| 技术路线 | 命令匹配(去命令库里找匹配) | 生成式理解(理解意思再决定怎么办) |
| 比喻 | 电话按键菜单:查话费请按 1,办业务请按 2 | 真人接线员:你怎么说都行 |
| 天花板 | 说法无穷、命令有限 | — |
问题出在第二步「去命令库里找匹配」。人类的说法无穷无尽,命令库条目却是工程师一条条写进去的:「叫我起床」「设个闹钟」「明早喊我」……每一种说法都得预先想到、预先登记,漏了哪种就听不懂哪种。
路线的天花板,加人是顶不破的。 工程师再加十倍,也穷举不完人类的说话方式。
它和 ChatGPT 的差距是代差——就像按键电话和智能手机,给按键电话换个铃声,它还是按键电话。
换个说法再说一遍:「明早七点叫我」→「明天我得七点起」。还接得住的,就是新的。
界面和付费版长得一模一样,差别全藏在看不见的地方:
免费版是试用装,不是同一件商品的小号包装。
| 用法 | 建议 |
|---|---|
| 偶尔用 | 免费版完全够 |
| 每天都靠它干活 | 付费版差距会越用越明显 |
| 靠它吃饭 | 上顶配 |
连续一周,只要碰到「今天次数用完了」或「内容太长放不下」这类提示,就到了该付费的时候。
反过来,一个月都没碰到过限制,说明免费版绰绰有余,别急着掏钱。
先把免费版用满再考虑付费——很多人付了钱才发现用量连免费额度都填不满,等于花钱买了个心理安慰。
量级概念:主流 AI 产品会员费大致在同一量级——一个月一顿饭到几顿饭的钱,国产产品普遍更便宜。你付费买的是模型档位和稳定性,不是那个长得一样的界面。
会员 = 包月自助餐;API = 按克称重的散称食材。
| 会员 | API | |
|---|---|---|
| 付法 | 交一次月费,随便聊 | 按实际用量,用多少称多少 |
| 得到什么 | 做好的菜:界面、聊天记录、联网搜索都配齐 | 生食材:一个接口地址 + 一把钥匙(key) |
| 限制 | 只能在店里吃,吃太猛会被提示「歇一会儿」 | 自由度大,但你得会开火 |
| 适合谁 | 普通人 | 接工具、做产品的人 |
几乎都发生在同一个场景:某个第三方工具要用 AI 的能力。翻译插件、写作软件、自动化脚本自己没有 AI,得由你递给它一把钥匙,它拿着钥匙去调用模型,费用记在你的账上。
简单分法:只是想用 AI 聊天干活 → 开会员;要让某个软件替你调 AI → 才需要 API。 多数人一辈子只需要前者。
| 内容 | 成本量级 |
|---|---|
| 一次文字问答 | 几厘到几分钱 |
| 一张 AI 图片 | 两三毛钱 |
| 一秒 AI 视频 | 约一块五到五块 |
换算:一元 ≈ 200 次问答 ≈ 3 张图 ≈ 0.3 秒视频。
价格按 2026 年 8 月主流 API 量级取整,只为感受数量级。
为什么生图要用「积分」、为什么先给小尺寸预览图、为什么高清放大要单独收费——都是在帮你(和他们自己)省那块被独占的显卡。
省钱技巧:先用文字把需求打磨清楚,再出图。一次成功最省。
视频不是"一张图",是每秒二十几张必须连贯的图,还要配上同步的声音、合理的物理运动。生成量是图片的几十倍,难度还不止翻几十倍。
按 24 帧/秒:一条 5 秒的视频 = 120 帧。你以为在生成一条视频,实际是生成 120 张图——而且它们不能各画各的,必须像连环画一样严丝合缝。
| 难点 | 说明 |
|---|---|
| 帧和帧必须"记得住彼此" | 衣服颜色、背景里的杯子、光线方向,每一帧都不能变卦。模型要同时"记住"几百帧互相对齐——这也是早期 AI 视频人物走着走着会"变脸"的原因 |
| 物理要合理 | 苹果往下掉、水往低处流、头发跟着风飘。模型得从海量视频里"悟"出物理规律才能不穿帮——这部分最烧训练成本 |
| 声音还要对上口型 | 新一代模型(Veo 3、Sora 2 等)直接生成配音音效,嘴型、脚步声、环境音都要同步——等于同时做视频和音频两份工作,所以"带声音"比"无声"贵一截 |
中转站 = 夹在你和 AI 官方之间的"二道贩子":批量拿到接口再转卖给你。便宜是真的,但你的每一句话都要先经过它的服务器。
路线 A · 官方直连(或豆包、Kimi 等官方 App)
你 ──→ 模型官方 ──→ 回答
数据只经过官方一家,价格/隐私政策/模型版本白纸黑字可查
路线 B · 经过中转站
你 ──→ 中转站服务器(能看到你的全部内容)──→ 某个来源的接口(是不是正品?)──→ 回答
中间多了两个你无法核实的环节
共同点:别只看表面体验,往下看一层成本,很多不合理的设计立刻就合理了。
| 课节 | 一句话 |
|---|---|
| AI 客服为什么那么蠢? | 省钱、怕赔、旧系统冒充——换说法再问一遍就能分辨 |
| Siri 和 ChatGPT 是一种东西吗? | 不是。命令匹配 vs 生成式理解,是代差不是版本差 |
| 免费的 AI 够用吗? | 按频率定;连续一周碰到限制才升级,先把免费版用满 |
| API 和会员有什么区别? | 自助餐 vs 散称食材;key 是密码,官方渠道购买 |
| 生成一张图为什么贵几十倍? | 像素多 + 画几十遍 + 显卡独占 |
| AI 视频为什么按秒收费? | 每秒 24 帧 × 帧间连贯 × 物理合理 × 音画同步 |
| 什么是 API 中转站? | 二道贩子:内容透明、模型可能掺假、余额可能清零 |
*来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)*
*本页文字为配套解读,音频为二次演绎配音版。*