CHAPTER 1 · EP 13

小白三千问 · 祛魅打假

第 1 章 · 第 13 讲 · 16:44

时长 16:44音色 云健 · 男声章节 1

同步字幕

章节导航(点击跳转)

0:00开场1:10
1:10开源不等于免费2:19
3:29跑分第一,为什么用起来不行2:34
6:04它其实一个字都没学进去2:47
8:51AI 检测器,接近玄学2:32
11:24提示词秘籍值得买吗2:00
13:24为什么每次答案不一样2:01
15:26可带走的判断清单1:16
解读全文

ep13 · 小白三千问 · 祛魅打假

  • 模块:M1 认知地基
  • 课节:6 节(「开源模型」等于免费吗?/「跑分第一」的模型,为什么用起来不行?/ AI 越聊越懂我,是它在学习吗?/ AI 检测器说「这是 AI 写的」,可信吗?/「提示词秘籍」值得买吗?/ 同一个问题,为什么每次答案不一样?)
  • 来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)
  • 配套音频:pm13-m1-播客.mp3

这一集解决什么问题

这一集叫「祛魅打假」,一次拆掉六个流传极广的说法:

#流行说法一句话结论
1开源模型 = 免费多半只开权重;免费下载 ≠ 免费运行 ≠ 免费商用
2跑分第一 = 最好榜单测的是考试,你要的是干活
3越聊越懂我 = 它在学习参数出厂即冻结,懂你的是外挂小本本
4检测说 AI 写的 = AI 写的不可信,接近玄学,不能当证据
5花钱才能学到真提示词大概率不值,骨架半页纸讲完
6每次答案不一样 = 不稳定随机是特性,是刻意设计

为什么产品经理要关心:这六个说法每一个都会变成一次具体决策——选模型要不要看榜单、采购合同里「开源」意味着什么、用 AI 检测做内容审核会不会误伤最认真的那批用户。判断错了,赔进去的是预算、时间和信誉。


能力地图

误区需要建立的认知可执行的动作
开源 = 免费三件套检查:权重 / 数据 / 方法商用前读许可证
榜单 = 选型依据刷榜、过拟合、考纲不含你的场景建十题私人题库
对话 = 学习训练 / 聊天两阶段,参数冻结重要偏好自己存一份
检测分 = 证据只认表面特征,认不出作者看创作过程 + 当面聊
秘籍 = 真功夫骨架免费,功夫在场景三条标准筛付费内容
答案漂移 = 故障每个字都是一次带权重抽签按场合调温度

一、「开源模型」等于免费吗?

AI 圈的「开源」有点特殊

软件圈开源AI 圈「开源模型」
给你什么源代码,每一行可见权重(练好的大脑本体)
能否改造能改、能编译汤随便喝,配方与炖法保密
严谨叫法开源开放权重

三件套检查器:判断一个模型开得多彻底,看权重、数据、方法三样。多数模型只亮第一盏灯。

满血版 vs 蒸馏版:可能不是同一个模型

满血版蒸馏版
身份新闻标题里刷榜的那个你家电脑跑起来的那个
参数量千亿级几十亿级
能力榜单成绩的来源日常够用,难题露怯
设备一屋子服务器 + 一排专业显卡一台高配电脑
本地跑的多半是小号。 夸模型之前,先确认自己用的是哪个版本。跑不动满血版一点也不丢人——几十亿参数的小模型干日常活已经相当称职。

三个「免费」要分开算

  1. 免费下载——模型文件本身不要钱。
  2. 免费运行——跑起来要占显存,模型越大显卡越贵;大到一定程度一张卡装不下,得好几张一起上。电费也是持续开销。
  3. 免费商用——看许可证。有的随便商用,有的限制用途或用户规模。自己玩基本没事,拿去赚钱前务必读一遍。这一步很多人跳过,跳过的代价可能是律师函。

二、「跑分第一」的模型,为什么用起来不行?

反转演示

两个虚构模型:A 跑分 95,B 跑分 88。按榜单选肯定选 A。但把三个真实任务跑一遍,结论可能反过来——95 分和 88 分的差距,在你的日常任务里可能根本感觉不到。

分数排的是考场座次,干活好坏还得上手试。

三个原因

  1. 刷榜:榜单题库在网上流传久了,难免混进训练数据。相当于考前背了答案——分数好看,能力没那么多。圈内有个体面的说法,叫「数据污染」。
  2. 过拟合考试:厂商知道大家看榜,就专门朝着考点优化。像应试教育里的做题家——卷面顶尖,日常交流与动手能力反而被牺牲。
  3. 考纲不含你的场景:榜单考数学、考代码、考知识问答,但不考「懂你们行业」,也不考「安慰人」。

什么榜相对可信

真人盲测投票类:把两个模型的回答摆在一起隐藏名字,让大量真实用户投票。没有固定题库可背,考官是活人,刷起来难度大得多。

但它也只是「相对」可信——投票的人未必和你干同一行,大众觉得好的风格未必适合你的场景。

建一套私人题库(最靠谱的评测机构是你自己)

从自己的工作里攒 10 个真实问题,存成一个文档:

  • 挑最常干的活:周报、方案、邮件——选你每周都要做的 3 件
  • 挑最专业的活:带上行业黑话和内部语境,考它懂不懂你这行
  • 挑翻过车的活:以前 AI 答砸过的问题,最能试出新模型的成色
  • 留一道送分题 + 一道刁钻题:送分题都答不好的直接淘汰,刁钻题用来拉开差距
  • 答案好坏你说了算:你比任何榜单都清楚,什么样的输出算「能交差」
每次想换模型,把这 10 道题跑一遍,五分钟出结论。
隐藏好处:它会逼你想清楚自己到底需要 AI 干什么。很多人换了三个月模型,最后发现真正的问题是提示词没写好。

三、AI 越聊越懂我,是它在学习吗?

答案:没有在学习。对话改变不了模型本身,它的大脑在出厂那一刻就冻结了。

两个阶段

阶段类比参数
训练上学,读海量资料、反复调参持续变化
聊天毕业后上班,用学到的东西干活上岗那天起定型

你跟它聊一万句,这些参数一个都不会动——但那是未来新模型的事,眼下正在跟你聊天的这一个,学不进任何东西。

「记忆功能」的真面目

  • 它是模型外面挂的一个记事本。
  • 你聊天时提到的关键信息(住哪、吃什么、做什么工作)被摘出来存好。
  • 每次新对话开始前,产品把这些条目贴进对话的最前面。
  • 模型读到了,回答自然显得懂你。
  • 这些贴进去的内容占用的空间,就是常说的上下文窗口。

两件常被混为一谈的事

场景会不会失忆原因
换个产品会清零小本本存在 A 的服务器上,B 看不到
同一产品新开对话不会失忆小本本挂在账号上,不在某一个对话里

真正会丢的是:这个对话里聊过、却没被摘进小本本的细节——刚才那段长文档、上一轮的具体措辞、你临时改的口径。失忆的是模型,不是产品。

为什么这样设计

  • 单独训练贵到离谱:成千上万块专用芯片连跑数周,成本按「亿」的量级算。给几亿用户每人练一个专属模型,没有公司付得起。
  • 小本本便宜又够用:成本几乎可忽略,效果上你感觉不出差别。
  • 冻结反而更安全:如果每个人都能靠聊天改写模型,有人教好话,也会有人教坏话。参数冻结让它对所有人保持同一个水准——这是特性,也是保护。

四、AI 检测器说「这是 AI 写的」,可信吗?

答案:不可信,接近玄学。目前没有任何检测器能可靠区分两者。检测分数当参考都勉强,当证据万万不行。

为什么原理上就做不准

检测器的思路是找「AI 味」:用词太规范?句子太通顺?结构太整齐?

问题来了:AI 当年就是照着人类的好文章学写作的。通顺、规范、结构清楚,这些恰恰是认真写作的人一直在追求的东西。
让检测器找「AI 特征」,等于让它找「好学生特征」——结果就是认真写字的人集体中枪。

反方向更尴尬:把 AI 生成的文字改几个词、加两个错别字、掺点口语,检测分数立刻大跳水。一个正着抓冤枉好人、反着抓轻易被骗的工具,很难说它抓住的到底是什么。它只认表面特征,认不出作者。

自证三件套

材料说明
草稿和修改记录在线文档的编辑历史带时间戳;真人写的文章,历史是一点点长出来的,装不出来
创作过程录屏重要的稿子(论文、求职作品)顺手开录屏,占点硬盘换一份无人能反驳的证据
过程材料留底大纲、参考资料截图、讨论记录——都是创作路径的脚印

给老师和 HR 的话

主流检测工具的官方说明里,都写着结果仅供参考、存在误判可能。工具自己都不敢打包票的事,使用工具的人更不该拿它一票否决一个学生或候选人。

更可靠的判断方式:看创作过程,当面聊几句——让对方讲讲写作思路、某段为什么这么写、换个角度能怎么改。真写过的人聊起来眉飞色舞,没写过的人三句就露馅。

对产品经理尤其要紧:如果你在产品里接入 AI 检测做内容审核,你等于把误判成本转嫁给了最认真的那批用户。

五、「提示词秘籍」值得买吗?

答案:大概率不值。 真正有用的骨架半页纸就讲完了;剩下的功夫在你自己的活儿上多用多改。几百块的秘籍,卖的主要是焦虑。

宣传单拆解结果

分类条数
免费学过2
过度包装1
纯话术3

这张几百块的宣传单里,没有一条是你必须花钱才能得到的东西。

什么值得花钱:三条标准

  1. 可试听——敢让你先看内容再掏钱的,通常对质量有底气。只给目录和喜报截图的,先按住钱包。
  2. 可退款——有明确退款条款,说明卖家分担了一部分风险。「虚拟商品概不退换」+ 高价,两个信号叠加要警惕。
  3. 承诺不夸张——靠谱的课讲方法、讲练习、讲适用范围。只要出现收入承诺,直接关页面。 能稳定月入过万的人,很少靠卖这个赚钱。

免费路径:两步

第一步,学骨架。 背景 + 要求 + 限制,加上「让 AI 先反问你再动手」。市面上大半秘籍的核心内容你就有了。

第二步,在自己的活儿上磨。 挑一件每周都要做的事,用骨架写一版,不满意就改,改三轮存下来。三个月后你手里那套专属模板,任何秘籍都卖不了你——因为它长在你的工作里。

模板的定价算法:它帮你省了多少小时,值多少钱。按这个算法再看「几百块买 100 个模板」,多数时候答案会自己浮出来。

六、同一个问题,为什么每次答案不一样?

因为 AI 生成每个字的时候都在掷骰子——从几个高概率的候选词里挑一个。这是有意的设计,让回答自然不死板。

骰子原理

  1. 给所有候选字打分
  2. 分高的中签机会大,分低的机会小,然后抽一个
  3. 抽完这个字,再为下一个字重新抽签
  4. 一句话几十个字 = 几十次抽签
两次回答一模一样才是小概率事件。

为什么要故意随机

如果永远选最高分,回答会变成死板的复读机——你问十次奶茶店起名,它答十次「茉莉奶茶」;写文案千篇一律,起名、写诗、想创意这类任务直接废掉。

允许它抽中第二名、第三名的词,路子一下就宽了,语言也更像活人说话。随机是出厂特性,就像让两位文案同事各写一稿,本来就不该一模一样。

按场合使用

场景建议
创意任务(起名、文案、头脑风暴)欢迎随机。多问几次 = 免费多请了几位同事,挑最好的那版
严肃任务(合同条款、代码、数据处理)调低随机(常见叫「温度」参数),调到最低时接近每次都选最高分
实用提醒:随机性也意味着单次回答的可靠度有限。涉及重要事实时,同一个问题换着方式多问几次——答案一致的部分可信度更高,来回变的部分要去权威来源核实。答案不一致和撒谎是两回事,但处理方式一样:都要核实。

约束说明(务必读完)

  1. 「开放权重」不是法律术语。是否可商用、有何限制,只以该模型随附的许可证为准,不以新闻标题为准。
  2. 榜单分数仅供参考。95 与 88 的差距在你的日常任务里可能感觉不到,甚至反转。选型请以自有题库实测为准。
  3. 检测器的误判是结构性的,不是精度问题。写得越工整越容易被冤枉;改写几个词就能让分数跳水。不要用它做一票否决。
  4. 记忆功能因产品而异。是否默认开启、存在哪台服务器、能否导出,各产品政策不同。重要偏好请自备一份文档。
  5. 本页演示为教学模拟。检测器的判决、宣传单拆解、模型对比均为课程示意,不对应任何真实产品输出。
  6. 随机性无法通过设置彻底消除。调低温度只是让输出更集中,不保证完全一致;严肃场景仍需交叉验证。

审查清单

  • 看到「开源」,我有没有问清开了权重、数据还是方法?
  • 商用之前,我有没有读完许可证?
  • 我用的是满血版还是蒸馏版?有没有拿榜单成绩要求小号?
  • 选型时,我有没有跑过自己的十题题库?
  • 我有没有误以为它会在对话里学习?重要偏好是否自存一份?
  • 用到 AI 检测时,我有没有意识到误判会伤到最认真的用户?
  • 面对付费内容,我有没有过一遍可试听 / 可退款 / 承诺不夸张?
  • 见到收入承诺,我有没有直接关页面?
  • 严肃任务里,我有没有调低温度并做交叉验证?
  • 重要事实上,我有没有多问几次、只信一致的部分?

实践提示

提示1 · 把「开源」换成三个问题

下次听到某模型开源,不要急着欢呼,问三句:权重给了吗?训练数据给了吗?训练方法给了吗?三样里有两样是保密的,就叫开放权重,不叫开源。

提示2 · 用十道题替代看新闻

从你每周真实在做的事里挑十道题存成文档,换模型就跑一遍。五分钟出结论,比追三个月新闻管用。你比任何榜单都清楚,什么样的输出算能交差。

提示3 · 把重要偏好从产品里拿出来

记忆挂在账号上,换产品就清零。把常用的背景、口径、约束写成一份自己的文档,走到哪贴到哪。不要让你的默契寄存在别人的服务器上。

提示4 · 别用检测分做否决

如果你负责审核,记住:检测分只能作为线索之一,不能作为结论。看创作过程、当面聊几句,比任何分数都可靠——这既是对用户负责,也是对自己负责。

提示5 · 场景决定温度

创意任务放开随机,多跑几版挑最好的;合同、代码、数据类任务把温度调低,并对关键事实多问几次交叉验证。同一个模型,两种用法,结果稳定性完全不同。


常见问题

Q:开源模型能不能直接商用?

看许可证,不看「开源」两个字。有的随便商用,有的限制用途或用户规模。拿去赚钱前务必读一遍。

Q:我在本地跑的模型为什么没新闻里那么强?

你跑的多半是蒸馏小号——参数量几十亿级,而新闻里刷榜的是千亿级满血版。体积差几十倍,能力自然不同。

Q:换产品后它就不认识我了,是新模型变差了吗?

不是。小本本存在原来那家产品的服务器上,换一家看不到。重要偏好建议你自己存一份。

Q:检测报告说我的文章 AI 生成率过高,怎么办?

拿出过程材料:编辑历史、创作录屏、大纲与草稿。检测分本身不能作为结论,主流工具官方也都标注了仅供参考。

Q:把温度调到最低,答案就会完全一致吗?

接近但不保证。调低温度只是让输出更集中;严肃场景仍需对重要事实交叉验证。


一句话总结

这六个说法听起来都对,也都很顺口,但每一个都会在具体决策上把人带偏。拆开它们不需要技术背景,只需要知道该问哪一句。


来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)

本页文字与音频为基于小山学堂原课程的二次演绎版本,仅供学习交流使用。