CHAPTER 7 · EP 55

两个战场

第 7 章 · 第 55 讲 · 17:02

时长 17:02音色 云健 · 男声章节 7

同步字幕

章节导航(点击跳转)

0:00开场 · 两个战场1:17
1:17第一段 · 先治最要命的病1:37
2:55第二段 · 一页一个主题,标题是那张脸1:55
4:50第三段 · 把随缘变成可观测2:26
7:16第四段 · 你争的东西变了2:57
10:14第五段 · 四个杠杆3:29
13:44第六段 · 仪表盘,和一个绕不开的取舍2:06
15:51末段 · 可带走的判断清单1:11
解读全文

pm55-m7 解读与音频稿件 · 两个战场 · SEO 最低可行清单与 GEO

  • 模块:M7 商业与合规
  • 课节:SEO 最低可行清单(能被抓 / 能被读懂 / 能被收录) / GEO 让 AI 引擎愿意引用你
  • 配套音频:pm55-m7-播客.mp3
  • 配套字幕:pm55-m7-播客.srt

一、本集解决什么问题

产品做好了,内容也写了,可就是没人找得到你。更麻烦的是,「被找到」这件事已经裂成了两个战场:

战场用户行为你争的是什么内容被怎么消费
SEO(搜索引擎)在搜索框敲关键词十条蓝色链接里的排位与点击用户进站读全文
GEO(生成式引擎)把问题直接丢给对话式助手答案里的一句引用、一个署名AI 摘走「能独立成立」的那一段

为什么产品经理必须关心:自然流量是独立开发者和小团队唯一付得起的获客方式。而第二个战场你不去争,也不会收到任何提醒——它只是安静地不发生。

好消息是两者不冲突。SEO 的最低可行清单正是 GEO 的地基,AI 引擎同样从抓取和索引开始。GEO 要加的,是它自己特有的四个杠杆。

二、能力地图

层级能力具体表现验证方式
L1 抓取层能被抓关键页面正文在 HTML 源码里,不依赖 JS 渲染右键「查看源代码」能直接看到文字
L2 理解层能被读懂一页一个主题,title 是用户会搜的问题句说得出每页回答的是哪个问题
L3 索引层能被收录sitemap / robots / canonical / 站长平台四件套齐site: 查得到收录数且有基线
L4 引用层自包含段落每页开头两三句直接给答案,摘走仍成立随机摘一段问自己:单独读成立吗
L5 结构化层机器可读FAQPage 结构化数据 + 日期信号富媒体测试通过,日期与 git 记录一致
L6 观测层有仪表盘AI 爬虫 UA 单独归档,按天看抓取量能看到抓取量曲线,且与发版节奏相关

能力依赖关系:L1 不通,L2/L3 全部归零(抓到空壳,后面做得再好也没用);L4 是跨越两个战场的最小一步,也是性价比最高的一步;L6 是唯一诚实的反馈环——没有它,前五层做得对不对都无法验证。

提示1 · 先过三组,再谈内容质量

这是本集最省钱的顺序。能被抓、能被读懂、能被收录,缺任何一组,后面写得多好都归零。上线那天用十项清单打一遍分,缺哪补哪,而不是先去研究外链和词库。


三、能被抓:先治最要命的病

AI 生成前端的头号病:偏爱单页应用——页面打开先是个空壳,内容由 JS 请求数据再渲染出来。用户看到的一切正常,爬虫拿到的是另一回事。

  • 主流引擎宣称能执行 JS,但执行有配额、有延迟,小站排不上优先队列
  • 多数 AI 爬虫干脆不执行 JS,抓到什么算什么

对策不用推翻架构:关键页面(首页、功能页、文章页)保证 HTML 源码里就有正文,交互部分继续用 JS 没问题。用 AI 写页面时把这句写进提示词,成本为零。

核对方法简单到不像话:右键 → 查看源代码,能不能直接看到文字。


四、能被读懂:一页一个主题

原则只有一条:一页回答一个问题。 什么都讲的页面,引擎不知道该在什么问题下展示它,最后哪个问题都轮不到。

搜索结果页文案急诊室(三个真实病例)

病例原标题 / 描述病在哪改法
首页「首页 - 发票猫头鹰」/「欢迎访问本站。」「首页」两个字没回答任何问题改成用户会搜的那句话:谁、干什么、给谁用
功能页「功能介绍 \强大的智能化一站式解决方案」/「赋能广大用户,打造极致体验」「智能化 / 赋能 / 极致体验」黑话三件套把功能名和用户的原话写进去,一个词都别浪费
帮助文档「帮助文档 - 页面 3」/「本页包含常见问题的解答」「页面 3」是给数据库看的帮助文档是长尾流量金矿:每篇回答一个具体问题,title 就写那个问题本身

规律是同一个:title 写用户会搜的那句话,description 写这页能帮他做什么。 两行字加起来百来个字符,是你在搜索结果页里唯一的开口机会。

常见纠结:炫和被搜到冲突吗?不冲突,但有先后——先保证 HTML 里有完整正文,动画和交互往上叠加。

五、能被收录:把「随缘」变成「可观测」

四样东西,一个下午能全部做完:

动作做什么为什么值得 / 坑
sitemap.xml根目录 XML 列出全部页面地址;多语言站每个 URL 用 hreflang 互指引擎照清单抓。本站 2026 年 8 月补上英韩页面后,条目从约 330 涨到约 950
robots.txt根目录文本,声明欢迎抓 / 别抓的路径,末尾指向 sitemap爬虫进站看的第一个文件。写错一行 Disallow: / 能把全站封掉
canonical每页 head 一行 <link rel="canonical"> 声明正式地址带参数、多入口指向同一页时,权重不会自己人分自己人的票
站长平台提交Google Search Console + Bing Webmaster 各注册一次,验证域名、提交 sitemap收录数、抓取错误、展示次数全部有报表。Bing 顺手开 IndexNow

这些都不需要每天维护:sitemap 让构建脚本自动生成,站长平台每周看一眼报表。

给 AI 的一段固定提示词


页面要求:正文写在 HTML 源码里,不依赖 JS 渲染;每页一个主题;
title 写成用户会搜索的问题句,40 字以内;meta description 写这页能帮用户做什么,
80 字以内;每页加 canonical;新增页面记得更新 sitemap 生成逻辑。
能进提示词和脚本的要求,就别放进记忆和自觉里。一段话的成本,换来每个新页面天生合格。

提示2 · 全站收录突然掉到 0,第一件事看 robots.txt

上线两个月全站收录归零,最高频的原因不是被举报、不是算法惩罚,而是爬虫协议文件里多了一行禁止抓取全部(测试期加的,上线忘了删)。这是一击命中率最高的排查动作。


六、GEO:你争的东西变了

引用竞标现场(三个候选的命运)

候选内容特征命运理由
某产品博客「定价是一门艺术,也是一门科学……在深入探讨之前,让我们先回顾」落选读完问题一个字都没被回答,AI 摘不出能独立成立的句子
某独立开发者复盘三档定价 + 同类产品六到八折 + 2026 年个人效率工具每月 30–60 元 + 自身从 19 元涨到 39 元、付费率 2.1% → 1.7%、收入涨六成被引用自包含:有做法、有价格区间、有第一手数据
某问答社区高赞「这个问题问得好……主要看你的用户群体……有兴趣可以看我主页置顶」落选信息密度为零,关键内容在段落之外;AI 不会替你跳转
规律:AI 挑的是能单独摘走、摘走之后依然成立的段落。

七、四个杠杆与速查表

杠杆做法工期验收方式
一句话答案块H1 下先用两三句把问题直接答掉:是什么、为什么重要、一句话记住存量页批量补需几天随机摘一段问自己:单独读成立吗
FAQPage 结构化数据问答页放 JSON-LD,机器可读地声明问题与答案脚本活,半天Google 富媒体测试通过
llms.txt / llms-full.txt根目录 Markdown 站点导览;加强版把全站正文拼成一个大文件脚本活,半天根目录可访问,随构建更新
日期信号JSON-LD 带 datePublished / dateModified,日期从 git 提交记录取脚本活,两小时抽查日期与 git 记录一致

反面例子:某页讲接口限流,开头是「在当今快速发展的互联网时代……本文将带你一步步了解限流的方方面面」——可引用度很低。

提示3 · 结构化数据必须和页面可见内容一致

页面上没有的问答,别塞进 JSON-LD。那属于给引擎和用户两套内容,是一条碰不得的线。这条纪律比杠杆本身更重要,因为它决定了你是长期资产还是短期投机。

llms.txt 是 2024 年由社区提出的民间约定(llmstxt.org),不是官方标准,各家 AI 引擎支持程度不一且在变化。它成本极低(一个脚本自动生成),赌的是「让 AI 读懂你的成本越低,被引用的机会越大」这个朴素逻辑。本站 llms.txt 覆盖全部 317 节课的目录和描述,llms-full.txt 体积一到两兆。

八、爬虫点名册:GEO 的仪表盘

GEO 做没做进去,最诚实的信号是AI 爬虫来没来、来得勤不勤——它们都在请求日志的 User-Agent 里留名。

类型职责备注
训练语料类给模型训练收集语料来得勤=内容在进未来模型的知识库
对话搜索类服务对话产品的搜索功能,与训练爬虫分开想被搜到就别拦
助手语料类给某助手收集语料抓取节奏通常比较克制
答案引擎类服务答案引擎的实时检索每条答案都带引用,最容易观测 GEO 效果
训练开关类控制内容能否用于训练的开关标识拦它不影响正常搜索收录
中文站常客类国内对话产品背后的爬虫中文站常客,抓取量常常大得惊人

很多统计工具默认把 bot 流量全丢掉,等于把 GEO 的唯一仪表盘扔了。 把这几类 UA 单独归档、按天看抓取量,曲线上升就是内容在进 AI 索引的直接证据。

一条暗线

主流对话产品的联网搜索大量依赖 Bing 的索引——Bing 收录得少,对话产品就搜不到你。这就是第五节要求「两个平台都要提交」的原因。

提示4 · 拦不拦训练类爬虫,是立场问题不是技术问题

拦了,内容不进未来模型的知识库;不拦,等于免费供料。本站的选择是全放行,因为免费课的目标本来就是被更多人(和 AI)学到。你的站自己权衡,robots.txt 里一行就能表态。

被 AI 转述该哭该笑?看内容定位:通用知识被转述换来署名曝光,产品和第一手经验才是要用户进站的部分。内容分层设计,别一刀切拦爬虫。


九、审查清单

上线前逐条自检,任一为「否」都需要回到对应章节补做:

  • 正文进源码:首页 / 功能页 / 文章页右键查看源代码,能直接看到文字?
  • 一页一主题:说不清这页回答什么问题的页面,是否已拆开或合并?
  • title 说人话:是否写成了用户会搜的问题句,而不是「首页」「页面 3」?
  • description 写价值:是否写清这页能帮用户做什么,而不是欢迎语?
  • sitemap 随内容更新:是否由构建脚本自动生成,而非手动维护?
  • robots 没误封:上线时是否删掉了测试期的全站禁止抓取?用站长工具验证过吗?
  • canonical 已加:带参数地址、多入口页面是否都声明了正式地址?
  • 两个平台都提交:Google 与 Bing 是否都已验证并提交 sitemap?
  • 有收录基线:是否用 site: 查过收录数并记录?没有基线就没有「改善」。
  • 一句话答案块:每页 H1 下两三句,单独摘走仍成立?
  • 结构化数据一致:JSON-LD 内容是否全部来自页面可见内容?
  • 爬虫日志归档:AI 爬虫 UA 是否单独归档、按天可看?

十、约束说明

本集的判断与数字,均在以下约束边界内成立:

  1. 适用对象约束:「最低可行」清单面向一个人或小团队的产品站。有团队有预算的公司,外链建设、竞品词库、站群那套逻辑另算,不在本集射程内。
  2. 时效性约束:文中本站数据均注明口径日期(sitemap 约 330 → 约 950 为 2026 年 8 月改造后数据;llms.txt 覆盖 317 节课为 2026-08-10 口径)。引擎算法与爬虫策略变动频繁,具体数字请替换为自己的实测基线。
  3. llms.txt 非标准约束:这是 2024 年社区提案(llmstxt.org),不是官方标准,各家 AI 引擎支持程度以官方文档为准,不应作为唯一投入方向。
  4. 一致性约束:结构化数据必须与页面可见内容一致,这是合规红线而非优化建议。
  5. 立场约束:是否放行训练类爬虫取决于内容定位(免费课求传播 vs 付费内容求留存),没有技术上的标准答案。

提示5 · 两个战场的共同底座是「可观测」

SEO 侧靠站长平台报表把收录变成数字,GEO 侧靠爬虫 UA 归档把引用变成曲线。这两件事的共同点是——先有仪表盘,再有优化。没有基线的改善,都是自我感觉。


十一、可带走的判断清单

  1. 先过三组,再谈内容质量:能被抓、能被读懂、能被收录,缺任何一组后面都归零。
  2. title 写用户会搜的那句话,description 写这页能帮他做什么:这是结果页里唯一的开口机会。
  3. 每页开头两三句直接给答案:这一段要能单独摘走还成立,是跨到新战场最小也最划算的一步。
  4. 能进提示词和脚本的要求,别放进记忆和自觉:站点地图自动生成、日期从提交记录取、页面要求写进项目规则。
  5. 两个平台都要提交,并把机器流量单独归档:Bing 收录数决定对话产品能否搜到你,爬虫曲线是唯一诚实的仪表盘。

内容来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》),本集取材于「被搜到」专题第 2、3 节,为二次演绎配音版。