第 7 章 · 第 55 讲 · 17:02
产品做好了,内容也写了,可就是没人找得到你。更麻烦的是,「被找到」这件事已经裂成了两个战场:
| 战场 | 用户行为 | 你争的是什么 | 内容被怎么消费 |
|---|---|---|---|
| SEO(搜索引擎) | 在搜索框敲关键词 | 十条蓝色链接里的排位与点击 | 用户进站读全文 |
| GEO(生成式引擎) | 把问题直接丢给对话式助手 | 答案里的一句引用、一个署名 | AI 摘走「能独立成立」的那一段 |
为什么产品经理必须关心:自然流量是独立开发者和小团队唯一付得起的获客方式。而第二个战场你不去争,也不会收到任何提醒——它只是安静地不发生。
好消息是两者不冲突。SEO 的最低可行清单正是 GEO 的地基,AI 引擎同样从抓取和索引开始。GEO 要加的,是它自己特有的四个杠杆。
| 层级 | 能力 | 具体表现 | 验证方式 |
|---|---|---|---|
| L1 抓取层 | 能被抓 | 关键页面正文在 HTML 源码里,不依赖 JS 渲染 | 右键「查看源代码」能直接看到文字 |
| L2 理解层 | 能被读懂 | 一页一个主题,title 是用户会搜的问题句 | 说得出每页回答的是哪个问题 |
| L3 索引层 | 能被收录 | sitemap / robots / canonical / 站长平台四件套齐 | site: 查得到收录数且有基线 |
| L4 引用层 | 自包含段落 | 每页开头两三句直接给答案,摘走仍成立 | 随机摘一段问自己:单独读成立吗 |
| L5 结构化层 | 机器可读 | FAQPage 结构化数据 + 日期信号 | 富媒体测试通过,日期与 git 记录一致 |
| L6 观测层 | 有仪表盘 | AI 爬虫 UA 单独归档,按天看抓取量 | 能看到抓取量曲线,且与发版节奏相关 |
能力依赖关系:L1 不通,L2/L3 全部归零(抓到空壳,后面做得再好也没用);L4 是跨越两个战场的最小一步,也是性价比最高的一步;L6 是唯一诚实的反馈环——没有它,前五层做得对不对都无法验证。
这是本集最省钱的顺序。能被抓、能被读懂、能被收录,缺任何一组,后面写得多好都归零。上线那天用十项清单打一遍分,缺哪补哪,而不是先去研究外链和词库。
AI 生成前端的头号病:偏爱单页应用——页面打开先是个空壳,内容由 JS 请求数据再渲染出来。用户看到的一切正常,爬虫拿到的是另一回事。
对策不用推翻架构:关键页面(首页、功能页、文章页)保证 HTML 源码里就有正文,交互部分继续用 JS 没问题。用 AI 写页面时把这句写进提示词,成本为零。
核对方法简单到不像话:右键 → 查看源代码,能不能直接看到文字。
原则只有一条:一页回答一个问题。 什么都讲的页面,引擎不知道该在什么问题下展示它,最后哪个问题都轮不到。
| 病例 | 原标题 / 描述 | 病在哪 | 改法 | |
|---|---|---|---|---|
| 首页 | 「首页 - 发票猫头鹰」/「欢迎访问本站。」 | 「首页」两个字没回答任何问题 | 改成用户会搜的那句话:谁、干什么、给谁用 | |
| 功能页 | 「功能介绍 \ | 强大的智能化一站式解决方案」/「赋能广大用户,打造极致体验」 | 「智能化 / 赋能 / 极致体验」黑话三件套 | 把功能名和用户的原话写进去,一个词都别浪费 |
| 帮助文档 | 「帮助文档 - 页面 3」/「本页包含常见问题的解答」 | 「页面 3」是给数据库看的 | 帮助文档是长尾流量金矿:每篇回答一个具体问题,title 就写那个问题本身 |
规律是同一个:title 写用户会搜的那句话,description 写这页能帮他做什么。 两行字加起来百来个字符,是你在搜索结果页里唯一的开口机会。
常见纠结:炫和被搜到冲突吗?不冲突,但有先后——先保证 HTML 里有完整正文,动画和交互往上叠加。
四样东西,一个下午能全部做完:
| 动作 | 做什么 | 为什么值得 / 坑 |
|---|---|---|
| sitemap.xml | 根目录 XML 列出全部页面地址;多语言站每个 URL 用 hreflang 互指 | 引擎照清单抓。本站 2026 年 8 月补上英韩页面后,条目从约 330 涨到约 950 |
| robots.txt | 根目录文本,声明欢迎抓 / 别抓的路径,末尾指向 sitemap | 爬虫进站看的第一个文件。写错一行 Disallow: / 能把全站封掉 |
| canonical | 每页 head 一行 <link rel="canonical"> 声明正式地址 | 带参数、多入口指向同一页时,权重不会自己人分自己人的票 |
| 站长平台提交 | Google Search Console + Bing Webmaster 各注册一次,验证域名、提交 sitemap | 收录数、抓取错误、展示次数全部有报表。Bing 顺手开 IndexNow |
这些都不需要每天维护:sitemap 让构建脚本自动生成,站长平台每周看一眼报表。
页面要求:正文写在 HTML 源码里,不依赖 JS 渲染;每页一个主题;
title 写成用户会搜索的问题句,40 字以内;meta description 写这页能帮用户做什么,
80 字以内;每页加 canonical;新增页面记得更新 sitemap 生成逻辑。
能进提示词和脚本的要求,就别放进记忆和自觉里。一段话的成本,换来每个新页面天生合格。
上线两个月全站收录归零,最高频的原因不是被举报、不是算法惩罚,而是爬虫协议文件里多了一行禁止抓取全部(测试期加的,上线忘了删)。这是一击命中率最高的排查动作。
| 候选 | 内容特征 | 命运 | 理由 |
|---|---|---|---|
| 某产品博客 | 「定价是一门艺术,也是一门科学……在深入探讨之前,让我们先回顾」 | 落选 | 读完问题一个字都没被回答,AI 摘不出能独立成立的句子 |
| 某独立开发者复盘 | 三档定价 + 同类产品六到八折 + 2026 年个人效率工具每月 30–60 元 + 自身从 19 元涨到 39 元、付费率 2.1% → 1.7%、收入涨六成 | 被引用 | 自包含:有做法、有价格区间、有第一手数据 |
| 某问答社区高赞 | 「这个问题问得好……主要看你的用户群体……有兴趣可以看我主页置顶」 | 落选 | 信息密度为零,关键内容在段落之外;AI 不会替你跳转 |
规律:AI 挑的是能单独摘走、摘走之后依然成立的段落。
| 杠杆 | 做法 | 工期 | 验收方式 |
|---|---|---|---|
| 一句话答案块 | H1 下先用两三句把问题直接答掉:是什么、为什么重要、一句话记住 | 存量页批量补需几天 | 随机摘一段问自己:单独读成立吗 |
| FAQPage 结构化数据 | 问答页放 JSON-LD,机器可读地声明问题与答案 | 脚本活,半天 | Google 富媒体测试通过 |
| llms.txt / llms-full.txt | 根目录 Markdown 站点导览;加强版把全站正文拼成一个大文件 | 脚本活,半天 | 根目录可访问,随构建更新 |
| 日期信号 | JSON-LD 带 datePublished / dateModified,日期从 git 提交记录取 | 脚本活,两小时 | 抽查日期与 git 记录一致 |
反面例子:某页讲接口限流,开头是「在当今快速发展的互联网时代……本文将带你一步步了解限流的方方面面」——可引用度很低。
页面上没有的问答,别塞进 JSON-LD。那属于给引擎和用户两套内容,是一条碰不得的线。这条纪律比杠杆本身更重要,因为它决定了你是长期资产还是短期投机。
llms.txt 是 2024 年由社区提出的民间约定(llmstxt.org),不是官方标准,各家 AI 引擎支持程度不一且在变化。它成本极低(一个脚本自动生成),赌的是「让 AI 读懂你的成本越低,被引用的机会越大」这个朴素逻辑。本站 llms.txt 覆盖全部 317 节课的目录和描述,llms-full.txt 体积一到两兆。
GEO 做没做进去,最诚实的信号是AI 爬虫来没来、来得勤不勤——它们都在请求日志的 User-Agent 里留名。
| 类型 | 职责 | 备注 |
|---|---|---|
| 训练语料类 | 给模型训练收集语料 | 来得勤=内容在进未来模型的知识库 |
| 对话搜索类 | 服务对话产品的搜索功能,与训练爬虫分开 | 想被搜到就别拦 |
| 助手语料类 | 给某助手收集语料 | 抓取节奏通常比较克制 |
| 答案引擎类 | 服务答案引擎的实时检索 | 每条答案都带引用,最容易观测 GEO 效果 |
| 训练开关类 | 控制内容能否用于训练的开关标识 | 拦它不影响正常搜索收录 |
| 中文站常客类 | 国内对话产品背后的爬虫 | 中文站常客,抓取量常常大得惊人 |
很多统计工具默认把 bot 流量全丢掉,等于把 GEO 的唯一仪表盘扔了。 把这几类 UA 单独归档、按天看抓取量,曲线上升就是内容在进 AI 索引的直接证据。
主流对话产品的联网搜索大量依赖 Bing 的索引——Bing 收录得少,对话产品就搜不到你。这就是第五节要求「两个平台都要提交」的原因。
拦了,内容不进未来模型的知识库;不拦,等于免费供料。本站的选择是全放行,因为免费课的目标本来就是被更多人(和 AI)学到。你的站自己权衡,robots.txt 里一行就能表态。
被 AI 转述该哭该笑?看内容定位:通用知识被转述换来署名曝光,产品和第一手经验才是要用户进站的部分。内容分层设计,别一刀切拦爬虫。
上线前逐条自检,任一为「否」都需要回到对应章节补做:
site: 查过收录数并记录?没有基线就没有「改善」。本集的判断与数字,均在以下约束边界内成立:
SEO 侧靠站长平台报表把收录变成数字,GEO 侧靠爬虫 UA 归档把引用变成曲线。这两件事的共同点是——先有仪表盘,再有优化。没有基线的改善,都是自我感觉。
内容来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》),本集取材于「被搜到」专题第 2、3 节,为二次演绎配音版。