1
00:00:00,100 --> 00:00:06,432
本内容改编自小山学堂《学 AI 产品，从入门到精通》，为二次演绎配音版。

2
00:00:06,382 --> 00:00:10,649
这一集要解决的，是一个做完之后才发现的问题。

3
00:00:10,649 --> 00:00:15,048
产品做好了，内容也写了，可就是没人找得到你。

4
00:00:15,048 --> 00:00:19,951
更麻烦的是，现在「被找到」这件事已经裂成了两个战场。

5
00:00:19,951 --> 00:00:26,634
一个是老的，用户在搜索框里敲关键词，你争的是十条蓝色链接里的排位。

6
00:00:26,634 --> 00:00:36,983
另一个是新的，用户把问题直接丢给对话式助手，答案由人工智能组织好端到他面前，你争的是答案里的一句引用、一个署名。

7
00:00:36,983 --> 00:00:39,314
为什么产品经理要关心。

8
00:00:39,314 --> 00:00:47,956
因为这两个战场决定了自然流量的天花板，而自然流量是独立开发者和小团队唯一付得起的获客方式。

9
00:00:47,956 --> 00:00:54,735
更现实的是，第二个战场你不去争，也不会收到任何提醒，它只是安静地不发生。

10
00:00:54,735 --> 00:00:56,514
这一集分六段。

11
00:00:56,514 --> 00:01:02,139
前三段讲老战场的三组基本功，能被抓、能被读懂、能被收录。

12
00:01:02,139 --> 00:01:06,129
第四段讲两个战场到底在争什么不同的东西。

13
00:01:06,129 --> 00:01:09,026
第五段讲新战场的四个杠杆。

14
00:01:09,026 --> 00:01:13,653
第六段讲怎么观测效果，以及一个绕不开的取舍。

15
00:01:13,653 --> 00:01:17,199
最后一段，是可带走的判断清单。

16
00:01:17,360 --> 00:01:20,098
先说清楚什么叫最低可行。

17
00:01:20,048 --> 00:01:30,228
传统那套搜索优化是个大行业，外链建设、竞品词库、站群、老域名，那套东西面向的是有团队有预算的公司。

18
00:01:30,228 --> 00:01:33,906
一个人做产品去学那些，是浪费生命。

19
00:01:33,906 --> 00:01:43,173
好消息是，搜索引擎这些年一直在把游戏往一个方向推，把内容做好、把技术障碍清掉的站，自然会被善待。

20
00:01:43,173 --> 00:01:48,582
所以最低可行的逻辑只有一句，只做那些不做就直接出局的事。

21
00:01:48,582 --> 00:01:53,401
它们正好分成三组，能被抓、能被读懂、能被收录。

22
00:01:53,401 --> 00:01:56,935
三组都通了，剩下的交给内容质量。

23
00:01:56,935 --> 00:02:01,154
第一组是能被抓，也就是爬虫来了能拿到正文。

24
00:02:01,154 --> 00:02:03,870
抓到空壳，后面全归零。

25
00:02:03,870 --> 00:02:09,171
这里有个头号病，而且它几乎是人工智能生成前端的标配。

26
00:02:09,171 --> 00:02:16,767
现在的页面偏爱做成单页应用，打开先是个空壳，内容由脚本请求数据再渲染出来。

27
00:02:16,767 --> 00:02:21,130
用户看到的一切正常，爬虫拿到的是另一回事。

28
00:02:21,130 --> 00:02:32,067
主流引擎宣称能执行脚本，但执行有配额、有延迟，小站排不上优先队列；多数人工智能爬虫干脆不执行脚本，抓到什么算什么。

29
00:02:32,067 --> 00:02:34,086
对策不用推翻架构。

30
00:02:34,086 --> 00:02:42,885
关键页面，也就是首页、功能页、文章页，保证网页源码里就有正文，交互部分继续用脚本没问题。

31
00:02:42,885 --> 00:02:48,738
用人工智能写页面的时候，把这句要求写进提示词，成本为零。

32
00:02:48,738 --> 00:02:55,144
核对方法也简单到不像话，右键查看源代码，能不能直接看到文字。

33
00:02:55,300 --> 00:02:58,531
能被抓之后，第二组是能被读懂。

34
00:02:58,481 --> 00:03:01,630
原则只有一条，一页回答一个问题。

35
00:03:01,630 --> 00:03:09,226
什么都讲的页面，引擎不知道该在什么问题下展示它，最后的结果往往是哪个问题都轮不到。

36
00:03:09,226 --> 00:03:14,226
主题定了，标题和描述就是这一页在搜索结果里的脸。

37
00:03:14,226 --> 00:03:17,724
用户扫一眼这两行字，决定点不点。

38
00:03:17,724 --> 00:03:19,671
看三个真实病例。

39
00:03:19,671 --> 00:03:24,959
第一个病例写的是「首页，某某产品」，描述是「欢迎访问本站」。

40
00:03:24,959 --> 00:03:28,757
问题在于「首页」两个字没有回答任何问题。

41
00:03:28,757 --> 00:03:33,433
改成用户会搜的那句话，谁、干什么、给谁用。

42
00:03:33,433 --> 00:03:39,635
描述别写欢迎语，写清这页能帮用户解决什么，它就是你的免费广告位。

43
00:03:39,635 --> 00:03:50,668
第二个病例写的是「功能介绍，强大的智能化一站式解决方案」，描述是「我们采用先进的人工智能技术，赋能广大用户，打造极致体验」。

44
00:03:50,668 --> 00:03:59,370
智能化、赋能、极致体验，这是黑话三件套，用户不会搜这些词，引擎也不知道这页在讲什么。

45
00:03:59,370 --> 00:04:03,841
把功能名和用户的原话写进去，一个词都别浪费。

46
00:04:03,841 --> 00:04:12,014
第三个病例写的是「帮助文档，页面三」，描述是「本页包含常见问题的解答，如有疑问请联系客服」。

47
00:04:12,014 --> 00:04:15,897
页面三是给数据库看的，不是给人看的。

48
00:04:15,897 --> 00:04:24,863
可帮助文档偏偏是长尾流量的金矿，每篇回答一个具体问题，标题就写那个问题本身，搜的人自己送上门。

49
00:04:24,863 --> 00:04:27,519
三个改完，规律是同一个。

50
00:04:27,519 --> 00:04:32,279
标题写用户会搜的那句话，描述写这页能帮他做什么。

51
00:04:32,279 --> 00:04:37,760
两行字加起来百来个字符，是你在搜索结果页里唯一的开口机会。

52
00:04:37,760 --> 00:04:42,243
顺带回答一个常见纠结，炫和被搜到冲突吗。

53
00:04:42,243 --> 00:04:44,538
不冲突，但有先后。

54
00:04:44,538 --> 00:04:50,752
先保证源码里有完整正文，动画和交互往上叠加，这个顺序不能倒。

55
00:04:50,910 --> 00:04:52,999
第三组是能被收录。

56
00:04:52,949 --> 00:04:58,838
抓得到、读得懂之后，最后一组动作是主动把站送到引擎面前。

57
00:04:58,838 --> 00:05:06,062
四样东西，一个下午能全部做完，做完收录就从玄学变成一个能看数字的过程。

58
00:05:06,062 --> 00:05:08,213
第一样，站点地图。

59
00:05:08,213 --> 00:05:12,793
一个文件列出你全部页面的地址，放在站点根目录。

60
00:05:12,793 --> 00:05:19,007
多语言站每个网址还要用多语言互指标记，把各语言版本互相指一遍。

61
00:05:19,007 --> 00:05:23,153
引擎照着清单抓，不用自己摸索你的站有几页。

62
00:05:23,153 --> 00:05:31,242
本站二零二六年八月补上英文和韩文页面之后，站点地图条目从约三百三十涨到约九百五十。

63
00:05:31,242 --> 00:05:33,694
第二样，爬虫协议文件。

64
00:05:33,694 --> 00:05:41,314
根目录下的一个文本文件，声明哪些路径欢迎抓、哪些别抓，末尾指向站点地图的地址。

65
00:05:41,314 --> 00:05:50,088
它是爬虫进站看的第一个文件，写错一行禁止抓取全部，能把整站封掉，改完务必用站长工具验证。

66
00:05:50,088 --> 00:05:52,709
第三样，正式地址声明。

67
00:05:52,709 --> 00:05:56,795
每页头部加一行，声明这一页的正式地址。

68
00:05:56,795 --> 00:06:06,374
带参数的地址、多个入口指向同一页的时候，引擎知道该把权重记在谁头上，不会自己人分自己人的票。

69
00:06:06,374 --> 00:06:09,019
第四样，站长平台提交。

70
00:06:09,019 --> 00:06:13,910
谷歌和必应各注册一次，验证域名、提交站点地图。

71
00:06:13,910 --> 00:06:19,728
必应那边顺手开通即时推送，发版之后把变更页面的地址推给它。

72
00:06:19,728 --> 00:06:24,487
从此收录数、抓取错误、展示次数全部有报表。

73
00:06:24,487 --> 00:06:29,451
这里特别提醒一句，别只提交谷歌，原因第六段会讲。

74
00:06:29,451 --> 00:06:31,987
这四样都不需要每天维护。

75
00:06:31,987 --> 00:06:38,502
站点地图让构建脚本自动生成，站长平台每周看一眼报表，就够了。

76
00:06:38,502 --> 00:06:44,187
这一节的多数要求，可以在让人工智能写页面的时候一次性说清。

77
00:06:44,187 --> 00:06:47,769
把它贴进项目提示词或者规则文件里。

78
00:06:47,769 --> 00:07:05,525
页面正文写在网页源码里，不依赖脚本渲染；每页一个主题；标题写成用户会搜索的问题句，四十字以内；描述写这页能帮用户做什么，八十字以内；每页加正式地址声明；新增页面记得更新站点地图生成逻辑。

79
00:07:05,525 --> 00:07:09,744
一段话的成本，换来每个新页面天生合格。

80
00:07:09,744 --> 00:07:16,943
这也是本章反复出现的模式，能进提示词和脚本的要求，就别放进记忆和自觉里。

81
00:07:17,070 --> 00:07:18,858
现在说新战场。

82
00:07:18,808 --> 00:07:23,857
越来越多的用户跳过搜索框，直接把问题丢给对话式助手。

83
00:07:23,857 --> 00:07:29,734
答案由人工智能组织，你的站在不在答案里，成了一条新的生死线。

84
00:07:29,734 --> 00:07:33,628
这门手艺有个名字，叫生成式引擎优化。

85
00:07:33,628 --> 00:07:37,787
把它和搜索优化放在一起看，差别就清楚了。

86
00:07:37,787 --> 00:07:46,357
用户看到的东西不一样，搜索给一排链接让他自己挑，人工智能直接给一段答案，而且已经替他挑完了。

87
00:07:46,357 --> 00:07:53,893
你争的东西不一样，搜索争排名和点击，人工智能这边争被引用、被推荐、被当作出处。

88
00:07:53,893 --> 00:08:01,873
内容被消费的方式也不一样，搜索是用户进站读全文，人工智能是摘走能独立成立的那一段。

89
00:08:01,873 --> 00:08:04,265
好消息是两者不冲突。

90
00:08:04,265 --> 00:08:12,751
前三段那套最低可行清单，正是生成式引擎优化的地基，人工智能引擎同样从抓取和索引开始。

91
00:08:12,751 --> 00:08:16,381
新战场要加的，是它特有的四个杠杆。

92
00:08:16,381 --> 00:08:20,143
在讲杠杆之前，先请你当一次人工智能。

93
00:08:20,143 --> 00:08:23,857
用户问，个人开发者的产品怎么定价。

94
00:08:23,857 --> 00:08:27,703
检索回来三段候选，逐段看它们的命运。

95
00:08:27,703 --> 00:08:42,430
第一段来自某产品博客，写的是定价是一门艺术，也是一门科学，正如我们在上一篇文章中提到的，很多因素都会影响你的决策，在深入探讨之前，让我们先回顾一下什么是价值主张。

96
00:08:42,430 --> 00:08:45,844
读完这段，问题一个字都没被回答。

97
00:08:45,844 --> 00:08:50,675
它在铺垫、在引用自己的上一篇、在即将深入探讨。

98
00:08:50,675 --> 00:08:55,820
人工智能摘不出任何能独立成立的句子，只能放弃。

99
00:08:55,820 --> 00:08:59,606
很多人的文章通篇都是这种「即将说到」体。

100
00:08:59,606 --> 00:09:02,695
第二段来自某独立开发者的复盘。

101
00:09:02,695 --> 00:09:16,240
个人开发者定价的常见做法是三档，免费档给核心功能拉新，标准档定在同类产品的六到八折，二零二六年个人效率工具普遍在每月三十到六十元，专业档放团队功能。

102
00:09:16,240 --> 00:09:24,906
我的工具站从每月十九元涨到三十九元，付费率从百分之二点一降到百分之一点七，但收入涨了六成。

103
00:09:24,906 --> 00:09:33,872
这段被引用，因为它自包含，单独摘出来仍是一个完整回答，有具体做法、有价格区间、有第一手数据。

104
00:09:33,872 --> 00:09:37,370
据一位独立开发者的实测」就是这么来的。

105
00:09:37,370 --> 00:09:40,807
第三段来自某问答社区的高赞回答。

106
00:09:40,807 --> 00:09:53,259
这个问题问得好，楼上说的都有道理，我补充一点，其实定价没有标准答案，主要看你的用户群体，我之前踩过坑，说多了都是泪，有兴趣可以看我主页置顶。

107
00:09:53,259 --> 00:10:01,300
口语化没问题，问题是信息密度为零，没有数字、没有做法，关键内容还要跳去主页置顶。

108
00:10:01,300 --> 00:10:06,168
人工智能不会替你跳转，段落之外的东西等于不存在。

109
00:10:06,168 --> 00:10:08,740
三段看完，规律浮出来了。

110
00:10:08,740 --> 00:10:14,461
人工智能挑的是能单独摘走、摘走之后依然成立的段落。

111
00:10:14,600 --> 00:10:18,552
第一个杠杆，每页开头给一段一句话答案。

112
00:10:18,502 --> 00:10:26,038
自包含段落最省力的落法，就是在一级标题下面，先用两三句话把这页的问题直接答掉。

113
00:10:26,038 --> 00:10:29,524
是什么、为什么重要、一句话记住。

114
00:10:29,524 --> 00:10:32,372
剩下的正文再展开细节。

115
00:10:32,372 --> 00:10:37,168
用户扫一眼有收获，人工智能摘一段能引用，双赢。

116
00:10:37,168 --> 00:10:39,187
对照一个反面例子。

117
00:10:39,187 --> 00:10:57,725
某页讲接口限流，开头写的是，在当今快速发展的互联网时代，接口已经成为系统间通信的重要方式，随着业务规模的不断扩大，如何保障服务的稳定性成为了一个值得深入探讨的话题，本文将带你一步步了解限流的方方面面。

118
00:10:57,725 --> 00:10:59,443
可引用度很低。

119
00:10:59,443 --> 00:11:03,482
这个答案前置的写法，和第二段的描述是一对。

120
00:11:03,482 --> 00:11:09,467
描述给搜索结果页看，一句话答案块给人工智能和赶时间的读者看。

121
00:11:09,467 --> 00:11:17,496
本站每个课程页标题下面那行一句话速览，就是这个杠杆的落地，全站由构建脚本批量注入。

122
00:11:17,496 --> 00:11:20,777
第二个杠杆，问答页加结构化数据。

123
00:11:20,777 --> 00:11:27,640
如果你的页面本身就是一问一答，帮助文档、常见问题都算，有一个几乎白捡的杠杆。

124
00:11:27,640 --> 00:11:36,487
在页面里放一段机器可读的数据，用固定格式声明这页的问题是什么、答案是什么，引擎不用猜，直接拿走。

125
00:11:36,487 --> 00:11:41,811
别被结构化数据这几个字吓住，它就是一段固定格式的数据块。

126
00:11:41,811 --> 00:11:45,753
生成之后拿富媒体测试工具验一下就行。

127
00:11:45,753 --> 00:11:53,878
本站给三十七个问答页面补上之后，这批原生问题成了全站最容易被人工智能引用的页面。

128
00:11:53,878 --> 00:11:55,994
这里顺带立一条纪律。

129
00:11:55,994 --> 00:11:59,804
结构化数据必须和页面可见内容一致。

130
00:11:59,804 --> 00:12:06,763
页面上没有的问答，别塞进去，那属于给引擎和用户两套内容，这条线碰不得。

131
00:12:06,763 --> 00:12:10,369
第三个杠杆，给人工智能的导览文件。

132
00:12:10,369 --> 00:12:18,770
爬虫协议文件告诉爬虫哪能去哪不能去，导览文件反过来，是主动递给人工智能的一份站点导览。

133
00:12:18,770 --> 00:12:23,999
放在根目录，列出你有什么内容、每页讲什么、地址在哪。

134
00:12:23,999 --> 00:12:31,318
配套还有一个加强版，直接把全站正文拼成一个大文件，人工智能一次就能读完你的站。

135
00:12:31,318 --> 00:12:41,378
要说实话的是，这是二零二四年由社区提出的民间约定，不是官方标准，各家人工智能引擎的支持程度不一，也一直在变。

136
00:12:41,378 --> 00:12:51,006
但它成本极低，一个脚本自动生成，赌的是一个朴素逻辑，让人工智能读懂你的成本越低，被引用的机会越大。

137
00:12:51,006 --> 00:12:57,869
本站的导览文件覆盖全部三百一十七节课的目录和描述，加强版体积一到两兆。

138
00:12:57,869 --> 00:13:01,991
同一节里还有个容易漏的杠杆，新鲜度信号。

139
00:13:01,991 --> 00:13:11,775
在结构化数据里带上发布日期和修改日期，人工智能偏爱能判断时效的内容，尤其是「二零二六年还怎么样吗」这类问题。

140
00:13:11,775 --> 00:13:16,438
日期从版本提交记录里取，脚本一次搞定，别手填。

141
00:13:16,438 --> 00:13:19,395
四件事的性价比放在一起看。

142
00:13:19,395 --> 00:13:27,472
一句话答案块，存量页面批量补需要几天，验收方法是随机摘一段问自己，单独读成立吗。

143
00:13:27,472 --> 00:13:32,592
结构化数据，脚本活半天，验收是富媒体测试通过。

144
00:13:32,592 --> 00:13:38,350
导览文件，脚本活半天，验收是根目录能访问、随构建更新。

145
00:13:38,350 --> 00:13:44,443
日期信号，脚本活两小时，验收是抽查日期与提交记录一致。

146
00:13:44,580 --> 00:13:50,936
做没做进去，有一个最诚实的信号，人工智能的爬虫来没来、来得勤不勤。

147
00:13:50,886 --> 00:13:53,662
它们都会在请求日志里留名。

148
00:13:53,662 --> 00:13:56,415
按职责分，主要就这么几类。

149
00:13:56,415 --> 00:14:03,686
第一类是给模型训练收集语料的，它来得勤，说明你的内容在进未来模型的知识库。

150
00:14:03,686 --> 00:14:10,297
第二类是服务对话产品搜索功能的，和训练爬虫分开，想被搜到就别把它拦了。

151
00:14:10,297 --> 00:14:15,693
第三类是给某个助手收集语料的，抓取节奏通常比较克制。

152
00:14:15,693 --> 00:14:23,145
第四类是服务答案引擎实时检索的，这个平台每条答案都带引用，是最容易观测效果的。

153
00:14:23,145 --> 00:14:29,347
第五类是控制内容能不能用于训练的开关键，拦它不影响正常搜索收录。

154
00:14:29,347 --> 00:14:33,830
第六类是中文站的常客，抓取量常常大得惊人。

155
00:14:33,830 --> 00:14:36,306
去日志里给它们点个名。

156
00:14:36,306 --> 00:14:42,196
很多统计工具默认把机器流量全丢掉，等于把唯一的仪表盘扔了。

157
00:14:42,196 --> 00:14:50,621
把这几类访问标识单独归档、按天看抓取量，曲线上升，就是内容在进人工智能索引的直接证据。

158
00:14:50,621 --> 00:14:53,338
还有一个很多人漏掉的暗线。

159
00:14:53,338 --> 00:14:57,520
主流对话产品的联网搜索，大量依赖必应的索引。

160
00:14:57,520 --> 00:15:01,811
也就是说，必应收录得少，对话产品就搜不到你。

161
00:15:01,811 --> 00:15:06,186
所以第三段让你两个平台都要提交，伏笔在这里。

162
00:15:06,186 --> 00:15:10,886
要不要拦训练类爬虫，这是个立场问题，不是技术问题。

163
00:15:10,886 --> 00:15:16,475
拦了，内容不进未来模型的知识库；不拦，等于免费供料。

164
00:15:16,475 --> 00:15:23,830
本站的选择是全放行，因为免费课的目标本来就是被更多人、也被更多人工智能学到。

165
00:15:23,830 --> 00:15:28,410
你的站自己权衡，爬虫协议文件里一行就能表态。

166
00:15:28,410 --> 00:15:30,898
最后一个焦虑也想清楚。

167
00:15:30,898 --> 00:15:37,605
人工智能把你的教程完整转述给了用户，用户没点进你的站，该哭还是该笑。

168
00:15:37,605 --> 00:15:39,840
答案是看内容定位。

169
00:15:39,840 --> 00:15:47,448
通用知识被转述，换来的是署名曝光；产品和第一手经验，才是要用户进站的部分。

170
00:15:47,448 --> 00:15:50,970
内容分层设计，别一刀切拦爬虫。

171
00:15:51,110 --> 00:15:53,067
最后浓缩成五条。

172
00:15:53,017 --> 00:15:56,598
第一，先过三组，再谈内容质量。

173
00:15:56,598 --> 00:16:02,788
能被抓、能被读懂、能被收录，缺任何一组，后面写得多好都归零。

174
00:16:02,788 --> 00:16:07,115
上线那天用十项清单打一遍分，缺哪补哪。

175
00:16:07,115 --> 00:16:12,512
第二，标题写用户会搜的那句话，描述写这页能帮他做什么。

176
00:16:12,512 --> 00:16:19,122
这两行字是你在搜索结果页里唯一的开口机会，别浪费在欢迎语和黑话上。

177
00:16:19,122 --> 00:16:24,988
第三，每页开头两三句直接给答案，这一段要能单独摘走还成立。

178
00:16:24,988 --> 00:16:30,805
这是从老战场跨到新战场最小的一步，也是性价比最高的一步。

179
00:16:30,805 --> 00:16:35,841
第四，能进提示词和脚本的要求，别放进记忆和自觉。

180
00:16:35,841 --> 00:16:43,582
站点地图让构建脚本生成，日期从版本提交记录里取，页面要求写进项目规则文件。

181
00:16:43,582 --> 00:16:47,524
这三件事做完，每个新页面天生合格。

182
00:16:47,524 --> 00:16:52,909
第五，两个站长平台都要提交，并且把机器流量单独归档。

183
00:16:52,909 --> 00:17:02,404
必应的收录数，直接决定你在对话产品里能不能被搜到；爬虫抓取曲线，是这套体系里唯一诚实的仪表盘。

