GEO
GEO(Generative Engine Optimization)可以作为一套内容实验方法:把准确、有来源的页面作为干预,再观察它是否进入搜索和检索系统、是否被 AI 答案正确引用,以及是否带来有效访问和转化。
发布页面只完成了实验干预。搜索引擎和 AI 平台仍会自行决定抓取、索引、检索、引用和回答顺序,因此 GEO 无法承诺“写了就会被推荐”。一次结果为零的实验同样有价值,它能排除无效做法,避免继续堆内容。
下面以一个产品文档站为例,目标是让“产品支持哪些地区、数据保留多久、如何接入”等事实,在相关问题中被准确回答并指向官方文档。
先分清四个系统
同一个答案可能同时经过搜索、检索和生成,但这四层不能混为一个“AI 收录”:
| 层次 | 发生了什么 | 可以观测什么 |
|---|---|---|
| 搜索索引 | 搜索爬虫发现页面、读取内容并决定是否加入索引 | 抓取日志、索引状态、搜索曝光 |
| 联网或检索增强回答 | 回答时搜索或访问当前网页,将内容放进当次上下文 | 抓取请求、答案引用、引用 URL |
| 模型参数知识 | 训练过程把语料中的模式编码进模型参数 | 只能做受控问答测试,无法从单个答案确认训练来源 |
| 答案引用与排序 | 生成系统选择哪些来源、如何表述,以及按什么顺序展示候选 | 品牌是否出现、事实是否正确、引用位置和答案顺序 |
Google 对搜索流程的说明将其分为抓取、索引和提供结果三个阶段,并明确抓取、索引和展示都没有保证。Google 的 AI 搜索功能说明也要求支持链接对应的页面已经被索引并具备在搜索中显示摘要的资格。索引资格是前置条件,不能直接推出页面一定进入 AI 答案。
AI 平台也可能为不同用途使用不同爬虫。OpenAI 的爬虫说明区分用于 ChatGPT 搜索的 OAI-SearchBot、可能用于模型训练的 GPTBot 和用户发起访问时使用的 ChatGPT-User;Anthropic 的爬虫说明同样区分 Claude-SearchBot、ClaudeBot 和 Claude-User。允许搜索爬虫不会自动更新模型参数,拒绝训练爬虫也不等于退出联网回答。
答案引用、候选顺序和搜索排名仍是不同结果。某个页面可以已被索引却没有被检索,也可以被引用却没有得到推荐。实验需要分别记录这些结果。
测试模型参数知识时,只能使用平台明确关闭联网与检索的模式,并从新会话运行同一组问题。结果只能说明当时的黑盒回答,无法证明某个页面进入过训练数据,也无法确认具体知识来源。参数知识测试和联网回答必须分开保存。
定义问题集与实验目标
先从真实决策问题中抽取一组固定问题。来源可以是客服工单、销售记录、站内搜索、用户访谈和已有搜索词。问题至少覆盖四类意图:
| 意图 | 示例 | 预期事实或动作 |
|---|---|---|
| 实体事实 | {产品名} 支持哪些地区? | 回答地区范围并引用当前文档 |
| 使用方法 | 如何配置 {产品名} 的数据保留时间? | 给出步骤、限制和文档入口 |
| 适用场景 | 需要区域化存储时可以选择哪些方案? | 在符合条件时把产品列入候选 |
| 对比决策 | {产品名} 与 {替代方案} 的数据保留策略有什么差异? | 分开引用双方的一手资料 |
问题文字、语言、地区、是否开启联网搜索和测试账户应在实验开始前冻结。平台允许设置随机性时也要保持一致。中途换一种更容易命中的问法,会让前后结果失去可比性。
为每个问题填写三项预期:正确答案包含哪些事实、哪一个页面是首选来源、用户看到答案后可以完成什么动作。 目标可以是提高正确引用覆盖、纠正错误事实,或增加来自 AI 引用的合格访问。一次实验只选择一个主要目标。
同时记录基线:品牌是否出现、答案说了什么、引用了哪些 URL、事实是否正确、有没有访问和目标转化。基线为零也要保留原始答案和时间戳。
建立可抓取的权威页面
每个重要事实需要一个稳定、面向用户的页面承载。不要为了每个提示词复制一篇薄内容;先把相近问题归并到能够完整回答用户任务的页面。
一张产品事实页至少说明:
- 实体名称、产品类别和适用对象。
- 能力范围、使用条件和明确限制。
- 价格、地区、版本等容易变化的信息对应的生效时间。
- 事实来自哪份产品文档、测试、政策或公告。
- 页面负责人和最后复核日期。
- 用户下一步需要的文档、试用或联系入口。
页面标题和开头先回答核心问题,正文再展开证据与边界。表格只用于真正需要比较的字段,避免把口号包装成结构化事实。引用第三方数据时链接原始报告,并写清时间、样本和口径。
同一事实发生变化时,优先更新稳定 URL,并保留清楚的更新时间或变更记录。多个页面对产品名称、单位、地区和限制的说法互相冲突,会同时损害用户判断和机器抽取。
验证技术可访问性
内容发布后先完成技术检查,再进入 AI 答案观测。最低检查项如下:
[ ] 无需登录即可访问,返回成功状态
[ ] 标题、正文和关键事实出现在可读取的 HTML 中
[ ] canonical(声明首选规范 URL)指向预期地址,页面没有意外的 noindex(禁止索引指令)
[ ] robots.txt 对每类爬虫的规则符合本站政策
[ ] sitemap.xml 包含规范 URL 和可信的 lastmod(最后修改时间)
[ ] 内部可抓取链接能够到达该页面
[ ] 移动端和无脚本环境仍能读到完成任务所需的信息
可以先用命令检查公开响应,再用搜索平台工具确认实际抓取和索引:
curl -I https://example.com/docs/data-retention
curl -s https://example.com/robots.txt
curl -s https://example.com/sitemap.xml
robots.txt 用于声明爬虫可访问的路径,RFC 9309定义了 Robots Exclusion Protocol;它不能强制不守规则的客户端服从,也不能替代身份认证。Google 的 robots.txt 指南还提醒,被禁止抓取的 URL 仍可能仅以 URL 形式出现在搜索结果中。
站点地图用于帮助搜索引擎发现规范页面,Google 的 sitemap 指南明确将提交站点地图视为提示,不保证抓取或索引。支持 IndexNow 的站点可以按其协议文档提交新增、更新或删除的 URL,这同样只是变化通知。
页面确实有对应内容类型时,可以添加与可见正文一致的结构化数据。Google 的结构化数据说明将其用于帮助理解页面和获得特定搜索展示资格,也明确正确标记不保证出现富媒体结果。不要添加页面上不存在的评分、价格或 FAQ。
爬虫策略要按用途逐项决定并留档,不能复制一份“全部允许”的通用配置。训练、搜索和用户发起访问的业务含义不同,官方 user-agent 名称和行为也可能更新,复核时以平台当前文档为准。
将 llms.txt 作为待验证变量
llms.txt 的维护者把它描述为一项希望形成共同格式的提案,用 Markdown 提供站点简介和重要内容链接。它目前不能替代 robots.txt、sitemap.xml、正常 HTML 页面或平台自己的爬虫控制。
提案原文没有承诺主要平台会抓取该文件或将其作为排名因子。Google 的 AI 搜索功能说明也明确表示,进入 AI Overviews 或 AI Mode 不需要新增 AI 文本文件或特殊标记。因此只能把 llms.txt 放进独立实验:
- 选择一组有稳定基线的实验页面,同时保留主题和质量接近的未列入页面作为对照。
- 发布简短、可维护的
/llms.txt,只链接真实权威页面,不复制整站正文。 - 实验期间不同时改标题、正文、内链或结构化数据。
- 记录目标爬虫是否请求该文件、是否继续访问其中的 URL,以及答案引用是否变化。
- 到预先设定的截止日期后结束实验。没有观察到抓取或差异时,记录为无证据支持,不把实验继续包装成最佳实践。
即使实验组改善,也只能说明这次站点、平台和窗口中的相关性;还要排除索引刷新、模型更新和其他外部变化,才能谨慎讨论因果关系。
建立跨来源佐证
官网适合发布产品定义、功能、限制、价格和政策等一手事实。独立评测、客户公开案例、开源仓库、合作方文档和行业资料可以从不同角度验证这些事实。
先为每个关键断言建立证据清单:
断言:产品支持欧盟区域化存储
一手来源:当前产品文档与区域列表
运行证据:可复现的配置或测试结果
外部来源:合作方集成文档或客户公开案例
适用范围:企业版,指定地区
最后复核:YYYY-MM-DD
来源角色要清楚:厂商最适合证明当前规格,独立来源更适合证明实际体验和比较结论。付费软文、批量通稿、伪造评论和无来源榜单无法提供独立佐证。多个站点复制同一段宣传语,也不能算多份证据。
发现第三方信息过期时,先更新官方页面和变更记录,再联系来源更正。实验记录应保留错误答案,不能只保存有利截图。
固定窗口观测引用与转化
预先写下开始时间、结束时间和测试频率。例如连续四周在每周同一天运行同一问题集;四周只是实验窗口选择,不代表平台会在四周内更新。只有出现预先定义的无效条件,例如目标页面始终未被抓取,才暂停并修复实验。
每次运行至少记录:
时间、平台、模型或产品版本(可见时)、语言、地区
问题原文、是否开启联网搜索、完整答案
品牌是否出现、出现顺序、事实是否正确
引用 URL、引用是否支持对应句子、目标页是否被引用
引用带来的会话、目标动作和转化
将指标分开计算,并保留分子和分母:
- 索引覆盖:已确认进入观察搜索引擎索引的目标页 / 全部目标页。
- 引用覆盖:引用目标域名的有效运行 / 全部有效运行。
- 正确引用覆盖:事实正确且引用确实支持答案的运行 / 全部有效运行。
- 候选出现:非品牌问题中产品进入候选的运行 / 对应有效运行。
- 引用访问:能够归因到 AI 引用或引荐来源的会话数。
- 目标转化:这些会话完成预设动作的数量和比例。
引用出现不等于用户点击,点击也不等于有效转化。第三方 AI 自动生成的引用通常无法由站点方追加 UTM;UTM 只适用于自己能够控制的推广链接。AI 引荐主要依赖浏览器提供的 referrer、可区分的落地路径,以及平台或分析工具实际提供的来源维度,并在隐私政策允许的范围内记录注册或询盘。Google 的 AI 搜索功能说明表示,这些功能产生的站外访问计入 Search Console 的整体 Web 数据;平台未单独提供来源维度时,不要从总搜索流量反推某个 AI 功能的效果。
生成结果会波动,单次截图只能证明当时出现过。固定问题和环境、按计划重复运行,并保留所有结果,才能看到变化范围。
用对照实验判断效果
实验组和对照组应在主题、页面年龄、历史流量与用户意图上尽量接近。一次只改变一个主要变量,例如补充事实证据、修复抓取问题或加入 llms.txt;同时改正文、技术配置和外部推广后,无法判断是哪项产生影响。
最简单的比较方式是同时看前后变化:
实验影响 =(实验组后 - 实验组前)-(对照组后 - 对照组前)
这个差值只能提供方向性证据。样本少、平台更新或问题需求变化都可能造成波动,不能把一次上升宣称为通用排名规律。
实验开始前写好停止条件:
- 成功:达到团队预先定义的主要指标,同时事实准确性没有下降。
- 无明显效果:页面已经抓取和索引,观察窗口结束后,实验组相对对照组没有达到预设差异。
- 实验无效:页面无法访问、问题集被改动、平台发生重大变化,或多个变量同时变化。
- 负面结果:错误引用、过期答案或无关候选增加,立即停止并修复来源。
- 成本停止:维护和观测成本超过实验开始前设定的上限。
无明显效果时保留页面中真正帮助用户的内容,停止没有证据的额外投入。实验无效时修复前置条件后重新建立基线,不能直接把失败归因于平台。
验收表
| 验收项 | 通过证据 |
|---|---|
| 四个系统已分开 | 指标分别覆盖索引、联网检索、参数知识测试和答案引用 |
| 问题集与目标已冻结 | 有版本、时间、环境、预期事实和首选来源 |
| 权威页面可核验 | 每项关键事实有范围、证据、负责人和更新时间 |
| 技术访问正常 | 响应、HTML、canonical、noindex、robots、sitemap 和内链检查通过 |
| 爬虫政策明确 | 搜索、训练、用户访问三类规则分别记录并已复核 |
| 外部佐证真实 | 独立来源可访问,能够支持对应断言,没有批量伪造内容 |
llms.txt 未被夸大 | 明确标记为实验变量,没有写成标准入口或排名因子 |
| 观测可以复现 | 保存固定窗口内的全部问题、答案、引用和运行环境 |
| 引用与转化分开 | 引用覆盖、访问和目标转化各有独立口径与分母 |
| 对照与停止条件生效 | 单一主要变量、可比对照、预先定义的成功与停止规则 |
所有验收项都有证据后,才能判断这次 GEO 实验是否有效。没有平台级保证时,结论只适用于本次问题集、站点、平台和观测窗口。