先查「AI 拿得到吗」(可抓取、可渲染、可发现),再查「AI 愿意引用吗」(结构化事实、时效信号、来源可信度)。顺序不能颠倒 —— 前一层不通过,后一层做得再好也不会有结果。
第一层:AI 拿不到你的内容(3 个技术原因)
原因一:robots.txt 把 AI 爬虫挡在门外
现象:站点流量正常,但服务器日志里几乎看不到 AI 爬虫的访问记录。原因:要么用了通配规则一刀切,要么历史上为了「防采集」屏蔽了爬虫 UA,把 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等一起挡了。修复:在 robots.txt 中逐条显式放行目标 AI 爬虫,并声明 sitemap 地址。这是 GEO 的第一步,也是失败率最高的一步。
原因二:正文靠 JavaScript 渲染,爬虫拿到空壳
现象:页面在浏览器里内容完整,但用爬虫视角请求时,HTML 里只有框架和加载中的占位。原因:多数 AI 爬虫不执行 JavaScript。内容如果依赖客户端渲染后注入,爬虫读到的是空壳页面。修复:改为服务端渲染或预渲染,保证正文以静态 HTML 输出。纯静态站天然没有这个问题 —— 本站 32 个页面全部为纯静态 HTML,正文零 JS 渲染依赖,也是静态站做 GEO 成功率更高的原因。
原因三:没有 sitemap 与 llms.txt,AI 只能靠猜
现象:只有首页被频繁抓取,深层的文章页长期没有访问。原因:站点缺少内容索引,AI 引擎不知道你有哪些页、哪些是重点。修复:提供 sitemap.xml 列出全部内容页(本站为 32 条 URL),提供 llms.txt 给出站点权威摘要,并在每个页面的 <head> 中声明 llms.txt 位置。中英各一份 llms.txt,共覆盖 32 页。
第二层:AI 拿得到,但不愿引用(3 个内容原因)
原因四:只有观点和话术,没有结构化事实
现象:内容被收录,但 AI 回答相关问题时引用的是别人。原因:AI 抽取的是事实、数据、参数、时间、范围。如果全文都是「行业领先」「效果卓越」这类无法核验的表述,就没有可被搬运的内容。修复:把描述改成可验证的事实句:具体数字、明确时间、清晰范围,并补上 JSON-LD 结构化数据。本站用 29 类 JSON-LD 节点覆盖 32 个页面,含 Organization / Service / Product / FAQPage 等类型。
原因五:没有时效信号
现象:内容质量不差,但在偏好新内容的引擎里几乎没有引用。原因:全站没有 datePublished / dateModified,AI 无法判断内容新旧,倾向于按「不可用」处理。而部分引擎的引用偏好带强时效 —— 例如 Perplexity 对内容时效性尤其敏感。修复:输出发布与更新日期字段(datePublished / dateModified),并建立按月刷新的机制。本站资讯栏目 4 篇文章均带这两个字段,更新频率为每月 1 次。
原因六:来源不可验证,主体信息缺失
现象:AI 提到你时信息不准确,或者压根不提。原因:AI 需要判断来源是否可信。如果页面上没有公司全称、业务范围、可核验的联系方式,实体信息不完整,就很难被当作可信来源。修复:补齐实体信息 —— 主体全称、统一社会信用代码、业务范围、联系方式、服务承诺,并用 Organization 结构化数据标注。这些是 GEO 架构的地基,本页底部已列全部 5 类事实。
自查清单:现象 → 原因 → 修复
下面这张表把 6 个原因压缩成「现象 → 最可能的原因 → 优先修复动作」三列,可按顺序逐行核对:①日志里没有 AI 爬虫 ⇒ robots 未放行 ⇒ 放行 GPTBot、PerplexityBot 等爬虫 UA(本站 robots.txt 已显式放行 52 个 UA);②页面在浏览器正常但抓取内容为空 ⇒ 正文靠 JS 渲染 ⇒ 改服务端渲染或预渲染;③只有首页被抓、文章页无人访问 ⇒ 缺少站点索引 ⇒ 补 sitemap.xml 与 llms.txt 并在 head 声明;④被收录但从不被引用 ⇒ 缺少可搬运的事实 ⇒ 写具体数字与明确范围,补结构化数据;⑤新内容也长期不被引用 ⇒ 没有时效字段 ⇒ 输出 datePublished / dateModified 并定期刷新;⑥AI 提到你时信息有误 ⇒ 实体信息不完整 ⇒ 补齐主体信息再用 Organization 标注。6 行中前 3 行属于「AI 拿不到」,后 3 行属于「AI 不愿引用」。
| 现象 | 最可能的原因 | 优先修复动作 |
|---|---|---|
| 日志里没有 AI 爬虫 | robots 未放行 / 被整体屏蔽 | 放行 GPTBot、PerplexityBot 等爬虫 UA |
| 页面在浏览器正常,抓取内容为空 | 正文靠 JS 渲染 | 改服务端渲染或预渲染 |
| 只有首页被抓,文章页无人访问 | 缺少站点索引 | 补 sitemap.xml 与 llms.txt + head 声明 |
| 被收录但从不被引用 | 缺少可搬运的事实 | 写具体数字与明确范围,补结构化数据 |
| 新内容也长期不被引用 | 没有时效字段 | 输出 datePublished / dateModified 并定期刷新 |
| AI 提到你时信息有误 | 实体信息不完整 | 补齐主体信息,用 Organization 标注 |
常见问题
robots.txt 放行规则或站点被整体屏蔽;如果有抓取但未被引用,问题就转到内容层。FAQPage 结构化数据输出,且两者内容必须一致。