AI 的 RAG 系统检索网页的流程和 Google 爬虫类似,但有几个 GEO 特有的关键节点。
一、RAG 检索 5 步流程
① 抓取(Crawl)
RAG 爬虫主动访问网页。ChatGPT 用 GPTBot、Kimi 用 MoonshotBot、文心用 Baiduspider 等。这些爬虫的 IP 段和 User-Agent 与普通爬虫不同。
② 解析(Parse)
把 HTML 解析成纯文本 + 结构化信息。RAG 系统会识别:
– H1 / H2 / H3 标题
– 列表 / 表格 / FAQ
– 图片 alt 文本
– schema.org 标注
③ 分块(Chunk)
把长文档切成 200-500 字的小块。RAG 系统按段落 / 章节分块,每块单独索引。
④ 向量化(Embed)
把每个文本块转成向量(一组数字)。语义相似的文本向量相近。
⑥ 检索(Retrieve)
– 用户提问 → 转成向量
– 在向量数据库中找最相似的 5-10 个文本块
– 用这些文本块 + 用户问题组成增强 prompt
– LLM 基于这些信息生成答案
二、GEO 优化要点
1. **不阻挡 AI 爬虫**:robots.txt 不要禁 GPTBot / ClaudeBot / Baiduspider / Bytespider
2. **sitemap.xml 完整**:让爬虫知道你有哪些页面
3. **H2 结构清晰**:让 RAG 解析时能准确分块
4. **schema.org 标注**:让 RAG 识别”这是 FAQ””这是产品””这是文章”
5. **内容不被广告 / Cookie banner 阻断**:用 lazy load 而非 JS 渲染关键内容
关键洞察:RAG 不是 Google 那样”看链接数”判断权威,而是看”文本与问题的语义相似度”。所以 GEO 不需要外链,但需要内容与用户问题高度相关。
让 RAG 系统”找到你” = 让爬虫能抓 + 内容结构化 + 语义匹配。