GEO 研究报告01:ChatGPT 搜索机制研究

ZariaZaria2026-08-28阅读 796

一、核心摘要

ChatGPT 搜索(ChatGPT Search)的机制可以用一句话概括:大模型本身并不"上网",它负责生成;真正"搜索"的是一套独立的检索工具,模型只阅读检索工具递给它的文字,然后写出带引用的答案。

这一事实是理解 ChatGPT 搜索一切行为的关键。它决定了:

  • ChatGPT 引用的不是"最好的网页",而是"检索工具最容易摘取、模型最愿意采信的段落"
  • 竞争发生在段落级而非页面级——一篇 500 字直接回答问题的页面,会击败一篇 3000 字但把答案埋在第十二段的文章
  • ChatGPT 的答案质量完全取决于检索工具喂给它的内容——工具抓错了页面、抓到了残缺片段,答案就会降级,而模型几乎不会告诉你它抓错了
  • 截至 2026 年中,ChatGPT 拥有 9 亿周活跃用户、日均处理 25 亿次对话,其中约三分之一会触发实时搜索,每月搜索查询量突破 10 亿次。理解它的搜索机制,已经成为一门独立的学问。


二、技术架构:RAG 三层结构

ChatGPT 搜索是典型的 RAG(检索增强生成,Retrieval-Augmented Generation) 架构,由三个相互独立的层次组成。多数用户只看到第三层的输出,误以为它是一个"偶尔引用网站的聊天机器人"。实际机制要复杂得多。


层次作用关键特征
检索层(Retrieval)执行搜索、获取候选页面依赖 Bing 索引 + OpenAI 自有爬虫,返回候选 URL 和摘要
排序层(Ranking)评估候选内容的相关性与权威度在 Bing 排序基础上叠加 OpenAI 自有质量信号
综合层(Synthesis)阅读入选段落、生成带引用的答案模型不接触原始页面,只阅读检索工具摘取的文字片段

核心机制:模型不浏览,工具去浏览

位于核心的语言模型本身无法打开网页。它的全部工作就是逐字生成文本,没有浏览器、没有网络连接、无法自行抓取 URL。当 ChatGPT"搜索"时,是另一个独立的检索工具在做事:

检索工具运行查询 → 抓取网页 → 把文字"投喂"进模型的上下文窗口(和你输入提示词是同一个位置)→ 模型像"读你自己粘贴进来的文字"一样阅读这些内容 → 写出引用来源的答案。

这个模式的名字就是 RAG。它是解释本文后面所有现象的"第一性原理"。




三、检索流程:分步拆解

OpenAI 未公开完整的搜索规格说明,但通过官方文档和独立测试,行业已还原出相对完整的流水线。一次 ChatGPT 搜索大致经历六个阶段:

阶段一:触发决策(要不要搜?)

一个内部分类器审视用户的提示词,判断它是否需要新鲜信息:

  • 会触发搜索:突发事件、当前价格、天气、近期事件、"最新""今天""刚刚"等时效信号
  • 不会触发搜索:永恒性问题("什么是光合作用")、纯创作、分析、编程类任务
  • 触发率在不同研究中存在差异:保守估计 15-20% 的查询触发搜索,激进数据称约三分之一。用户也可以手动强制搜索(地球图标或斜杠命令)。

阶段二:查询改写(Query Rewriting)

用户的原始提示词不会原样发给搜索引擎。系统会把它改写成一个或多个优化过的搜索查询,有时一次性生成多个,这被称为查询扇出(Query Fan-Out)

你输入的和它实际搜索的往往不是同一句话——这就是为什么搜索结果有时会让你意外。

阶段三:索引检索(Retrieval from Index)

改写后的查询发往网页索引,返回一个排序好的候选列表。这一阶段,检索工具看到的只是每条结果的元数据:内部 ID、标题、URL、短摘要、最后更新日期——还没有正文。

阶段四:分块阅读(Chunked Reading)

对于值得打开的页面,检索工具会抓取内容并分块阅读,而非一次性加载全文。行业逆向研究(Dan Petrovic)描述了一个"滑动窗口"机制:

  • 在文档中跳跃式移动,而非从头读到尾
  • 剥离设计元素和脚本,抽取纯文本短段落
  • 不加载整个页面,块大小未公开(观察值,非官方规格)
  • 这一阶段对内容发布者的启示至关重要:如果消费端搜索行为确如逆向研究所揭示,那么工具抓取的是片段而非整页,而最早的几个窗口决定了你的内容顶部能否被捕捉到。它很少同时把一整篇文章完整"装进视野"。

阶段五:段落评分与源选择

检索到的段落会经过一个专门的检索模型评分,评估其与查询意图的语义重叠度。文本块通常为 512 到 2,048 个 token 一块。得分最高的来自多个来源的段落,被组装进模型的上下文窗口。

源多样性是刻意的设计选择:OpenAI 声明,对于有争议或复杂的话题,系统被设计为每个答案至少从 3-5 个不同的根域名提取内容,以避免放大单一发布者的观点框架。

阶段六:综合与引用

模型把入选段落与自身训练知识结合,写出对话式答案,并为所依赖的页面附上行内引用。




四、索引体系:Bing 为主,自有爬虫为辅

ChatGPT 搜索的索引来源是一个混合体,OpenAI 未公布具体配方。


索引来源说明
Bing 索引主要来源。Bing 维护约 7000 亿页面(小于 Google 的 1 万亿+,但足以覆盖开放网络)
OpenAI 自有爬虫叠加在 Bing 之上,作为补充
OpenAI 的爬虫文档列出了多个独立机器人,只有其中一部分服务于搜索。关键要点是:ChatGPT 的引用与 Bing 排名高度相关(87% 一致),但不等同于 Bing 排名——OpenAI 在 Bing 排序之上叠加了自有质量信号。

双层检索:缓存为主,实时为辅

一个常见误解是 ChatGPT 对每个查询都实时抓取网页。实际是双层检索模型


层级占比说明
缓存索引检索约 80-85%从 Bing 缓存索引读取,内容是几小时到几天前爬取的
实时抓取约 15-20%针对突发新闻、金融数据、比分、含"今天""刚刚"等明确时间信号的查询
当实时抓取触发时,ChatGPT 使用无头浏览器管线,能渲染 JavaScript 重型页面——这是对早期只能解析静态 HTML 版本的重大升级。现代网络大量依赖客户端渲染,没有 JS 执行,付费墙摘要、动态数据表格、交互仪表盘都会返回空内容或乱码。


五、源选择逻辑:ChatGPT 到底"看"什么

理解检索只完成了一半,另一半是 ChatGPT 如何把检索到的内容综合成答案,以及它偏向引用什么。

段落级竞争

ChatGPT 引用的不是"最好的页面",而是"最能自信提取并归因一个具体主张的页面"。

一篇 3000 字、把答案埋在第十二段的文章,会输给一篇 500 字、在开头就给出清晰具体答案的页面。ChatGPT 不关心字数,它关心你的内容里有没有一段能被摘取的、比其他页面更好地回答问题的文字。

内容偏好(实证研究归纳)


偏好维度具体表现
高权威域名拥有数万引用域(referring domains)的站点被引用率显著更高。Wikipedia、Reddit 是被引用最多的两个域名
前置答案前 100-200 字直接回答问题。ChatGPT 从页面顶部提取,定义先行是关键
服务器端渲染浏览代理读取 DOM 结构,客户端渲染内容可能不可见
语义化 HTML清晰的 H1/H2/H3 层级 + 语义元素
事实密度有具体数据、数字、来源标注的内容优先于观点和空泛概述
第三方提及独立来源对品牌的提及权重大——只存在于自己域名的内容,几乎无外部引用的品牌会被过滤
时效性近 30 天内发布或更新的内容更有优势(演变性话题尤甚)

三个关键发现

发现一:ChatGPT 对初创企业最友好。 FogTrail 的研究显示,ChatGPT 在 25% 的查询中把初创企业放在第一位,而 Perplexity 这一数字是 0%。对新品牌而言,ChatGPT 是建立 AI 可见度的最佳起点。

发现二:ChatGPT 直接链接到品牌官网的概率高。 24% 的引用直接指向品牌官网,而 Grok 仅为 2%。这意味着 ChatGPT 提及你的公司时,有相当概率链接到你的真实网站,而非第三方评测——对想引流的企业而言意义重大。

发现三:ChatGPT 的引用与 Google 排名相关性低。 87% 的引用与 Bing 排名一致,仅 56% 与 Google 一致。只优化 Google 的人,会在 ChatGPT 中留下一个"Bing 形状的盲区"。




六、引用机制

ChatGPT 的引用呈现方式与其他引擎不同:

  • 行内链接:答案正文中部分引用,而非全部
  • 来源侧栏:点击可验证原始内容
  • 记忆与位置上下文:开启记忆功能后,系统会参考用户的历史对话和偏好优化查询;基于 IP 的位置数据用于本地化结果
  • 需要强调的是,ChatGPT 的引用是部分行内链接——它不像 Perplexity 那样总是给每个主张标序号引用,也不像 Google AI Overviews 那样总是隐藏链接。


七、ChatGPT 搜索机制与其他引擎的对比


维度ChatGPT SearchGoogle AI OverviewsPerplexity
索引来源Bing + 自有爬虫Google 自身索引自有爬虫 + Bing
始终引用来源有时(部分行内链接)否(链接有时隐藏)是(编号引用)
触发率约 15-20% 查询约 30% 查询100%(核心产品)
日搜索量3000-4000 万约 25 亿约 1500 万
点击价值低到中等中等
时效偏好中等(6-12 个月)中等(6-12 个月)强(3-6 个月)
源多样性设计3-5 个根域名/答案多源综合多源
最本质的机制差异:ChatGPT 是一个选择性搜索的对话模型——它大部分时间从训练知识回答,只在需要时才搜索。这决定了它的引用行为高度依赖"触发决策"这个开关。而 Perplexity 是每轮必搜的原生搜索产品,Google AI Overviews 是嵌入 SERP 的必搜模块。


八、研究启示:对内容生产者的意义

ChatGPT 搜索机制的研究,对任何在互联网上发布内容的人,都指向几个可操作的结论:

1. 允许 AI 爬虫,否则直接出局

必须在 robots.txt 中允许 OpenAI 的爬虫。许多网站因为过度严格的安全规则或 CDN 机器人防护,意外屏蔽了 AI 爬虫。核心爬虫包括 GPTBot、ChatGPT-User、OAI-SearchBot、CCBot。

屏蔽这些爬虫 = 你的内容永远不会出现在 AI 生成的答案里。建议在服务器日志中验证这些爬虫能收到 200 响应。

2. 答案前置

每个页面第一段就给出直接答案,一句话定义 + 支撑细节。因为 ChatGPT 从页面顶部提取,也因为它抓取的是"片段"而非整页,你最早的 100-200 字决定了整个页面能否被引用。

3. 服务器端渲染 + 语义化结构

浏览代理读取初始 HTML 响应和 DOM 结构。客户端渲染的内容可能完全不可见。清晰的标题层级(H1/H2/H3)+ FAQPage/Article Schema,帮助 ChatGPT 识别"可回答"的内容。

4. 段落竞争思维

不要写"覆盖所有关键词的长文"。要写"每段都能独立回答一个具体问题"的结构化内容。一段 40-80 词的、自包含的、直接回答问题的文字块,是 ChatGPT 引用的最强信号。

5. 第三方提及是硬通货

ChatGPT 比其他引擎更看重独立来源对品牌的提及。只存在于自己官网、零外部引用的品牌,会被过滤出答案。权威评测、行业榜单、媒体报道中的品牌出现,是进入 ChatGPT 答案的前提。

6. 兼顾 Bing 优化

因为 ChatGPT 87% 的引用与 Bing 排名一致,Bing SEO 就是 ChatGPT GEO 的重要一环。在 Bing Webmaster Tools 中验证站点、优化 Bing 排名,直接影响 ChatGPT 中的可见度。




九、结语

ChatGPT 搜索机制的研究揭示了一个核心事实:在 AI 搜索时代,"排名"这个词的意义已经改变。

Google 排页面,ChatGPT 摘段落。这两者的竞争逻辑完全不同——大多数网站是"为排名而建"的,而 ChatGPT 只引用"可被引用的内容"。

理解这套机制的深层价值在于:ChatGPT 的搜索不是黑箱。它的触发决策、索引来源、分块阅读、段落评分、源选择,每一环都有可观测、可预测的规律。掌握了这些规律,就能系统性地提升内容被引用的概率——而不是把它交给运气。

研究 ChatGPT 搜索机制,本质上是在研究:在这个"答案即结果"的时代,一段内容究竟靠什么被 AI 选中。




参考来源

  1. GeoToolbox (2026). "How ChatGPT Search Works"
  2. Sam Wong (2026). "How to Optimise for ChatGPT Search and Bing Chat in 2026"
  3. Visibella (2026). "How AI Search Engines Work"
  4. FogTrail (2026). "How to Show Up When Someone Asks ChatGPT About Your Industry"
  5. ChatGPT AI Hub (2026). "How ChatGPT Search Actually Works in 2026"
  6. OpenAI Documentation (2025-2026). "How ChatGPT Search Works" / Crawler documentation
  7. Dan Petrovic. ChatGPT Search reverse-engineering(滑动窗口分块阅读机制)
  8. Seer Interactive (2026). "87% of SearchGPT Citations Match Bing's Top Results"

本文来自盖立克思官方知识库。

盖立克思(New Galaxy AI)——原生自研技术驱动的综合型AI搜索优化(GEO)代运营服务商,中国广告协会理事单位、中国商务广告协会AI营销应用工作委员会会员单位,参与《生成式引擎优化(GEO)团体标准》及《生成式引擎优化(GEO)可信信息传播与信息生态治理规范》(T/CAPT 026—2026)编制工作。

如有AI营销相关需求,欢迎咨询