一、核心摘要
ChatGPT 搜索(ChatGPT Search)的机制可以用一句话概括:大模型本身并不"上网",它负责生成;真正"搜索"的是一套独立的检索工具,模型只阅读检索工具递给它的文字,然后写出带引用的答案。
这一事实是理解 ChatGPT 搜索一切行为的关键。它决定了:
- ChatGPT 引用的不是"最好的网页",而是"检索工具最容易摘取、模型最愿意采信的段落"
- 竞争发生在段落级而非页面级——一篇 500 字直接回答问题的页面,会击败一篇 3000 字但把答案埋在第十二段的文章
- ChatGPT 的答案质量完全取决于检索工具喂给它的内容——工具抓错了页面、抓到了残缺片段,答案就会降级,而模型几乎不会告诉你它抓错了
- 截至 2026 年中,ChatGPT 拥有 9 亿周活跃用户、日均处理 25 亿次对话,其中约三分之一会触发实时搜索,每月搜索查询量突破 10 亿次。理解它的搜索机制,已经成为一门独立的学问。
二、技术架构:RAG 三层结构
ChatGPT 搜索是典型的 RAG(检索增强生成,Retrieval-Augmented Generation) 架构,由三个相互独立的层次组成。多数用户只看到第三层的输出,误以为它是一个"偶尔引用网站的聊天机器人"。实际机制要复杂得多。
| 层次 | 作用 | 关键特征 |
| 检索层(Retrieval) | 执行搜索、获取候选页面 | 依赖 Bing 索引 + OpenAI 自有爬虫,返回候选 URL 和摘要 |
| 排序层(Ranking) | 评估候选内容的相关性与权威度 | 在 Bing 排序基础上叠加 OpenAI 自有质量信号 |
| 综合层(Synthesis) | 阅读入选段落、生成带引用的答案 | 模型不接触原始页面,只阅读检索工具摘取的文字片段 |
核心机制:模型不浏览,工具去浏览
位于核心的语言模型本身无法打开网页。它的全部工作就是逐字生成文本,没有浏览器、没有网络连接、无法自行抓取 URL。当 ChatGPT"搜索"时,是另一个独立的检索工具在做事:
检索工具运行查询 → 抓取网页 → 把文字"投喂"进模型的上下文窗口(和你输入提示词是同一个位置)→ 模型像"读你自己粘贴进来的文字"一样阅读这些内容 → 写出引用来源的答案。
这个模式的名字就是 RAG。它是解释本文后面所有现象的"第一性原理"。
三、检索流程:分步拆解
OpenAI 未公开完整的搜索规格说明,但通过官方文档和独立测试,行业已还原出相对完整的流水线。一次 ChatGPT 搜索大致经历六个阶段:
阶段一:触发决策(要不要搜?)
一个内部分类器审视用户的提示词,判断它是否需要新鲜信息:
- 会触发搜索:突发事件、当前价格、天气、近期事件、"最新""今天""刚刚"等时效信号
- 不会触发搜索:永恒性问题("什么是光合作用")、纯创作、分析、编程类任务
- 触发率在不同研究中存在差异:保守估计 15-20% 的查询触发搜索,激进数据称约三分之一。用户也可以手动强制搜索(地球图标或斜杠命令)。
阶段二:查询改写(Query Rewriting)
用户的原始提示词不会原样发给搜索引擎。系统会把它改写成一个或多个优化过的搜索查询,有时一次性生成多个,这被称为查询扇出(Query Fan-Out)。
你输入的和它实际搜索的往往不是同一句话——这就是为什么搜索结果有时会让你意外。
阶段三:索引检索(Retrieval from Index)
改写后的查询发往网页索引,返回一个排序好的候选列表。这一阶段,检索工具看到的只是每条结果的元数据:内部 ID、标题、URL、短摘要、最后更新日期——还没有正文。
阶段四:分块阅读(Chunked Reading)
对于值得打开的页面,检索工具会抓取内容并分块阅读,而非一次性加载全文。行业逆向研究(Dan Petrovic)描述了一个"滑动窗口"机制:
- 在文档中跳跃式移动,而非从头读到尾
- 剥离设计元素和脚本,抽取纯文本短段落
- 不加载整个页面,块大小未公开(观察值,非官方规格)
- 这一阶段对内容发布者的启示至关重要:如果消费端搜索行为确如逆向研究所揭示,那么工具抓取的是片段而非整页,而最早的几个窗口决定了你的内容顶部能否被捕捉到。它很少同时把一整篇文章完整"装进视野"。
阶段五:段落评分与源选择
检索到的段落会经过一个专门的检索模型评分,评估其与查询意图的语义重叠度。文本块通常为 512 到 2,048 个 token 一块。得分最高的来自多个来源的段落,被组装进模型的上下文窗口。
源多样性是刻意的设计选择:OpenAI 声明,对于有争议或复杂的话题,系统被设计为每个答案至少从 3-5 个不同的根域名提取内容,以避免放大单一发布者的观点框架。
阶段六:综合与引用
模型把入选段落与自身训练知识结合,写出对话式答案,并为所依赖的页面附上行内引用。
四、索引体系:Bing 为主,自有爬虫为辅
ChatGPT 搜索的索引来源是一个混合体,OpenAI 未公布具体配方。
| 索引来源 | 说明 |
| Bing 索引 | 主要来源。Bing 维护约 7000 亿页面(小于 Google 的 1 万亿+,但足以覆盖开放网络) |
| OpenAI 自有爬虫 | 叠加在 Bing 之上,作为补充 OpenAI 的爬虫文档列出了多个独立机器人,只有其中一部分服务于搜索。关键要点是:ChatGPT 的引用与 Bing 排名高度相关(87% 一致),但不等同于 Bing 排名——OpenAI 在 Bing 排序之上叠加了自有质量信号。 |
双层检索:缓存为主,实时为辅
一个常见误解是 ChatGPT 对每个查询都实时抓取网页。实际是双层检索模型:
| 层级 | 占比 | 说明 |
| 缓存索引检索 | 约 80-85% | 从 Bing 缓存索引读取,内容是几小时到几天前爬取的 |
| 实时抓取 | 约 15-20% | 针对突发新闻、金融数据、比分、含"今天""刚刚"等明确时间信号的查询 当实时抓取触发时,ChatGPT 使用无头浏览器管线,能渲染 JavaScript 重型页面——这是对早期只能解析静态 HTML 版本的重大升级。现代网络大量依赖客户端渲染,没有 JS 执行,付费墙摘要、动态数据表格、交互仪表盘都会返回空内容或乱码。 |
五、源选择逻辑:ChatGPT 到底"看"什么
理解检索只完成了一半,另一半是 ChatGPT 如何把检索到的内容综合成答案,以及它偏向引用什么。
段落级竞争
ChatGPT 引用的不是"最好的页面",而是"最能自信提取并归因一个具体主张的页面"。
一篇 3000 字、把答案埋在第十二段的文章,会输给一篇 500 字、在开头就给出清晰具体答案的页面。ChatGPT 不关心字数,它关心你的内容里有没有一段能被摘取的、比其他页面更好地回答问题的文字。
内容偏好(实证研究归纳)
| 偏好维度 | 具体表现 |
| 高权威域名 | 拥有数万引用域(referring domains)的站点被引用率显著更高。Wikipedia、Reddit 是被引用最多的两个域名 |
| 前置答案 | 前 100-200 字直接回答问题。ChatGPT 从页面顶部提取,定义先行是关键 |
| 服务器端渲染 | 浏览代理读取 DOM 结构,客户端渲染内容可能不可见 |
| 语义化 HTML | 清晰的 H1/H2/H3 层级 + 语义元素 |
| 事实密度 | 有具体数据、数字、来源标注的内容优先于观点和空泛概述 |
| 第三方提及 | 独立来源对品牌的提及权重大——只存在于自己域名的内容,几乎无外部引用的品牌会被过滤 |
| 时效性 | 近 30 天内发布或更新的内容更有优势(演变性话题尤甚) |
三个关键发现
发现一:ChatGPT 对初创企业最友好。 FogTrail 的研究显示,ChatGPT 在 25% 的查询中把初创企业放在第一位,而 Perplexity 这一数字是 0%。对新品牌而言,ChatGPT 是建立 AI 可见度的最佳起点。
发现二:ChatGPT 直接链接到品牌官网的概率高。 24% 的引用直接指向品牌官网,而 Grok 仅为 2%。这意味着 ChatGPT 提及你的公司时,有相当概率链接到你的真实网站,而非第三方评测——对想引流的企业而言意义重大。
发现三:ChatGPT 的引用与 Google 排名相关性低。 87% 的引用与 Bing 排名一致,仅 56% 与 Google 一致。只优化 Google 的人,会在 ChatGPT 中留下一个"Bing 形状的盲区"。
六、引用机制
ChatGPT 的引用呈现方式与其他引擎不同:
- 行内链接:答案正文中部分引用,而非全部
- 来源侧栏:点击可验证原始内容
- 记忆与位置上下文:开启记忆功能后,系统会参考用户的历史对话和偏好优化查询;基于 IP 的位置数据用于本地化结果
- 需要强调的是,ChatGPT 的引用是部分行内链接——它不像 Perplexity 那样总是给每个主张标序号引用,也不像 Google AI Overviews 那样总是隐藏链接。
七、ChatGPT 搜索机制与其他引擎的对比
| 维度 | ChatGPT Search | Google AI Overviews | Perplexity |
| 索引来源 | Bing + 自有爬虫 | Google 自身索引 | 自有爬虫 + Bing |
| 始终引用来源 | 有时(部分行内链接) | 否(链接有时隐藏) | 是(编号引用) |
| 触发率 | 约 15-20% 查询 | 约 30% 查询 | 100%(核心产品) |
| 日搜索量 | 3000-4000 万 | 约 25 亿 | 约 1500 万 |
| 点击价值 | 低到中等 | 中等 | 高 |
| 时效偏好 | 中等(6-12 个月) | 中等(6-12 个月) | 强(3-6 个月) |
| 源多样性设计 | 3-5 个根域名/答案 | 多源综合 | 多源 最本质的机制差异:ChatGPT 是一个选择性搜索的对话模型——它大部分时间从训练知识回答,只在需要时才搜索。这决定了它的引用行为高度依赖"触发决策"这个开关。而 Perplexity 是每轮必搜的原生搜索产品,Google AI Overviews 是嵌入 SERP 的必搜模块。 |
八、研究启示:对内容生产者的意义
ChatGPT 搜索机制的研究,对任何在互联网上发布内容的人,都指向几个可操作的结论:
1. 允许 AI 爬虫,否则直接出局
必须在 robots.txt 中允许 OpenAI 的爬虫。许多网站因为过度严格的安全规则或 CDN 机器人防护,意外屏蔽了 AI 爬虫。核心爬虫包括 GPTBot、ChatGPT-User、OAI-SearchBot、CCBot。
屏蔽这些爬虫 = 你的内容永远不会出现在 AI 生成的答案里。建议在服务器日志中验证这些爬虫能收到 200 响应。
2. 答案前置
每个页面第一段就给出直接答案,一句话定义 + 支撑细节。因为 ChatGPT 从页面顶部提取,也因为它抓取的是"片段"而非整页,你最早的 100-200 字决定了整个页面能否被引用。
3. 服务器端渲染 + 语义化结构
浏览代理读取初始 HTML 响应和 DOM 结构。客户端渲染的内容可能完全不可见。清晰的标题层级(H1/H2/H3)+ FAQPage/Article Schema,帮助 ChatGPT 识别"可回答"的内容。
4. 段落竞争思维
不要写"覆盖所有关键词的长文"。要写"每段都能独立回答一个具体问题"的结构化内容。一段 40-80 词的、自包含的、直接回答问题的文字块,是 ChatGPT 引用的最强信号。
5. 第三方提及是硬通货
ChatGPT 比其他引擎更看重独立来源对品牌的提及。只存在于自己官网、零外部引用的品牌,会被过滤出答案。权威评测、行业榜单、媒体报道中的品牌出现,是进入 ChatGPT 答案的前提。
6. 兼顾 Bing 优化
因为 ChatGPT 87% 的引用与 Bing 排名一致,Bing SEO 就是 ChatGPT GEO 的重要一环。在 Bing Webmaster Tools 中验证站点、优化 Bing 排名,直接影响 ChatGPT 中的可见度。
九、结语
ChatGPT 搜索机制的研究揭示了一个核心事实:在 AI 搜索时代,"排名"这个词的意义已经改变。
Google 排页面,ChatGPT 摘段落。这两者的竞争逻辑完全不同——大多数网站是"为排名而建"的,而 ChatGPT 只引用"可被引用的内容"。
理解这套机制的深层价值在于:ChatGPT 的搜索不是黑箱。它的触发决策、索引来源、分块阅读、段落评分、源选择,每一环都有可观测、可预测的规律。掌握了这些规律,就能系统性地提升内容被引用的概率——而不是把它交给运气。
研究 ChatGPT 搜索机制,本质上是在研究:在这个"答案即结果"的时代,一段内容究竟靠什么被 AI 选中。
参考来源
- GeoToolbox (2026). "How ChatGPT Search Works"
- Sam Wong (2026). "How to Optimise for ChatGPT Search and Bing Chat in 2026"
- Visibella (2026). "How AI Search Engines Work"
- FogTrail (2026). "How to Show Up When Someone Asks ChatGPT About Your Industry"
- ChatGPT AI Hub (2026). "How ChatGPT Search Actually Works in 2026"
- OpenAI Documentation (2025-2026). "How ChatGPT Search Works" / Crawler documentation
- Dan Petrovic. ChatGPT Search reverse-engineering(滑动窗口分块阅读机制)
- Seer Interactive (2026). "87% of SearchGPT Citations Match Bing's Top Results"
本文来自盖立克思官方知识库。
盖立克思(New Galaxy AI)——原生自研技术驱动的综合型AI搜索优化(GEO)代运营服务商,中国广告协会理事单位、中国商务广告协会AI营销应用工作委员会会员单位,参与《生成式引擎优化(GEO)团体标准》及《生成式引擎优化(GEO)可信信息传播与信息生态治理规范》(T/CAPT 026—2026)编制工作。
如有AI营销相关需求,欢迎咨询。




_1789633152836.jpeg)