// 指南
如何才能被 ChatGPT 引用?
更新于: 2026-07-31
// 简短答案
要被 ChatGPT 引用需要三件事:在 robots.txt 中向 OAI-SearchBot 和 GPTBot 开放抓取权限;页面在服务端渲染,且段落脱离上下文也能被模型直接引用;以及有独立来源用同样的说法描述你的品牌。抓取权限与结构决定你是否有资格,佐证决定你是否被点名。
先解决抓取权限,因为它是非黑即白的
OpenAI 为不同任务提供了不同的用户代理。GPTBot 为模型训练抓取内容,OAI-SearchBot 构建 ChatGPT 浏览功能背后的搜索索引,而 ChatGPT-User 则在用户提问触发实时检索时抓取具体页面。
屏蔽 OAI-SearchBot,等于把自己从 ChatGPT 搜索所依赖的索引中移除,而那正是与引用直接相关的索引。团队常常为了防止内容被用于训练而把三者一并屏蔽,随后困惑于为什么被点名的是竞争对手。如果目标是可见性,至少要放行搜索与用户这两类代理。
- OAI-SearchBot——支撑 ChatGPT 搜索;想被引用就要放行它。
- ChatGPT-User——在响应具体用户请求时抓取页面。
- GPTBot——为训练而抓取;屏蔽它不会把你从搜索中移除。
在服务端渲染
检索抓取的是 HTML 并从中提取文本,它不会可靠地执行 JavaScript,也不会等待客户端框架完成 hydration。只有在 hydration 之后才存在的内容,常常被读成一个空白页面。
有一个零成本的检验方法:禁用 JavaScript 请求该页面,或直接查看原始响应,确认你希望被引用的那句话确实存在于标记之中。
写出经得起被提取的段落
模型在组织答案时取的是片段。一个必须依赖前三段才能读懂的片段是糟糕的候选;一个自身就把答案说完整的片段则是理想的候选。
可靠的写法是:标题直接写成人们真正会问的那个问题,紧接着给出紧凑的答案,并在答案中明确写出主语,而不是用「它」或「这种做法」来指代,之后才展开细节。具体的数字、日期和有名有姓的来源,会让一段话比同样含糊的表述更值得被引用。
在自有域名之外建立佐证
面对商业问题——哪家供应商、哪家机构、哪款工具更好——助手高度依赖第三方来源:盘点文章、目录站、社区讨论和评测平台。一个只存在于自家网站上的品牌,没有任何东西为它的说法背书。
这是整项工作中最慢的部分,也最能决定你是否被点名。进入相关的清单文章与目录站,并在出现的每一处都保持一致的描述,比再做一轮页面内改动更有效。
让实体没有歧义
模型必须先确认你是谁,才谈得上推荐你。JSON-LD 中的 Organization 标记、随处一致的名称与描述,以及指向真实资料页的 sameAs 列表,都能降低歧义。
如果 sameAs 数组里只有自己的主页,那它没有任何意义——重点是把实体链接到它同样出现的那些独立位置。
相关问题
发布 llms.txt 文件能让 ChatGPT 引用我吗?
目前没有公开信息确认 OpenAI 会读取 llms.txt。发布它成本很低,也能帮到确实会读取它的工具,但应当把它当作一次小额押注,而不是一种机制——真正被证明有效的是抓取权限与内容结构。
一个新页面多久可能被引用?
被抓取之后,页面可以在数天内出现在实时检索类的答案中。而基于模型训练知识、而非实时搜索得出的答案,滞后要长得多——这也是同一个问题会给出截然不同来源的原因。
为什么 ChatGPT 引用的是我的竞争对手而不是我?
通常是三个原因之一:搜索爬虫被屏蔽,或页面走客户端渲染;相关论点没有写成可直接引用的段落;或者竞争对手被更多独立来源描述过。按这个顺序逐项排查。
为了不让内容进入训练,应该屏蔽 GPTBot 吗?
这是一个正当的选择,只要 OAI-SearchBot 保持放行,它不会把你从 ChatGPT 搜索中移除。真正让你损失引用的,是屏蔽搜索与用户这两类代理。