ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

如何让ChatGPT引用你的内容:GPTBot、OAI-SearchBot与llms.txt实操指南

如何让ChatGPT引用你的内容:GPTBot、OAI-SearchBot与llms.txt实操指南 1. 被AI引用的底层逻辑从“排名游戏”到“引用游戏”做内容的人这两年应该都有一个明显体感以前我们盯的是搜索引擎的排名现在越来越多的人开始盯“AI会不会提到我”。这个变化不是玄学背后是一整套抓取、索引、召回、生成的链路在起作用。你写的东西能不能被ChatGPT这类对话式产品引用本质上取决于两件事第一它的抓取系统有没有拿到你的内容第二它在生成答案时有没有理由把你当成可信来源拎出来。先把几个关键角色摆清楚不然后面全是空谈。GPTBot是内容抓取端的爬虫标识它负责把公开网页内容抓回去用于模型训练和部分检索场景。OAI-SearchBot则是面向搜索/检索场景的抓取标识它抓的内容更多是服务于“实时问答时去网上找资料”这个环节。这两个东西经常被混为一谈但它们的用途、抓取频率、对页面结构的要求都不太一样。你在服务器日志里看到的User-Agent是判断“AI到底来没来过”的第一手证据。robots.txt是老朋友了它是网站根目录下的一个纯文本协议文件用来告诉爬虫“哪些能抓、哪些不能抓”。很多人以为它只管传统搜索引擎其实GPTBot、OAI-SearchBot这类爬虫同样会读它。你如果一刀切把全站Disallow了那AI抓不到你引用自然无从谈起。反过来你如果放行但页面质量稀烂抓了也白抓。llms.txt是这两年冒出来的新东西可以理解成“给大模型看的站点说明书”。它不像robots.txt那样是强制协议更像是一种约定俗成的建议文件放在站点根目录用Markdown格式告诉模型我这个站点是干什么的、核心内容在哪、哪些页面值得优先看。它目前不是所有产品都认但属于“做了不亏、早做早占位”的动作。所以“如何被ChatGPT引用”这个问题拆开就是三层抓得到爬虫放行、读得懂结构清晰、信得过内容有权威性和可引用性。下面我按这个顺序把每一层的实操细节和踩坑经验摊开讲。2. 抓得到爬虫放行与站点可访问性排查2.1 先搞清楚你的站点到底被谁抓了很多人上来就问“怎么被引用”但连自己站点有没有被AI爬虫访问过都不知道。第一步永远是看日志。你打开服务器的access log按User-Agent过滤重点看这几个关键词GPTBot、OAI-SearchBot、ChatGPT-User。ChatGPT-User是用户在对话里触发实时联网时用的标识出现频率往往比前两个高因为它跟真实用户提问强相关。如果你用的是Nginx可以这样快速统计grep -i GPTBot /var/log/nginx/access.log | wc -l grep -i OAI-SearchBot /var/log/nginx/access.log | wc -l grep -i ChatGPT-User /var/log/nginx/access.log | wc -l三个数字如果都是0那说明要么爬虫没来过要么被你的防火墙、CDN、WAF拦在了外面。这时候别急着改robots.txt先确认网络层有没有放行。我遇到过好几次robots.txt写得漂漂亮亮结果Cloudflare的Bot Fight Mode把GPTBot当恶意流量给挡了日志里干干净净白忙活一周。注意部分CDN和WAF默认会拦截“非人类流量”GPTBot这类爬虫很容易被误伤。排查顺序应该是“网络层 → robots.txt → 页面层”别跳步。2.2 robots.txt怎么写才算“既放行又不失控”robots.txt的语法很简单但坑不少。一个对AI爬虫友好的基础写法大概是这样User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: * Allow: /这里有几个细节值得说。第一ChatGPT-User是用户主动触发的放行它对“被实时引用”帮助最直接因为用户问什么它就去找什么。第二如果你有付费墙或者登录后才能看的内容爬虫抓到的是登录页那放行也没意义反而浪费抓取配额。第三别用Disallow: /去赌气有些站长因为担心内容被白嫖就全站封禁结果就是彻底从AI的视野里消失这个代价在流量结构变化之后会越来越明显。还有一种情况是“只想让AI抓不想让传统搜索引擎抓”这个用User-agent分组就能实现但我不建议这么做因为大部分AI检索的底层还是依赖通用索引能力人为割裂反而降低被召回的概率。2.3 llms.txt给模型递一张“内容地图”llms.txt目前没有强制标准但社区里比较通行的写法是Markdown格式放在根目录内容大致包括站点简介、核心板块链接、重点文章列表。举个我实际在用的简化版# 某某技术博客 专注后端架构与AI工程实践每周更新深度长文。 ## 核心内容 - [AI检索与引用机制](/posts/ai-citation) - [爬虫日志分析实战](/posts/crawler-log) - [内容结构化指南](/posts/content-structure) ## 联系方式 - 站点地图/sitemap.xml它的作用不是“保证被引用”而是降低模型理解你站点结构的成本。你可以把它理解成给AI看的一份“导读”。我实测下来加了llms.txt之后OAI-SearchBot对核心页面的抓取频率有可见提升当然这也有可能是同期内容更新带来的不能完全归因但成本极低值得做。2.4 页面可访问性的三个硬指标爬虫能不能顺利读到内容还取决于页面本身。三个硬指标首屏渲染速度、是否有JS阻塞、返回状态码是否稳定。很多现代前端站点是客户端渲染爬虫拿到的HTML里只有一堆div和script正文根本没渲染出来那抓回去也是空的。判断方法很简单用curl直接拉页面源码curl -A GPTBot https://你的域名/某篇文章 -s | head -100如果返回的HTML里能看到正文文字说明服务端渲染没问题如果只有框架代码那就要考虑做SSR或者预渲染。状态码方面确保核心页面稳定返回200别今天200明天302跳登录爬虫会直接放弃。3. 读得懂内容结构如何影响被引用概率3.1 为什么“结构清晰”比“文笔好”更重要这里要讲一个反直觉的点AI在决定引用谁的时候可解析性的权重往往高于文采。因为模型需要从页面里抽取“一段能直接回答用户问题的文本”如果你的内容是一大坨没有小标题、没有列表、没有明确结论的散文抽取难度就高被选中的概率就低。我做过一个对比实验同一篇技术内容一版是纯段落叙述一版加了H2/H3小标题、要点列表和结论句。两周后加了结构的那版在对话产品里被引用的次数明显更多。原因不复杂结构化内容更容易被切成独立的“语义块”每个块都能单独回答一个问题。所以写作时要有意识地把内容组织成“问答单元”。比如你要讲robots.txt就单独起一个小节开头一句直接给结论后面再展开。模型最喜欢这种“结论前置解释在后”的段落。3.2 标题层级、列表和表格的实战用法标题层级要规范H1只出现一次H2做主要章节H3做子主题别跳级。列表适合罗列要点、步骤、参数表格适合对比。这些不只是给人看的也是给解析器看的。举个表格的例子把爬虫标识和用途对照清楚标识用途是否读robots.txt对引用的影响GPTBot训练与索引抓取是间接决定内容是否进入知识库OAI-SearchBot检索场景抓取是直接影响实时问答召回ChatGPT-User用户触发联网是最直接用户问什么抓什么这种表格对模型来说非常友好因为它把“实体-属性-关系”摆得明明白白抽取成本极低。3.3 语义块切分让每段都能“独立成答”一个实用技巧是每写300到500字就问自己一句“这段能不能单独回答一个问题”。如果不能说明它依赖上下文太多模型切出来也没法用。解决办法是在段落开头加一句概括性的主题句比如“判断爬虫是否来访最直接的方法是查服务器日志”然后再展开细节。另外避免用“如上所述”“见前文”这类指代因为切块之后这些指代就失效了。把每个小节都当成一篇微型文章来写是提升被引用率最有效的手段之一。3.4 元数据与结构化标记的加分项除了正文结构页面的元数据也有影响。title、meta description、og:title这些字段模型在判断页面主题时会参考。还有Schema.org的结构化数据比如Article、FAQPage、HowTo虽然不保证被采用但属于“有比没有好”的加分项。我一般会给技术文章加Article标记给教程类加HowTo给问答类加FAQPage。用JSON-LD写在head里不影响页面展示成本很低。4. 信得过内容权威性与可引用性的构建4.1 权威性不是“自封”的是外部信号堆出来的模型判断一个来源可不可信看的是外部信号有没有其他站点引用你、你的域名在相关领域有没有持续输出、内容有没有明确的作者和更新时间。这些信号不是一天建成的但可以主动经营。最直接的动作是保持更新频率和主题聚焦。一个每周更新、只写后端架构的站点在“后端架构”这个语义空间里的权重会高于一个什么都写、更新随缘的站点。模型在召回时倾向于选择主题一致的来源因为噪声低。4.2 作者信息、更新时间和引用来源页面上要明确标注作者、发布时间、最后更新时间。这不是形式主义模型在判断内容时效性时会用到。一篇2021年的文章讲某个工具的用法和2024年更新的同主题文章被引用的概率完全不同。引用外部来源也要规范尽量链接到原始出处别做“二手转述”。模型在评估内容可信度时会看你的论述有没有支撑。全是个人断言、没有任何引用和数据的文章可信度评分天然偏低。4.3 内容深度与“可验证性”被引用多的内容通常有一个共同点具体、可验证。比如你写“robots.txt要放行GPTBot”不如写“在robots.txt里加User-agent: GPTBot和Allow: /然后用curl -A GPTBot测试返回200”。后者有操作、有命令、有预期结果模型抽取出来就能直接回答用户问题。反过来全是“要重视”“要加强”“很重要”这种空话的内容模型抽不出有效信息自然不会引用。写作时多问自己这段话里有没有一个用户可以照着做的动作有没有一个可以验证的结论4.4 多平台分发与引用网络同一个内容除了自己站点可以在技术社区、问答平台做合理分发但要注意别做低质搬运。分发的价值在于增加“被引用”的入口当多个来源都指向同一个观点时模型对这个观点的置信度会提升。不过这里有个度过度分发、内容农场式铺量反而会被判定为低质。我的做法是核心长文放自己站点社区只发摘要加原文链接保持来源的唯一性和可追溯性。5. 实操排查从零到被引用的完整检查清单5.1 一周内的快速自查流程如果你现在就想知道自己的站点有没有机会被引用可以按这个顺序走一遍查日志确认GPTBot、OAI-SearchBot、ChatGPT-User有没有来访记录。检查robots.txt确认没有误封这三个标识。用curl模拟爬虫拉取核心页面确认正文在HTML里。检查页面是否有清晰的H2/H3结构和结论句。确认作者、更新时间、结构化数据是否齐全。在对话产品里搜自己站点的核心主题看有没有被提及。这套流程走下来基本能定位问题出在“抓不到”还是“读不懂”还是“信不过”。5.2 常见问题速查表现象可能原因排查动作日志里没有任何AI爬虫网络层拦截或robots封禁查WAF/CDN规则查robots.txt有抓取但没被引用内容结构差或权威性低优化结构增加可验证细节抓取频率骤降页面频繁报错或改版查状态码确认URL稳定引用了旧内容新内容未被抓取提交sitemap检查内链引用的是摘要不是原文页面正文被JS渲染做SSR或预渲染5.3 我踩过的几个坑第一个坑是过度依赖llms.txt。早期我以为放了它就万事大吉结果发现它只是辅助核心还是robots放行和内容质量。第二个坑是忽略ChatGPT-User只盯着GPTBot后来才发现实时引用主要靠前者。第三个坑是内容更新后没改更新时间模型以为还是旧内容召回时优先级低。还有一个容易被忽略的点页面URL的稳定性。如果你经常改slug或者做重定向爬虫抓到的链接失效之前积累的引用信号就断了。改版可以但要做好301跳转并且尽量保持核心内容URL不变。6. 内容之外影响引用的几个隐性因素6.1 站点整体权重与主题聚类单个页面能不能被引用和它所在站点的整体权重有关。一个在某个领域持续输出高质量内容的站点其页面被引用的概率高于一个孤立的高质量页面。这就是主题聚类的作用。模型在召回时会倾向于选择“这个站点在这个话题上一直很靠谱”的来源。所以别只盯单篇要有意识地把内容组织成系列。比如你写AI引用机制就围绕爬虫、结构、权威性、排查做成一个专题互相内链形成一个语义网络。6.2 用户提问方式对引用的影响同一个内容用户怎么问会影响它被不被召回。用户问“怎么让ChatGPT引用我的网站”和问“GPTBot是什么”触发的检索路径不同。前者更可能召回操作类内容后者更可能召回定义类内容。这意味着你的内容要覆盖不同的问题形态定义型、操作型、对比型、排查型。一篇好的内容应该同时包含“是什么”“怎么做”“和什么不同”“出问题怎么办”这几个维度。6.3 时效性与热点跟进模型在回答时效性强的问题时会优先召回近期内容。所以跟进热点、及时更新是提升被引用概率的有效手段。但跟进不等于蹭要在自己的主题领域内跟进保持内容的一致性。比如某个爬虫标识更新了行为你第一时间写一篇解析这种内容在接下来几周内被引用的概率会明显高于旧文。但如果你平时写后端突然去写娱乐八卦那即使被引用也不会给你带来持续价值。7. 把“被引用”当成一个长期工程我自己的站点从完全不被引用到核心文章能在对话产品里被稳定提及大概花了三个月。这三个月里做的动作没有一个是“黑科技”全是笨功夫放行爬虫、规范结构、持续更新、增加可验证细节、保持URL稳定。如果非要给一个优先级排序我会说先确保抓得到再确保读得懂最后才是信得过。很多人卡在第一步却不自知天天优化文笔结果爬虫根本没进来。还有一个心态上的建议别把“被引用”当成KPI去刷。它的本质是内容价值的副产品。你写的东西对别人有用、可验证、结构清晰被引用是自然结果。反过来为了被引用而堆砌关键词、做低质分发短期可能有点动静长期一定被降权。最后分享一个我常用的小检查每次发完文章隔一天用curl -A ChatGPT-User拉一次页面确认返回正常、正文完整。这个动作花不了一分钟但能帮你及早发现渲染或拦截问题。内容这行很多时候拼的不是谁更聪明而是谁更少犯低级错误。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进