外贸OPC
行业观察GEOChatGPTrobots.txtAI爬虫外贸独立站AI获客编辑整理

外贸站的 robots.txt 正在误伤自己:三种 AI 爬虫的区别,和一次 5 分钟自查

OpenAI 不是一个爬虫,是三个:GPTBot 管训练、OAI-SearchBot 管引用、ChatGPT-User 管用户触发读取。屏蔽错一个,你的页面就永远进不了 ChatGPT 的引用池。本文拆清三种爬虫的区别,讲为什么外贸站不该跟着屏蔽训练爬虫,给出四个正在发生的误伤点和一次 5 分钟自查。

外贸OPC 编辑部发布:2026-10-09最后更新:2026-10-09约 14 分钟读完编辑部基于公开资料整理

外贸站的 robots.txt 正在误伤自己:三种 AI 爬虫的区别,和一次 5 分钟自查

上个月帮一家做五金配件的工厂查"为什么 ChatGPT 从来不提我们"。他们做了三年内容,工艺页写得比同行细,阿里店铺也在投。我一开始以为是内容问题,查了两个小时,最后答案在一个三十行的文本文件里。

他们的 robots.txt 是这样的:

User-agent: *
Disallow: /admin/
Disallow: /cart/

看起来很正常,对吧。问题是他们的 CDN 里,"拦截 AI 爬虫"那个开关是默认打开的。三年里,ChatGPT 的搜索爬虫一次都没能读完他们的产品页。不是内容不够好,是门从里面锁上了。

这不是个例。2026 年大家都在谈怎么让 AI 引用自己,却很少有人先检查那扇门是不是开的。今天这篇就讲这一件事,因为它是所有 GEO 动作里成本最低、见效最直接、也最容易被忽略的一步。

三种爬虫,三个开关,大部分人只知道一个名字

OpenAI 不是一个爬虫,是三个,各管一件事。混为一谈是 robots.txt 里最常见的错误。

爬虫 作用 被屏蔽的后果 是否影响 ChatGPT 引用
GPTBot 批量抓取,可能用于模型训练 内容不进训练语料 不直接影响(仅间接)
OAI-SearchBot 实时搜索索引,供 ChatGPT Search 检索与引用 页面无法作为引用源出现 直接决定生死
ChatGPT-User 用户在对话里粘贴你的 URL 时触发抓取 用户手动要求的读取可能失败 不适用(OpenAI 称 robots.txt 可能不适用)
OAI-AdsBot 检查广告落地页合规性 影响广告审核 不影响自然引用

(来源:ICODA《GPTBot Explained》2026 版、SERP Mentor《GPTBot vs OAI-SearchBot vs ChatGPT-User》2026 年 10 月更新、CrawlReady AI 的 OpenAI 爬虫指南,均为第三方口径)

这里有个反直觉的点值得单独说:屏蔽 GPTBot 不会让你从 ChatGPT 搜索里消失,屏蔽 OAI-SearchBot 会。

很多站长做的正好是反过来的那件事——他们听说"AI 在偷我的内容",于是封了 GPTBot,以为这就把 AI 挡在门外了。实际上训练抓取封掉了,搜索引用通道还开着,白挨一刀。另一批人更惨:他们从某个自媒体那儿复制了一整段"AI 爬虫全封"的规则,把三个 user-agent 一起 Disallow,等于亲手把自己从 ChatGPT 的答案里删除。

我的立场:外贸工厂站,不该跟着"屏蔽训练爬虫"的主流建议走

2026 年英文 SEO 圈有个近乎默认的模板:block training, allow search。也就是封掉 GPTBot、ClaudeBot、Google-Extended、CCBot,放行 OAI-SearchBot、PerplexityBot、Claude-SearchBot。

对新闻站、付费研究站、UGC 论坛,这套逻辑成立。对一家年营收几千万、靠独立站拿询盘的中国工厂,我认为它是错的。理由有四条。

第一,你的内容不是知识产权资产,是获客物料。 工厂站上最有价值的东西是工艺参数、公差范围、材料清单、MOQ 和交期常识。这些东西你本来就想让买家看到,巴不得被抄走。把它们喂给模型,等于多了一个全天候分发渠道。你真正要保护的——底价表、客户名单、图纸、模具结构——本来就不该出现在公开页面上。

第二,用 robots.txt 保护商业秘密是自欺欺人。 robots.txt 是一个请求,不是一道锁。守规矩的爬虫会遵守,专门爬数据的不会。SERP Mentor 那篇文章里有一句话我完全同意:它是 control point 对守规矩者有效,对不守规矩者毫无法律效力。你真正该做的是别把底价放上网,而不是放上去之后再写一行 Disallow。

第三,新站尤其需要这条通道。 一家做了三年的工厂站,在 Google 里的域名权威大概率还是个位数。在这个权重下,被模型"认识"本身就是稀缺资源。新加坡 Best SEO 在 2026 年的 AI 爬虫配置矩阵里给了一条和我判断一致的建议:上线不足 6 个月、权威度低的商业站,建议 allow everything,可见性优先,到第 12 个月再重新评估。这条建议在中国外贸站这个群体里,适用范围比他们想象的大得多——因为我们绝大多数人的站,权威度都很低。

第四,你放弃的东西换不回来任何东西。 封掉 GPTBot 的收益是"我的工艺说明可能不会被用于训练",成本是"我在模型认知里的存在感少一条来源"。前者是个象征性的、无法验证的收益,后者是可以按月追踪的实际损失。这笔账对中小外贸企业根本不划算。

我把话说清楚:除非你的网站有付费墙、UGC 或者受监管内容,否则一律放行。 这不是偷懒,是算过账的结论。

四个正在发生的误伤点

按我见到的频率排序。

误伤一:User-agent: * 下面的宽泛规则,没有给 AI 搜索爬虫单独放行。

robots.txt 的匹配规则是"更具体的 user-agent 优先",但不少站的文件里只有一条 User-agent: *,后面跟着一串 Disallow。如果你的主题目录、产品目录、博客目录恰好落在被禁的路径里,AI 搜索爬虫也会一并被挡。正确做法是显式写:

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

有几家 SEO 机构的文档提到,Allow: / 在无 Disallow 时技术上不是必需的,但保留它有两个实际好处:给下一个改文件的人写明意图,以及防止文件前面那条 User-agent: * 的宽泛规则误伤。我同意这个做法。

误伤二:CDN 和安全插件的隐藏开关。

这是最坑的一类,因为你在 robots.txt 里看不到它。Cloudflare 有独立的 AI 爬虫拦截开关,部分 WordPress 安全插件默认把 AI user-agent 归进"恶意 bot"一并拦截,某些 WAF 规则库也会按 UA 封。结果就是:你的文件明明写着 Allow,请求在边缘节点就被拒了。

SERP Mentor 那篇里专门提醒过:有些安全插件和防火墙会在 robots.txt 之外按 user-agent 屏蔽 AI 爬虫。如果 ChatGPT 从来不引用你,除了查文件,还要查这些设置。

误伤三:抄来的"全封"名单。

网上流传着一些"把所有 AI 爬虫都封掉"的 robots.txt 模板,一长串 user-agent 后面全是 Disallow。这些模板大多出自 2023–2024 年那波"AI 偷内容"的情绪高峰,作者的分发收益和你的获客收益根本不是一回事。你照抄,等于替别人的立场买单。

误伤四:把产品目录整个禁掉。

有些工厂为了"防止同行抄款",把 /product/ 全目录 Disallow。这在 Google 时代已经是自伤,到了 AI 时代是致命的——因为买家用 AI 问的恰恰是产品问题。前面我写过,ChatGPT 在"帮我找能做 X 的供应商"这类产品发现问题上引用率最高(18.3%,第三方口径),你把产品页关掉,等于主动放弃了引用率最高的那一类查询。

这里补一句 B2B 平台的事:阿里国际站、Made-in-China 的店铺页,你改不了它们的 robots.txt。它们放不放行是平台的事。这恰恰是你自己的独立站必须放行的理由——那是你唯一能控制的、100% 属于你的入口。

一次 5 分钟自查

按顺序做,全程不需要技术背景。

  1. 浏览器打开 你的域名/robots.txt,肉眼找有没有 OAI-SearchBot、PerplexityBot、Claude-SearchBot 这几行。没有就是没放行。
  2. 登录 CDN 后台(Cloudflare 之类),搜索 bot / crawler / AI 相关的设置项,确认 AI 爬虫没被整体拦截。
  3. 如果你用 WordPress 且装了安全插件,进插件设置里看有没有"block AI bots"之类的开关。
  4. 把你的一个产品页 URL 粘进 ChatGPT,让它总结页面内容。这一步走的是 ChatGPT-User 通道,通常不受 robots.txt 限制,能验证的是"页面内容能不能被读懂"。
  5. 问一个真实的买家问题,比如"中国有哪些能做 XX 工艺的工厂",看你的公司有没有被提到。这一步测的是 OAI-SearchBot 通道。

第 5 步这个动作,建议你固定下来,每月问一次同样的问题,把结果记在一张表里。AI 可见度是波动的,单次快照说明不了什么,趋势才有意义。

关于生效时间要有心理准备:SERP Mentor 提到,robots.txt 的改动不是即时的,爬虫下次访问时才会重新读取文件;ICODA 那篇给的经验值是 OpenAI 系统层面反映变化大约需要 24 小时起步。我的建议是按周观察,别今天改、明天没动静就判定失败。

别把希望全押在这一步

放行爬虫只是拿到了门票,不是拿到了位置。

我之前写过 ChatGPT 的一次检索行为分析:15,000 条提示词里,模型为写答案检索了 548,534 个页面,最终出现在答案里的引用只有 82,108 次,引用率 15%。而品牌自有站在 ChatGPT 引用来源里的占比,几份第三方报告给出的数字在 11% 到 21% 之间(Presenc AI 2026 Q1 为 11%,Indexly 2026 年 4–6 月面板为 13%,MaxAEO 2026 年 3–5 月把厂商文档与博客合并计为 21%)。

翻译过来就是:门开了,你有资格被考虑;但答案里那三四个位置还是会优先给到别人家的页面。真正决定你能不能被摘走的,是你的页面有没有可被直接引用的一段话——具体的数字、清晰的对比、明确的定义,而不是"专业制造、出口三十国"。

所以正确的顺序是:先确认门是开的,再去改造门里的东西。顺序反了,内容做得再好也是白做。

顺带说一句,这套机制反过来用在你查买家身上也一样成立——AI 判断一家公司靠的是公开、可交叉验证的事实,你判断一个询盘真不真,用的应该是同一套方法。具体怎么用,我写在《用 ChatGPT 做海外买家背调:5 个提示词与 3 步交叉核实》里了。

常见问题

屏蔽 GPTBot 是不是就能让我的内容不被 AI 拿去训练?

只能让它不进 OpenAI 的公开训练抓取,不能阻止其他渠道。而且代价是它在模型认知里的存在感少一条来源。对以获客为目的的外贸站,我建议不要屏蔽——你要保护的东西本来就不该放上网,放了再屏蔽是无效保护。

我的网站用的是 SaaS 建站平台,改不了 robots.txt 怎么办?

先看平台后台有没有"搜索引擎可见性"或"robots.txt 自定义"入口,多数平台提供。确实改不了的,重点转去做可被 AI 摘走的内容,并把产品信息同步到你能控制的第三方页面(行业目录、协会名录、展会页面)。自有站是唯一完全属于你的入口,如果连它都不可控,长期看值得换。

放行 AI 爬虫会不会把我的底价和客户资料泄露出去?

不会泄露你没放上网的东西,但会抓取你放上网的所有公开页面。所以真正的防线在发布环节:底价、客户名单、图纸、成本结构不要出现在任何公开 URL 上。robots.txt 不是保密工具,它连普通搜索引擎都只是"请求"级别。

改完 robots.txt 多久能在 ChatGPT 里看到效果?

至少要等爬虫下一次访问重新读取文件,业内经验值是 24 小时起步,实际以周为单位更现实。建议每月固定问一组相同的买家问题并记录结果,看趋势而不是看单次结果。

我用了 Cloudflare 的 AI 爬虫拦截,是不是一定要关掉?

如果你的目标是在 AI 答案里被引用,那就要关掉或至少为 OAI-SearchBot、PerplexityBot 放行。这类边缘拦截在 robots.txt 之外生效,你的文件写得再正确也没用。这是本次自查里最容易被漏掉、也最常见的一处。


本文引用的爬虫机制、配置建议与占比数据均来自公开第三方资料(ICODA、SERP Mentor、CrawlReady AI、Best SEO、Presenc AI、Indexly、MaxAEO 等),各家统计口径与采样窗口不同,数值存在差异,仅作方向性参考,不代表 OpenAI 官方口径。robots.txt 与 CDN 配置涉及你站点的实际访问策略,修改前请自行评估并留档。

免费诊断由 用AI做外贸(aizuowaimao.com)提供

海外买家问 AI「找供应商」时,推荐的名单里有您吗?

对照这篇自查一遍,如果中了其中两条以上,与其继续猜,不如让诊断直接告诉你问题出在哪一环。

检测企业在豆包、ChatGPT 等大模型中的被提及与推荐情况。

免费测试我的企业 AI 可见度

免费,填企业基本信息即可。报告直接说明问题出在哪,不推销。

文中提到的工具,可对比后自选

工具条目由编辑部整理,标注价格、使用门槛与内容来源。你也可以按经营环节浏览全部工具。

继续阅读

自查之后,如果你发现自己做太麻烦

工具和方法都摆在这里,自己跑完全可行——只是要有人长期盯。如果团队里没人能盯这件事, 可以由专业团队接手。企业级服务由创贸集团提供(本站关联方,如实标注)。

看创贸集团的企业服务 →