GEO · AI 搜索优化

为什么你的外贸站,在 ChatGPT 答案里消失了

外贸AI库 · 公开版 · 约 9 分钟

越来越多的 B2B 买家在下单前先问 AI:"who are reliable wholesale auto parts suppliers in China?" 如果你的站根本没出现在 ChatGPT、Perplexity 的回答里,问题往往不在内容——而在你的站根本没让 AI 爬进来。这篇按"先放行、再可抽取"的顺序,给你能照抄的 robots 示例和自查步骤。(各爬虫 UA 与平台规则以厂商官方文档为准。)

一个被严重低估的问题

大量 B2B 独立站为了防刷、防采集,在 CDN 或 WAF(防火墙)层做了"拦机器人"的规则。问题是:这类规则经常把 AI 搜索爬虫一起误杀了。结果是——你的站在 Google 蓝链里可能还排得不错,却在 AI 答案里彻底消失。

而这正发生在 AI 搜索快速吃掉点击的当口:AI 直接给答案后,很多查询用户根本不再点进传统蓝链,"出现在 AI 答案里"本身已经成了新的流量入口。你拦掉爬虫,等于主动退出这个入口。

关键区分:搜索爬虫 vs 训练爬虫

很多人一刀切地"屏蔽所有 AI bot",这是误区。它们分两类,目的完全不同:

类型代表 UA(以官方文档为准)建议姿态
搜索爬虫(决定你是否被 AI 答案引用)OAI-SearchBot、ChatGPT-User、PerplexityBot、Claude-SearchBot 等放行
训练爬虫(抓内容用于模型训练)GPTBot、ClaudeBot、CCBot、Google-Extended 等可选择性拦截

换句话说:你可以"不让它拿去训练,但允许它在回答用户时引用你"。把搜索爬虫放行、训练爬虫按需处理,才是当下的标准姿态——而不是无脑全拦。

可照抄的 robots.txt 放行示例

下面这段的逻辑是:放行搜索爬虫、按需拦训练爬虫(UA 请按各厂商最新官方文档核对增删):

# 允许 AI 搜索爬虫抓取(被答案引用) User-agent: OAI-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Claude-SearchBot Allow: / # 不希望内容被拿去训练(按需,可删) User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: /

内行点:robots 只是"君子协定"层。真正最隐蔽的拦截发生在 WAF/CDN——robots 放行了,Cloudflare 的 Bot 规则却还在 403,照样进不来。两层都要查。

三步自查:你被误拦了吗

看 robots.txt

检查是否有 Disallow: / 命中了上面那些搜索爬虫 UA。很多模板默认拦了一长串 bot。

查 CDN / WAF 规则

Cloudflare 等的"Bot Fight Mode"、托管挑战规则,可能在 robots 之外直接挡掉爬虫请求。这是最隐蔽、最常见的元凶。

用 AI 实测

直接去 ChatGPT / Perplexity 问与你品类 + 市场强相关的问题,看会不会引用到你;再看服务器日志里有没有那些搜索爬虫的访问记录。

放行之后,还要让内容"可被抽取"

放进来只是第一步。AI 更愿意引用结构清晰、答案前置的页面:

端到端 worked example:一个站怎么从"消失"到"被引用"

某汽配独立站,Google 有排名但 ChatGPT 从不提它。
① 实测:去 Perplexity 问 "wholesale brake pads suppliers China",答案里没有它。
② 查 robots:模板默认 Disallow: / 拦了一串 bot,含搜索爬虫 → 改成上面的放行示例。
③ 查 WAF:Cloudflare Bot Fight Mode 开着、还在 403 → 给搜索爬虫 UA 加放行规则。
④ 改内容:产品页开头加一段"我们是谁、MOQ、认证、主供市场"的答案胶囊 + 事实表格 + FAQ。
⑤ 等收录后复测:日志里开始出现 OAI-SearchBot 访问,AI 问答里逐步被引用。
顺序是关键:先让它进得来(②③),再让它愿意引(④)。

小结(带增量):先确认 AI 爬虫能进来(robots + WAF 两层都查,WAF 才是隐蔽元凶),区分搜索爬虫(放行)和训练爬虫(按需拦),再把内容做成"答案前置 + 可抽取事实 + FAQ/Schema"。顺序别反——内容做得再好,爬虫进不来都是零。UA 和规则以各厂商官方文档为准。

常见问题 FAQ

为什么我的外贸站在 ChatGPT 答案里搜不到?

常见原因不是内容不好,是你的站没让 AI 搜索爬虫进来。很多 B2B 站为防刷在 CDN 或 WAF 层设了拦机器人规则,经常把 AI 搜索爬虫一起误杀。先查 robots.txt 和 WAF 规则有没有挡住 OAI-SearchBot、PerplexityBot 这类搜索爬虫,再谈内容优化。

AI 搜索爬虫和训练爬虫有什么区别?

搜索爬虫(如 OAI-SearchBot、PerplexityBot)决定你是否被 AI 答案引用,应放行;训练爬虫(如 GPTBot、ClaudeBot)抓内容用于模型训练,可按需选择性拦截。正确姿态是不让它拿去训练但允许它回答用户时引用你,而不是无脑全拦。具体 UA 以各厂商官方文档为准。

怎么查我的站是不是误拦了 AI 爬虫?

三步:① 看 robots.txt 有没有 Disallow 命中那些搜索爬虫 UA,很多模板默认拦一长串 bot;② 查 CDN/WAF 规则如 Cloudflare 的 Bot Fight Mode 和托管挑战,这是最隐蔽的元凶;③ 直接去 ChatGPT/Perplexity 问你品类+市场强相关的问题看会不会引用你,再看服务器日志有没有搜索爬虫访问记录。

放行爬虫后怎么让内容更容易被 AI 引用?

放进来只是第一步。AI 更愿意引用结构清晰、答案前置的页面:页面开头直接把核心问题答完整、把 MOQ/付款/认证/交期等事实做成可抽取的表格、保持内容新鲜定期更新、标题层级 H2 H3 H4 规整不跳级、加 FAQ 和 Schema。


本文为外贸AI库「模块 06 · GEO 与 AI 搜索优化」的公开节选。爬虫 UA 与平台规则以各 AI 厂商官方文档为准。会员版含:完整爬虫 UA 放行清单、Cloudflare 规则配置示例、答案胶囊模板、各 AI 引擎实测对照。

想要完整放行清单和模板?

模块 06 的完整版(含配置示例与答案胶囊模板)在会员库里。