为什么你的外贸站,在 ChatGPT 答案里消失了
越来越多的 B2B 买家在下单前先问 AI:"who are reliable wholesale auto parts suppliers in China?" 如果你的站根本没出现在 ChatGPT、Perplexity 的回答里,问题往往不在内容——而在你的站根本没让 AI 爬进来。这篇按"先放行、再可抽取"的顺序,给你能照抄的 robots 示例和自查步骤。(各爬虫 UA 与平台规则以厂商官方文档为准。)
一个被严重低估的问题
大量 B2B 独立站为了防刷、防采集,在 CDN 或 WAF(防火墙)层做了"拦机器人"的规则。问题是:这类规则经常把 AI 搜索爬虫一起误杀了。结果是——你的站在 Google 蓝链里可能还排得不错,却在 AI 答案里彻底消失。
而这正发生在 AI 搜索快速吃掉点击的当口:AI 直接给答案后,很多查询用户根本不再点进传统蓝链,"出现在 AI 答案里"本身已经成了新的流量入口。你拦掉爬虫,等于主动退出这个入口。
关键区分:搜索爬虫 vs 训练爬虫
很多人一刀切地"屏蔽所有 AI bot",这是误区。它们分两类,目的完全不同:
| 类型 | 代表 UA(以官方文档为准) | 建议姿态 |
|---|---|---|
| 搜索爬虫(决定你是否被 AI 答案引用) | OAI-SearchBot、ChatGPT-User、PerplexityBot、Claude-SearchBot 等 | 放行 |
| 训练爬虫(抓内容用于模型训练) | GPTBot、ClaudeBot、CCBot、Google-Extended 等 | 可选择性拦截 |
换句话说:你可以"不让它拿去训练,但允许它在回答用户时引用你"。把搜索爬虫放行、训练爬虫按需处理,才是当下的标准姿态——而不是无脑全拦。
可照抄的 robots.txt 放行示例
下面这段的逻辑是:放行搜索爬虫、按需拦训练爬虫(UA 请按各厂商最新官方文档核对增删):
# 允许 AI 搜索爬虫抓取(被答案引用) User-agent: OAI-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Claude-SearchBot Allow: / # 不希望内容被拿去训练(按需,可删) User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: /
内行点:robots 只是"君子协定"层。真正最隐蔽的拦截发生在 WAF/CDN——robots 放行了,Cloudflare 的 Bot 规则却还在 403,照样进不来。两层都要查。
三步自查:你被误拦了吗
看 robots.txt
检查是否有 Disallow: / 命中了上面那些搜索爬虫 UA。很多模板默认拦了一长串 bot。
查 CDN / WAF 规则
Cloudflare 等的"Bot Fight Mode"、托管挑战规则,可能在 robots 之外直接挡掉爬虫请求。这是最隐蔽、最常见的元凶。
用 AI 实测
直接去 ChatGPT / Perplexity 问与你品类 + 市场强相关的问题,看会不会引用到你;再看服务器日志里有没有那些搜索爬虫的访问记录。
放行之后,还要让内容"可被抽取"
放进来只是第一步。AI 更愿意引用结构清晰、答案前置的页面:
- 答案前置:页面开头就把核心问题直接答完整——AI 偏好能一句话摘走结论的段落,别让结论埋在长铺垫后面;
- 事实表格化:把 MOQ、付款方式、认证、交期写成能直接抽取的表格,而不是埋在段落里;
- 保持新鲜:定期更新内容、标注更新时间——陈旧页面更难被引用;
- 顺序标题:H2 > H3 > H4 规整,别跳级、别用样式假装标题;
- 加 FAQ + Schema:问答式结构正好对上用户向 AI 提问的方式,更易被抓取引用。
端到端 worked example:一个站怎么从"消失"到"被引用"
某汽配独立站,Google 有排名但 ChatGPT 从不提它。
① 实测:去 Perplexity 问 "wholesale brake pads suppliers China",答案里没有它。
② 查 robots:模板默认 Disallow: / 拦了一串 bot,含搜索爬虫 → 改成上面的放行示例。
③ 查 WAF:Cloudflare Bot Fight Mode 开着、还在 403 → 给搜索爬虫 UA 加放行规则。
④ 改内容:产品页开头加一段"我们是谁、MOQ、认证、主供市场"的答案胶囊 + 事实表格 + FAQ。
⑤ 等收录后复测:日志里开始出现 OAI-SearchBot 访问,AI 问答里逐步被引用。
顺序是关键:先让它进得来(②③),再让它愿意引(④)。
小结(带增量):先确认 AI 爬虫能进来(robots + WAF 两层都查,WAF 才是隐蔽元凶),区分搜索爬虫(放行)和训练爬虫(按需拦),再把内容做成"答案前置 + 可抽取事实 + FAQ/Schema"。顺序别反——内容做得再好,爬虫进不来都是零。UA 和规则以各厂商官方文档为准。
常见问题 FAQ
为什么我的外贸站在 ChatGPT 答案里搜不到?
常见原因不是内容不好,是你的站没让 AI 搜索爬虫进来。很多 B2B 站为防刷在 CDN 或 WAF 层设了拦机器人规则,经常把 AI 搜索爬虫一起误杀。先查 robots.txt 和 WAF 规则有没有挡住 OAI-SearchBot、PerplexityBot 这类搜索爬虫,再谈内容优化。
AI 搜索爬虫和训练爬虫有什么区别?
搜索爬虫(如 OAI-SearchBot、PerplexityBot)决定你是否被 AI 答案引用,应放行;训练爬虫(如 GPTBot、ClaudeBot)抓内容用于模型训练,可按需选择性拦截。正确姿态是不让它拿去训练但允许它回答用户时引用你,而不是无脑全拦。具体 UA 以各厂商官方文档为准。
怎么查我的站是不是误拦了 AI 爬虫?
三步:① 看 robots.txt 有没有 Disallow 命中那些搜索爬虫 UA,很多模板默认拦一长串 bot;② 查 CDN/WAF 规则如 Cloudflare 的 Bot Fight Mode 和托管挑战,这是最隐蔽的元凶;③ 直接去 ChatGPT/Perplexity 问你品类+市场强相关的问题看会不会引用你,再看服务器日志有没有搜索爬虫访问记录。
放行爬虫后怎么让内容更容易被 AI 引用?
放进来只是第一步。AI 更愿意引用结构清晰、答案前置的页面:页面开头直接把核心问题答完整、把 MOQ/付款/认证/交期等事实做成可抽取的表格、保持内容新鲜定期更新、标题层级 H2 H3 H4 规整不跳级、加 FAQ 和 Schema。
本文为外贸AI库「模块 06 · GEO 与 AI 搜索优化」的公开节选。爬虫 UA 与平台规则以各 AI 厂商官方文档为准。会员版含:完整爬虫 UA 放行清单、Cloudflare 规则配置示例、答案胶囊模板、各 AI 引擎实测对照。