
如何被 Claude 引用为答案来源:Anthropic 的取材偏好
要被 Claude 引用,靠的不是关键词堆砌,而是「事实密度」加「明确作者实体」。Claude 偏好结构清晰、每个主张都可验证、且不夸大的来源;当它用网页检索工具实时抓取数据时,会优先挑能直接摘录、来历清楚的段落。 内容写得像广告、主张没有数据支撑,就进不了它的引用池。
Claude 是 Anthropic 开发的 AI 助手。它引用外部网站,主要发生在启用「网页搜索」的场景——例如 Claude.ai 开启联网、或通过 API 使用 web_search 与 web_fetch 这两个服务器端工具时。这时 Claude 会实时检索、抓取网页,挑出最能回答问题的来源,并在答案里标注引用。要被选中,你的页面要通过三道关卡:抓得到、可验证、值得引。以下逐一拆解。
第一步:确认 Anthropic 的爬虫抓得到你
Anthropic 的爬虫分两类用途,混为一谈是常见错误,设置时要分开处理:
| User-agent | 用途 | 屏蔽掉的后果 |
|---|---|---|
ClaudeBot |
收集模型训练数据 | 未来版本的模型「脑中」没有你 |
anthropic-ai |
早期训练抓取代理 | 同上,属训练用途 |
Claude-User / Claude-SearchBot |
支持联网回答的实时检索抓取 | Claude 联网回答永远引用不到你 |
这里的关键取舍:训练爬虫与检索爬虫要分别决定。 如果你不希望内容被用于训练,可以只屏蔽 ClaudeBot;但只要屏蔽掉实时检索的 Claude-User,就等于放弃被 Claude 联网回答引用的机会。很多网站用「一键屏蔽 AI 爬虫」的插件或 CDN 设置(例如 Cloudflare 的 AI bot 屏蔽)把两者一起屏蔽掉,自己都不知道。
检查步骤:
- 打开
robots.txt,确认没有对上表的 user-agent 下Disallow。 - 确认 CDN/防火墙没有对这些 bot 返回 403(robots.txt 放行、但 CDN 拦截,是最隐蔽的失败)。
- 重要内容不要全靠 JavaScript 渲染后才出现——检索爬虫对 JS 的处理有限,正文要在 HTML 源码就读得到。
- 用服务器日志确认这些 user-agent 真的有来访。
user-agent 字符串会随时间调整,Anthropic 也会新增或更名爬虫。务实做法是定期查官方文档,并在日志里以
Claude、anthropic为关键词比对,而非只信一份静态清单。
第二步:把每个主张写成「可验证」的内容
这是 Claude 取材偏好和其他引擎差异最大的地方。Anthropic 自家给开发者的文档里,反复强调要用「明确、可验证、有结构」的内容,而不是含糊的营销语言——这套偏好同样反映在 Claude 挑选引用来源时。
Claude 的检索工具(Anthropic 的 web_search 新版本)具备「动态过滤」:它会实时写程序把检索结果先筛过一轮,再送进模型判读。这意味着模糊、无数据、公关腔的段落更容易在这一关被淘汰——不是因为你缺内容,而是因为缺可信度信号。要提高存活率:
| 写法 | 错误示范 | 正确示范 |
|---|---|---|
| 有数据 | 「效果非常好」 | 「GEO 论文实测,可见度最多提升 40%」 |
| 可溯源 | 「业界普遍认为」 | 「Google 官方文档(Search Central)明确说明」 |
| 不夸大 | 「保证第一名」 | 「多数情况提高概率,但无官方保证」 |
| 有结构 | 一大坨纯文字 | 定义句、对比表、编号步骤 |
| 敢写限制 | 通篇只讲优点 | 「此法在 X 情况不适用」 |
最后一项「敢写限制与取舍」尤其重要:Anthropic 训练 Claude 时重视诚实与校准,一篇坦承边界的文章,比通篇吹捧更像可信来源。这也是为什么本文一路标明「无官方保证」「字符串会变动」——这正是 Claude 偏好的语气。
第三步:建立明确的作者实体
Claude 在多个来源之间挑选时,偏向「来历清楚」的页面。你要留下机器读得到的实体信号:
- 明确的作者与品牌:页面有作者名、品牌名,且全站一致。匿名的泛泛内容最难被信任。
- Schema 结构化数据:至少加上 Article 与 FAQPage schema,让模型明确知道谁、何时、讲什么。作者页再补 Person schema 与
sameAs串接社交账号。 - 明确日期:标明发布与更新日期。2026 年的查询,模型明显偏好近期更新、且是实质改版(非只改日期)的来源。
- 主题集群:单篇孤文难以建立权威;同主题写 10 篇以上互相链接,实体权威才会成形。
事实密度加明确作者实体——这两件事合起来,就是「可验证」的具体样貌,也是进入 Claude 引用池的门票。
被 Claude 引用的六项检查清单
发布前逐项对照:
robots.txt没有屏蔽Claude-User/Claude-SearchBot。- CDN/防火墙没有对这些 bot 返回 403。
- 正文在 HTML 源码可读,不依赖 JS 渲染。
- 文章第一段就用 40–80 字给出可摘录的自包含答案。
- 每个关键主张都有数据或可点开的来源,语气不夸大、敢写限制。
- 有明确作者、品牌、发布/更新日期与 Article+FAQPage schema。
常见问题(FAQ)
Q1:Claude 有像 ChatGPT Search 那样的实时引用吗?
有,但要在启用联网/网页搜索工具时才会实时检索并引用外部网页。纯靠模型内部知识回答时不会附实时来源;被训练数据涵盖(ClaudeBot 抓取)与被实时检索引用(Claude-User 抓取)是两条不同的路。
Q2:只屏蔽 ClaudeBot、放行 Claude-User 可以吗? 可以,而且是常见的折中:不让内容进训练集,但保留被 Claude 联网回答实时引用的机会。反过来把两者一起屏蔽掉,是最常见、最可惜的失误。
Q3:关键词密度对被 Claude 引用有帮助吗? 帮助很小,甚至反效果。Claude 的检索过滤偏好事实密度与可信度信号,不是关键词重复次数。把力气放在数据、来源、清楚实体上,比堆关键词有效得多。
Q4:内容用英文写会比较容易被 Claude 引用吗? 对英文查询是;但简体中文查询时,Claude 倾向引用中文原生来源。做中文市场就用地道用语把中文内容写扎实,这反而是竞争较低的机会。
Q5:被引用了却没有链接点击,有意义吗? 有。品牌在 AI 答案中反复出现,累积的是品牌搜索量与信任——这本身就是强力的权威信号,会回头推升整体 SEO 与其他引擎的引用概率。
想知道你的文章够不够格被 Claude 引用?GeoSeoToday 把上述检查逻辑做成了免费的 GEO 就绪度检测器,贴上文章 30 秒拿到 0–100 分。Claude 看重的「可验证、明确作者」其实就是 E-E-A-T 的机器可读版本,想深入请读〈E-E-A-T 是什么?2026 怎么做到〉;若你的目标引擎是 ChatGPT,另见〈如何让 ChatGPT 引用你的网站内容〉。