被 AI 检索
不是因为玄学,是因为这六个机制 ↓
机制 ① .md 镜像 — 每个页面都有纯文本孪生
GET /chapters/chap01.md HTTP/1.1
Host: www.wohupanda.com
HTTP/1.1 200 OK
Content-Type: text/markdown; charset=utf-8
Vary: Accept
Link: </chapters/chap01.html>; rel="alternate"
# 新崤山藏锋录 · 第 1 话 · 渡头初逢
(完整对白 + 逐格画面描述)
机制 ② /llms.txt — 站点说明书
一份放在站点根目录的 Markdown 目录:这是什么站、有哪些作品、哪些章节免费。AI 平台把它当 README 用。
读本站的 llms.txt →# 墨栈 MÒZHÀN
> 华语漫画平台:武侠魔幻、
> 都市言情、生活现实。
## 作品
- [新崤山藏锋录](/work.html): 武侠悬疑 · 连载中 · 第一部 14 话
- [第 1 话 · 渡头初逢](/chapters/chap01.md)
…(全站章节清单)
机制 ③ robots.txt — 明确欢迎 AI 爬虫
很多站一边抱怨「AI 怎么不引用我」,一边在 robots.txt 里把 GPTBot 拦得死死的。我们反着来:
- 放行 GPTBot / ClaudeBot / PerplexityBot / Google-Extended
- 声明 Content-Signal: search=yes, ai-input=yes
- sitemap.xml 每日更新
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Content-Signal: search=yes,
ai-input=yes, ai-train=yes
机制 ④ Accept 内容协商 — 同一 URL,智能返回
# 浏览器请求(要 HTML)
GET /chapters/chap01.html
Accept: text/html, */*
→ 返回 text/html(图 + 版式)
# Claude Code / Cursor 请求(要 Markdown)
GET /chapters/chap01.html
Accept: text/markdown, text/html
→ 返回 text/markdown(纯文本孪生)
响应头 Vary: Accept,CDN 分开缓存,不算 cloaking
这是 HTTP 标准玩法(1997 年就有),不是给爬虫看另一篇文章——同一内容、两种表示。验收工具:acceptmarkdown.com / isitagentready.com
机制 ⑤⑥ alt 全量 + schema.org
⑤ 全量图片 alt
每一格漫画都带真实画面描述的 alt(不是「图片1」)。屏幕阅读器与 AI 共用这条通道。例:「晨雾中的青石城门,一名背着长剑的少年迈步走出」
⑥ schema.org ComicSeries
结构化数据标注「这是漫画连载的第几话」,搜索引擎与部分 AI(Bing 系)据此建索引。