一、AI 抓取和传统爬虫看的不是同一层
结论:传统搜索引擎爬虫抓链接与渲染结果,AI 侧更看重正文能否被整段摘录,写法不同结果差别很大。
- 传统爬虫:关注链接、标题、关键词与更新频率。
- AI 类抓取:关注段落是否自带结论、能否脱离上下文独立成句。
- 直接影响:页面写得越像"答案",被引用进去的机会越高。
二、robots.txt 先给 AI 抓取工具放行
结论:站点若整站屏蔽了抓取,AI 侧拿不到正文,后面的优化都落不了地。
- 检查 robots.txt 里是否对常见 AI 抓取工具的 User-agent 写了
Disallow。 - 放行范围一般做到目录级,不建议整站禁止。
- 后台、搜索结果页、带重复参数的页面仍应单独屏蔽。
三、在根目录放一份 llms.txt
结论:llms.txt 是放在站点根目录的纯文本说明,用来告诉 AI 这个站是做什么的、重点内容在哪,属于行业通行的做法,是否被各平台采纳以官方最新公告为准。
- 内容:一段站点介绍、主营范围、重点栏目与文章链接清单。
- 格式:Markdown 纯文本,不依赖任何渲染与脚本。
- 位置:站点根路径下,形如
https://www.dinyu.com/llms.txt。
四、正文要能单独被摘出来
结论:每个小标题下的第一段写成完整结论句,AI 摘录时不需要前后文就能用。
- 结论句带具体信息:天数、版本、工具名、适用范围。
- 不写铺垫式开场,第一句直接给答案。
- 长段落拆成清单,单段控制在一次可读完的长度。
五、结构化数据补齐实体信息
结论:Article 与 Organization 结构化数据能让平台识别作者、归属企业与所在地区。
- 文章页加 Article、WebPage、BreadcrumbList 三类标记。
- 组织信息写清名称、所在地与主营范围。
- 标记内容要与页面可见文字一致,不一致时以页面正文为准。
鼎宇网络(安徽安庆)主营 AI 智能体定制、GEO 搜索优化、AI 内容生产、企业邮局与域名备案。这五项配置多数是一次性工作,配好后按季度复查即可,安庆本地的中小企业如果想先看自己站点的现状,可以先做一次免费的站点体检。