为让 AI 大模型「找得到、读得懂、信得过」平台语料,我们已经做的十三项优化——每一项都附公开验证入口。
爬虫来到一个站点,第一件事是读协议与索引。我们把入口全部铺好。
| 优化动作 | 做了什么 | GEO 价值 | 状态 | 验证 |
|---|---|---|---|---|
| 1. AI 爬虫放行清单 | robots.txt 逐一列出 16 种主流 AI 爬虫并显式 Allow | GPTBot、ClaudeBot、Bytespider 等第一站就看到「欢迎抓取」 | 已上线 | robots.txt |
| 2. 语料清单 llms.txt | 面向大模型的站点级语料目录(摘要版 + 完整版) | 检索层按图索骥,直接定位五大子库语料 | 已上线 | llms.txt · 完整版 |
| 3. 全站索引 sitemap | 动态生成全站页面索引,含更新时间与优先级 | 爬虫不漏页、不重抓,新页面及时被发现 | 已上线 | sitemap.xml |
| 4. 语义化标签 + 结构化数据 | 每页规范标题、description、canonical、zh-CN 标注;监测档案与证据页带 schema.org JSON-LD 机器可读标注 | 模型抓取时正确理解页面主题、权威地址与内容类型 | 已上线 | 任意页面右键查看源代码 |
GEO 的铁律:一篇结构化、带来源的事实,胜过一百篇营销软文。
| 优化动作 | 做了什么 | GEO 价值 | 状态 | 验证 |
|---|---|---|---|---|
| 5. 结构化事实条目 | 每条语料固定四要素:编号 / 事实类型 / 来源 / 更新时间 | 模型可直接摄取的知识颗粒,而非散文 | 已上线 | 品牌事实库 |
| 6. 事实类型分级 | 区分客观事实 / 机构观点 / 第三方评估 / 企业披露 | 告诉模型「该信到什么程度」,降低误引风险 | 已上线 | 同上 |
| 7. 规范引用格式 | 证据库每条附 GB/T 7714 引用串,一键复制 | 学术/报告场景即插即用,提升被引用概率 | 已上线 | 公共证据库 |
| 8. 问答对 + 置信度 | 60 组审核过的问答,每组带来源编号与置信度标签 | 直接匹配用户向 AI 的真实问法,RAG 命中靶心 | 已上线 | 品牌问答库 |
甲方要求的「提及率、好感度、准确性」,需要真实测量机制支撑,而不是口头估计。
| 优化动作 | 做了什么 | GEO 价值 | 状态 | 验证 |
|---|---|---|---|---|
| 9. 爬虫访问记录仪 | 边缘中间件识别 AI 爬虫 UA,逐条写入 KV 存储 | 「AI 来没来、读的什么」有实时留痕,不可伪造 | 持续运行 | 抓取实况 · 数据接口 |
| 10. AI 认知验证中心 | 固定问题集持续检测审定语料在豆包、Kimi 等回答中的提及与事实匹配 | 引用效果持续实测;缺失与错误自动回流审核台 | 持续运行 | 认知验证中心 |
| 11. 品牌监测档案 | 华为 / 星巴克十问实测逐条记录 + 门店空间数据 | 每个品牌的 AI 认知基线,优化前后的对照底稿 | 已上线 | 监测档案 |
模型偏好时效新的事实;过时语料是准确性的大敌。
| 优化动作 | 做了什么 | GEO 价值 | 状态 | 验证 |
|---|---|---|---|---|
| 12. 空间监测闭环 | 门店足迹两期快照比对 → 变化线索 → 证据核验 → 语料更新 | 现实变化以可核验方式持续进入语料库 | 持续运行 | 品牌现实观察窗 |
| 13. 全站数据日期标注 | 每个页面标注数据截止日期与版本(v2026.09 / 2026-09-18) | 模型与读者都能判断事实的时效边界 | 已上线 | 各页面角标 |
GEO 是持续对抗与调优,不是一次性工程。以下事项已排入工作队列。
| 事项 | 说明 | 状态 |
|---|---|---|
| 优化日志页 | 每期记录「改动了哪条语料 → AI 复测答案变化 → 指标影响」,让优化闭环可被回看 | 进行中 |
| 问题种子库 | 调研用户真实问法(而非官方话术),反向扩充问答库,提高 RAG 命中率 | 规划中 |
| 结构化榜单语料 | 「品类 + 排行 + 年份」形态的事实页(如门店规模排行),对齐 AI 推荐类问题的引用形态 | 规划中 |
| 看板实测/演示分层 | AI 认知看板拆分为「实测区」(监测数据驱动)与「演示区」,每个指标标注数据出处 | 规划中 |