GEO 三层怎么测:题库模板、记录表与基线判读
结论先说:框架讲完还不够,要会测。把 认知层、推荐层、信任层 落成固定题库 + 统一记录表 + 可复测基线,才能知道卡在哪一层、补完有没有用。本文给你可直接套用的模板与读法。合订本见 监测与复测手册。
监测不等于「随手问两句截图」。一次有效基线至少同时固定四件事:测哪些平台、问哪些原句、怎么记字段、隔多久用同一规则再测。答案会波动,所以比的是趋势和缺口结构,不是单次第一。
一、开测前先锁死规则
| 规则项 | 建议做法 | 不要这样做 |
|---|---|---|
| 平台清单 | 先定 3~6 个目标中文 AI,名单写进表头 | 今天测 A,下周换成 B,无法对比 |
| 问法原文 | 客户原话入库;改写另开一行,不覆盖旧题 | 口头复述,导致每次问法不同 |
| 时间窗口 | 记录日期与大致时段;同轮尽量同一天内测完 | 跨很多天混成「一次基线」 |
| 记录口径 | 提及 / 位次 / 理由 / 准确度 / 来源 / 情绪统一打分 | 只写「感觉还行」 |
| 竞品名单 | 同品类锁定 2~5 个对照对象 | 每题临时换竞品 |
工具可用表格、Notion,或直接用 翎见 GEO 做题库与回测;方法相同,关键是同题复测。
二、题库模板:三层各测什么
起步规模建议:认知 8~12 题、推荐 10~15 题、信任 6~10 题;每层再加 2~3 个同义改写即可。产品里若把题标成「对比 / 决策」,测量时计入推荐层;标成「信任 / 口碑」计入信任层——问法类型可以细,验收层只有三个。下面用「通用 B2B 品牌」写法,把括号换成你的品类与品牌名。
1. 认知层题库(知不知道、说得对不对)
| 题型 | 模板问法 | 记录重点 |
|---|---|---|
| 品牌是什么 | {品牌} 是做什么的? | 是否出现;品类是否正确 |
| 主体归属 | {品牌} 是哪家公司的产品?总部在哪? | 主体、地区是否说错 |
| 产品边界 | {品牌} 主要解决什么问题?不适合什么场景? | 边界是否清晰 |
| 易混主体 | {品牌} 和 {易混名} 是同一家吗? | 是否张冠李戴 |
| 场景认知 | {品牌} 适合哪些行业 / 规模的企业? | 适用画像是否准确 |
2. 推荐层题库(会不会被列入候选)
| 题型 | 模板问法 | 记录重点 |
|---|---|---|
| 品类名单 | {城市/赛道} 有哪些靠谱的 {品类}? | 是否进入名单;位次 |
| 条件推荐 | 预算有限 / {N} 人团队,{品类} 怎么选? | 是否被推荐;理由是否匹配 |
| 对比选型 | {品牌} 和 {竞品A}、{竞品B} 怎么选? | 是否出现;差异点是否正确 |
| 场景匹配 | 适合 {具体场景} 的 {品类} 有哪些? | 是否进入;有无错配硬推 |
| 替代问法 | 除了 {竞品A},还有哪些类似选择? | 是否被想起 |
3. 信任层题库(依据够不够、追问稳不稳)
| 题型 | 模板问法 | 记录重点 |
|---|---|---|
| 推荐依据 | 为什么推荐 {品牌}?依据是什么? | 理由是否可核验 |
| 案例证据 | {品牌} 有哪些公开案例或资料? | 是否指向可查材料 |
| 缺点边界 | {品牌} 有哪些限制或不适合谁? | 是否客观;会否回避 |
| 风险口碑 | {品牌} 网上评价怎么样?有没有争议? | 情绪与依据是否对应 |
| 多轮追问 | 那价格 / 交付周期 / 效果承诺怎么理解? | 前后是否一致;有无胡编 |
三、记录表:一行一题一台
建议每行 = 一个平台 + 一条问法原文 + 一次作答。最小字段如下(可复制到表格):
| 字段 | 填写说明 | 示例 |
|---|---|---|
| 轮次 | 基线 / 复测-1 / 复测-2 | 基线 |
| 日期 | YYYY-MM-DD | 2026-08-18 |
| 平台 | 固定名单中的一项 | DeepSeek |
| 层级 | 认知 / 推荐 / 信任 | 推荐 |
| 问法 ID | 题库编号,便于复测对齐 | R-03 |
| 问法原文 | 完整复制,勿改写 | 深圳 GEO 服务商怎么选? |
| 提及 | 是 / 否 | 是 |
| 位次 | 首次出现序位;未出现记空 | 2 |
| 是否进入候选 | 明确名单/建议项才算是 | 是 |
| 推荐理由摘要 | 一句话摘录关键理由 | 强调可监测与复测 |
| 事实准确 | 对 / 偏 / 错 | 对 |
| 偏差说明 | 说错了什么 | — |
| 引用来源 | 有 / 无;能记则记域名 | 有 · 官网 |
| 情绪 | 正 / 中 / 负 | 中 |
| 竞品是否出现 | 列出名字 | 竞品 A、B |
| 原始答案链接或附件 | 截图 / 文本存档路径 | drive/… |
| 备注 | 异常、拒答、改口等 | — |
打分要克制:「进入候选」必须是答案里明确列出或建议;顺带提一句名字,记「提及=是、进入候选=否」。不要把模糊好感写成推荐。
四、怎么读基线:先看结构,再看数字
基线跑完,先做三层汇总,再决定补什么。可按下表判读:
| 你看到的基线 | 优先判断 | 下一步 |
|---|---|---|
| 品牌词常提到,品类/选型题几乎不进名单 | 认知有底,推荐弱 | 补品类、场景、对比、条件推荐页 |
| 名单里常有你,但理由空、差异点不对 | 有席位,推荐质量差 | 补可核验事实与适用边界,少写口号 |
| 常被推荐,但主体/价格/能力说错 | 认知与信任双缺口 | 先修官方实体与 FAQ,再谈曝光 |
| 正面问法还行,缺点/风险追问立刻崩 | 信任结构不足 | 补边界、证据、第三方印证与诚实对比 |
| 单一平台很好,其他平台接近空白 | 跨平台差异大 | 分平台看趋势;勿用单点外推 |
读基线时的三个纪律
- 分层看,不混算:认知提及率高,不代表推荐率高;推荐率高,不代表信任稳。
- 看稳定缺口,不看单次亮点:同一题在多数平台都不进名单,才是优先洞。
- 复测才验收:补内容后用同一题库、同一口径再测;变化写进「轮次」列。
五、一周最小测量流程
- Day 1:定平台、竞品、三层题库(控制总量,能复测优先)。
- Day 2~3:按记录表跑完整基线;存原文答案。
- Day 4:出三层缺口清单:先修哪 1~2 层、对应补哪几页。
- Day 5~6:上线可引用页(结论前置、表格/FAQ、边界);写法见 RAG 与可引用页。
- Day 7 或隔 1~2 周:同题复测,只比较同平台同问法的变化。
不承诺「第几天一定被检索到」——平台抓取节奏不同;你能控制的是材料质量与复测纪律。
六、可直接复制的汇总看板(管理层一页)
| 层级 | 核心指标(本轮) | 相对竞品 | 最大缺口 | 本周动作 |
|---|---|---|---|---|
| 认知 | 提及率 · 实体准确率 | |||
| 推荐 | 进入候选率 · 平均位次 · 理由命中 | |||
| 信任 | 来源质量 · 事实准确 · 风险追问稳定性 |
把空格填满,比堆截图更能指导内容日历。框架定义仍见 三层全维度解析;原理背景见 GEO 原理。
FAQ
Q:GEO 三层怎么测?
A:固定平台与题库,按认知 / 推荐 / 信任分别提问,用统一记录表记下提及、位次、候选、理由、准确度、来源与情绪;先出基线,再同题复测。
Q:基线最少要测多少题?
A:建议认知 8~12、推荐 10~15、信任 6~10,加少量同义改写。宁可少而固定,也不要题量很大却无法复测。
Q:一次截图能当基线吗?
A:不能。基线要固定平台、问法原文、时间与口径。截图只作附件,不能替代结构化记录。
Q:怎么判断该先补哪一层?
A:看缺口最大的一层:说不清主体先修认知;进不了品类/选型候选先争推荐;能进名单但证据弱或追问崩,先补信任。
Q:手动测和工具测有什么差别?
A:方法相同。手动适合起步验证口径;题量上来后,用监测工具可减少漏记与口径漂移。翎见 GEO 对齐的是「题库 → 监测 → 补内容 → 复测」闭环。
本文提供可执行的测量模板,不构成对任一 AI 平台内部排序规则的断言,也不承诺特定天数内的可见度结果。答案具有波动性,请以持续、同题、跨平台复测为准。