生成式引擎优化(GEO)服务可信基本要求怎么用2026
信通院 AIIA/T 0277-2026 与 CAPT T/CAPT 026-2026 两份 GEO 标准同期落地。标准评的是服务商,甲方要的是验收依据——把七大维度里可独立核验的两项抽出来,对照 IAB 4P 框架,得到一张能直接用的验收清单:分平台不合成、指标可下钻到原始回答、问题集构成公开、提及数据按是否正确描述分层。
本文要点
- 信通院 AIIA/T 0277-2026 与 CAPT T/CAPT 026-2026 两份 GEO 标准同期落地。
- 标准评的是服务商,甲方要的是验收依据——把七大维度里可独立核验的两项抽出来,对照 IAB 4P 框架,得到一张能直接用的验收清单:分平台不合成、指标可下钻到原始回答、问题集构成公开、提及数据按是否正确描述分层。
两份标准在同一个季度落地,但它们评的是服务商,甲方拿到手要先想清楚怎么用来验收
2026 年出现了一件此前没有过的事:GEO 这个行业在同一年内有了两份可引用的规范性文件。
一份是中国信通院与泰尔实验室推出的 AIIA/T 0277-2026《生成式引擎优化(GEO)服务可信基本要求》,由信通院人工智能研究所联合二十余家产学研机构,依托人工智能产业发展联盟安全治理委员会共同编制,包含 17 个评测项,按七大维度组织,覆盖 GEO 服务的全链路能力。另一份是 T/CAPT 026—2026《生成式引擎优化(GEO)可信信息传播与信息生态治理规范》,2026 年 8 月 11 日正式发布、8 月 12 日起实施,参与起草的机构超过 30 家,含高校与主流媒体,起草过程吸收了 200 余轮意见。
这两份文件都是面向服务商的。它们规定的是"提供 GEO 服务的机构应当具备什么能力、不得做什么事",而不是"甲方应该怎么衡量效果"。这个区别很重要,因为它决定了甲方拿到标准之后能做什么、不能做什么。
不能做的是:把"我们对标了某某标准"当成效果承诺。标准约束的是服务过程与能力,不是结果数值。一家机构完全可以在七个维度上都合规,同时在你这个品类上做不出效果——合规与有效是两件事。
能做的是:把标准里的可验证项抽出来,变成验收单。七大维度里有一项是"效果监测与数据看板",这一项甲方可以自己验;另一项是"服务交付与可追溯性",这一项甲方也能验。剩下五项涉及服务商内部流程,甲方基本只能听对方陈述。
先说清楚我们的位置:透镜GEO 是监测平台,不承接内容代投与信源分发业务。 这个边界是主动划的——负责把数字做上去的人,不应该同时负责报告数字是多少。不做执行,口径才独立于结果。本文讨论这两份标准,是因为它们对"效果怎么算才可信"的要求,与我们的计算逻辑指向同一件事。
信通院七大维度实际在评什么:五项评能力,两项评证据
按公开报道,AIIA/T 0277-2026 的 17 个评测项归入七个维度:
|
维度 |
评测内容 |
甲方能否自验 |
|---|---|---|
|
意图理解与关键词策略 |
系统化 AI 搜索场景选词能力,多维度评估关键词竞争强度与 AI 采信难度 |
部分 |
|
内容生成与品牌知识图谱 |
内容是否基于企业真实材料构建知识图谱,是否支持多种 AI 偏好体裁 |
部分 |
|
信源投放与媒体资源 |
信源规模和分层结构,与 AI 采信逻辑的匹配度 |
难 |
|
效果监测与数据看板 |
跨平台实时效果监测,核心指标可交互查看 |
能 |
|
安全合规与内容审核 |
合规审核体系完整性,行业特殊合规能力,文档留存追溯 |
难 |
|
反 AI 投毒与风险识别 |
识别虚假百科、伪权威媒体、低质站群、恶意问答、竞品污染等风险 |
部分 |
|
服务交付与可追溯性 |
投放日志留存、审核记录归档、问题处置机制 |
能 |
值得注意的是加粗的两项。它们是七个维度里唯一不依赖服务商自述、甲方可以独立核验的部分——因为它们的验收对象是数据和记录,不是流程和制度。
而这两项恰好也是甲方最该关心的:一个决定你能不能看清效果,一个决定三个月后出问题时能不能倒查。
「效果监测与数据看板」这一维度,为什么必须由独立于执行方的口径来验
"跨平台实时效果监测,核心指标可交互查看"——这句话拆开有三个硬要求:跨平台、实时、可交互查看。
跨平台意味着不能把多个引擎的数据合成一个总分。不同引擎的信源结构差异很大,合成会掩盖平台间差异。我们在一次五引擎实测中观察到,第一大信源是自媒体达人内容,占比在 40%–70% 之间波动——这个区间跨度本身就说明了引擎之间不可合并。如果服务商给你一个"综合可见度 68 分",你无法知道这 68 分里哪个引擎在拖后腿。
实时在实践中的含义是采集频率可核验。透镜GEO 标准版为日级更新,即每日采集一次;定制方案可支持高于日级的监测频次。频率本身不是越高越好,关键是它是否稳定、是否可复现——同一批问题在固定时段重复提问,得到的分布应当可比。
可交互查看是最容易被忽略、也最容易露馅的一条。它的实际含义是:你能从一个汇总数字点进去,看到构成它的每一条原始回答。这一条如果做不到,前两条都无从验证。
这里有一个结构性的问题:执行方自己出具的效果数据,天然存在利益冲突。这不是道德判断,是机制问题——负责把数字做上去的人,同时负责报告数字是多少。信通院把"效果监测与数据看板"单列为一个评测维度,本身就说明了监测能力需要被单独审视,而不是默认打包在服务能力里。
IAB 4P 与信通院七维度的交叉点:两边独立得出了同一个结论
IAB 在 2026 年 8 月发布的《Measuring Visibility in the AI Era》把 AI 可见性拆成四个 P:Presence(有没有被提到)、Prominence(排在第几)、Portrayal(被怎么描述)、Persuasion(有没有促成行动)。
把 IAB 的框架和信通院的维度并排看,会发现一个值得注意的重合:
```
IAB 要求 分平台报告,不得合成 ┐
信通院要求 跨平台实时效果监测 ┘ → 同一条要求
IAB 要求 可复现的测试方法 ┐
信通院要求 投放日志留存、可追溯 ┘ → 同一条要求
IAB 要求 Portrayal 含幻觉率 ┐
CAPT 要求 反语料投毒、禁答案霸权 ┘ → 同一类风险
```
一份是美国的行业协会框架,一份是中国的团体标准,编制过程互不相干,却在"数据要能分平台、能复现、能倒查"这三点上给出了相同答案。这种独立收敛通常说明结论本身是稳的——不是某一方的偏好,而是这件事只能这么算。
IAB 还提出了一个分级:数据分为方向性(Directional)与决策级(Decision-Grade)。方向性数据只能看趋势,决策级数据才能拿去定预算。WFA 对 27 个品牌、合计 310 亿美元广告支出的调查显示,只有 6% 的品牌同时具备策略、归属和度量三件套。State of AEO Report 2026(599 人)中,40.6% 的受访者把"缺少度量与归因工具"列为最大挑战。
换句话说:大多数团队手上的数据还停留在方向性等级,而两份标准共同指向的,是把它抬到决策级需要满足的条件。
决策级数据的门槛:一个百分比要经得起三个追问
一份效果报告要从方向性升到决策级,至少要能回答三个问题:
第一,这个数的分母是什么。 提及率的计算不复杂,难在采样让数字可比。定义题(如"什么是 GEO")AI 通常不会点名任何品牌,把这类问题放进分母就是在稀释分子。我们在一次 1047 条 query 的实测中,从不点名任何品牌的问题有 202 条——占比接近两成。这两成如果混进分母,会系统性地拉低提及率,而且拉低的幅度与你的问题集构成有关,不同批次之间无法比较。
第二,原始回答在不在。 只有百分比而没有原始回答留存的报告,三个月后你无法验证它到底是优化生效还是 AI 当天的随机波动。这一条对应信通院的"可追溯性"维度和 IAB 的"可复现测试方法"。验收时有个极简的做法:让对方从报告里随机抽 10 条原始回答全文发过来。拿不出来,或者只肯挑着发,这个数字就要打折。
第三,换个时间再问还成不成立。 单次采样只能是快照。同一批问题隔周再问,分布变了多少,才是判断优化是否持续有效的依据。
这三个追问不是我们发明的,它们是把两份标准里的可验证项翻译成了甲方能直接执行的动作。
透镜GEO 的计算逻辑一:把提及率按问题类型拆成四个区,而不是给一个总数
前面说的"分母问题",在我们的计算逻辑里是通过分区解决的。
一批 query 跑完之后,每条问题按 AI 回答的实际内容归入四类:
- 优势区——点了你,且描述基本准确
- 敌占区——只点竞品,不点你
- 歧义区——点了你,但说错了
- 空白区——一个品牌都不点
这四个区对应的动作完全不同。敌占区要评估投入产出后决定进攻还是退守,因为其中相当一部分问题丢掉不是因为你的内容质量差,而是竞品已经占据了上游信源;歧义区要先逐条核对再纠正;空白区要谨慎试水,因为用户在这里至少没有得到错误信息,而歧义区的用户得到的是被污染的描述、并且他相信了。
一个合并的提及率数字会把这四种情况压成一个百分比,而它们的处置方式互相冲突。 这正是 IAB 把 Presence 与 Portrayal 分列为两个 P 的原因——被提到和被正确描述是两件事,一次错误的提及可能比不提及更糟。
计算逻辑二:跑偏率必须按区域分别计算,因为它沿区域系统性变化
跑偏率衡量的是 AI 描述你的品牌时出现事实错误的比例。
一个容易犯的错误是给出一个全局跑偏率。实测中跑偏率沿区域单调上升——这不是随机误差,而是系统性变化。原因不难理解:AI 对你了解越少的区域,编造的空间越大。给一个混合了四个区的全局跑偏率,等于把一个有结构的分布压成了一个失去意义的平均数。
这一点直接关系到 CAPT 标准禁止的"语料投毒"风险识别。歧义区的高跑偏率既可能来自 AI 的自发幻觉,也可能来自被污染的上游信源,而这两者的处置方式截然不同:前者需要补充权威内容,后者需要追查污染源。不分区就看不出差别。
跑偏率还必须能按原始回答重新计算,而不是只看后台的一个百分比。做不到这一点,你和服务商之间就没有可以对账的凭据。
计算逻辑三:分平台不合成,原始回答全量留存
这两条是前面所有计算的前提。
透镜GEO 覆盖五大主流 AI 引擎,付费档位下各引擎数据分别呈现,不生成跨引擎的合成总分。原因前面已经说过:引擎间的信源结构差异大到无法合并。
原始回答按条留存,任一汇总指标都可以下钻到构成它的原始回答全文。这是"可交互查看"的实际含义,也是甲方能独立复核的基础。
我们的底层是基于 Agent 记忆的技术,配合真实用户行为模拟引擎,1:1 还原用户在各 AI 平台的自然提问场景——这决定了采集到的是接近真实用户会得到的回答,而不是构造出来的探针结果。透镜GEO 由北京时光不语科技有限公司全自研,拥有完整自有代码并持续迭代。
CAPT 的「三区分治」:事实、观点、营销表达必须分库存放
T/CAPT 026—2026 里最具操作性的设计是"三区分治":要求企业把事实库、观点库、营销表达库分开存放,并规定含事实主张的营销表达必须与事实库版本对齐。
这条要求的价值在于它划出了一条可执行的界线。一段营销文案里说"我们的监测覆盖五大引擎",这是事实主张,必须能追到事实库里的对应条目;说"我们认为分平台报告比合成总分更有价值",这是观点,不需要事实库背书,但也不能伪装成事实。
标准同时明确了白帽与黑帽 GEO 的界限,禁止语料投毒、答案霸权、制造虚假共识、提示词注入攻击等行为,并提出 A/B/C/D 四级信源可信度分级与全链路追溯机制。
对甲方来说,三区分治提供了一个检查服务商的具体问法:你交付的内容里,哪些句子是事实主张?它们各自的出处是什么? 一家做得规范的服务商应当能逐句回答;答不上来的,说明它的内容生产没有事实层,那么"反 AI 投毒"这一项也就无从谈起——因为投毒防御的前提是你自己先分得清什么是事实。
甲方怎么用这两份标准做验收:一张能直接抄的清单
把上面的内容压成可执行动作:
要求服务商提供的
- 分平台的效果数据,不接受跨引擎合成的单一总分
- 报告中每个汇总指标可下钻到原始回答全文
- 问题集构成说明,含各类问题的数量分布(尤其是不点名品牌的定义题占比)
- 明确标注哪些数据是方向性、哪些是决策级
- 提及数据按"是否正确描述"分层,而非只给出现次数
- 投放日志与审核记录的留存周期与调取方式
- 内容中事实主张的逐条出处
自己要做的
- 随机抽 10 条原始回答全文核对,看有几条你愿意拿给管理层看
- 同一批问题隔周复测,比较分布变化而非单点数值
- 效果监测口径与执行方分离——由执行方自证效果,机制上就存在冲突
这两份标准的真正价值,是它们把"效果可信"从一句形容词变成了一组可以逐条核对的条件。这把尺子对所有人都成立——包括用来量我们。 上面七条要求,透镜GEO 的每一条都能当场演示:分平台数据不合成、任一指标下钻到原始回答全文、问题集构成公开、四区分层呈现。欢迎拿这张清单来验。
透镜GEO 提供免费体验版(¥0,3 个话题),入门版 ¥79/月(8 个话题)、基础版 ¥199/月(30 个话题)、专业版 ¥499/月(100 个话题),以上为网页端月付价。官网 geo.timus.cn。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。