行业动态·10 分钟读完·透镜GEO 实验室

找外包做优化,怎么在合同里写防造假条款?

评估AI搜索优化效果不能只看截图。本文拆解服务商数据粉饰套路,教你通过留存问题清单、固定计算口径等建立独立验收标准,并提供可写入合同的防注水条款。

本文要点

  • 评估AI搜索优化效果不能只看截图。
  • 本文拆解服务商数据粉饰套路,教你通过留存问题清单、固定计算口径等建立独立验收标准,并提供可写入合同的防注水条款。

怎么判断服务商给的AI搜索优化报告有没有水分?

评估 AI 搜索优化(GEO)效果不能只看一张截图或一个综合比率。一份真实、可复核的验收报告,必须提供完整的问题清单、明确的分子分母计算口径、每一轮的原始回答全文存档以及引用来源的逐条明细。缺少这四样过程数据,任何好看的趋势图都无法被核验。

怎么验证GEO服务商给的交付物是不是真的跑过测试?

判断一份 GEO 效果报告可不可信,不能看 PPT 汇报写得多漂亮,而要看这四样东西是不是实实在在地拿在手里。

交付物

作用

缺了会怎样

完整问题清单(每期留档)

可重跑、可比对

数据无法核验,也看不出中途是否换了更容易答对的题

每个比率的分子分母定义

可解读涨跌

仅凭一句「提及率涨了」无法判断是效果变好还是口径变宽松

原始回答全文存档

还原品牌被描述的真实语境

只知道品牌「在不在」回答里,不知道被说成了什么

引用来源逐条明细

定位优化动作的切入点

无法追溯 AI 到底抓取了哪个页面,只能得到「内容质量要提升」这种无法落地的结论

这四样数据都是执行测试过程中的自然副产品。只要服务商真的跑过测试,系统里就一定有留存。如果拿不出来,通常不是因为涉及机密,而是因为在测试时根本没有做结构化存储。

怎么判断GEO服务商在测试中途有没有偷偷换题?

判断一份 AI 搜索可见性报告是否真实,标准只有一个:第三方按同样的方法、在同一时间段重跑这批问题,能不能得到接近的结果。而重跑的前提,是必须知道具体测了哪些问题。

留存问题清单,还能防止一种极其隐蔽的「数据粉饰」手段——中途换题。

如果在后期的测试中,悄悄加进几条自带品牌名的提问(例如将「有什么好用的协同办公软件」替换为「某某协同办公软件好用吗」),品牌的提及率必然会大幅上升。但这并不是因为 AI 搜索可见性变好了,而是因为提问本身就在给品牌送分。

这种操作会让趋势图看起来非常漂亮,但它无法被追溯——除非你手里有每一期测试的完整问题清单。因此,在合作之初就应当明确:问题集发生任何调整,都必须在报告中逐条标注。

想知道你的品牌是否被 AI 推荐?查看品牌 AI 可见性

为什么同一批AI搜索测试数据能算出完全不同的提及率?

在 AI 搜索的监测中,同一个数据集,用不同的口径能算出差距极大的两个率。

分母口径

算进去的是什么

算出来的提及率表现

全部提交的问题数

包含执行失败、API 接口无结果的样本

最低

执行成功的问题数

排除接口异常等非内容因素

中等

产生品牌推荐语境的问题数

进一步排除定义解释题等无效样本

最高

如果分母口径不一致,两个时期的提及率数据放在一起对比就毫无意义。

此外,多轮采样在算法上还有一个常见的坑:先算每一轮的比率,然后再取平均值。这会导致样本量极小的那一轮,在最终结果里占了过高的权重。

计算方式

第一轮数据

第二轮数据

最终计算结果

先算单轮比率再取平均值

20 / 40 = 50%

3 / 12 = 25%

37.5%

分子分母各自相加再计算

分子共 23,分母共 52

23 / 52

44.2%

两者的计算结果差了近几个百分点。后者才是这批问题真实的平均表现,而前者把只有极少样本的那一轮赋予了和多样本那一轮同等的权重。

这绝非钻牛角尖。在流量监测上,透镜GEO 团队自己就栽过同类的跟头。在一次策略评估中,我们仅看整站点击率,得出了「标题改版把点击率拉低了」的结论。但当我们把词的类型分段拆解后,才发现真实情况是点击率其实是有所提升的,实际是上涨的。

导致这一误判的原因是流量构成在变——泛词的展现占比在极宽的区间内剧烈摆动。如果把高点击率的品牌词与低点击率的泛词混在一起算平均数,读到的就只是流量构成的变化,而不是真实的优化效果。合并口径,极易把涨的数据读成跌的数据。

怎么判断AI搜索提及率上升时品牌有没有被抹黑?

提及率(Mention Rate)是 GEO 监测中最常用的指标,但它有一个致命盲区:它只统计品牌「在不在」,却不统计品牌「好不好」。

AI 的具体描述方式

对用户决策的影响

提及率计作

列为该领域主要厂商之一,推荐尝试

正向

1

描述为「规模较小的创业公司,市场份额有限」

负向

1

描述为「功能相对基础,不适合复杂场景」

负向

1

将品牌归到完全错误的品类中

无效且误导

1

把竞品的短板或负面事件写到了你的名下

严重负向

1

在提及率的算法里,上面这五种情况全部被记作「1」。如果只看提及率,数字涨了,你可能还在庆祝,但实际上后面四种负面或无效提及的占比正在悄悄上升。

透镜GEO 在每一轮监测中都会把原始回答的全文进行留存。因为比率只能告诉你品牌在 AI 回答中出现的频次,而留存的原文才能帮你复核:AI 到底在用什么词汇描述你,以及到了下个月,那句「功能相对基础」的负面评价是否真的被优化掉了。

为什么不能用AI回答截图和官网流量来做GEO验收依据?

在实际业务中,很多市场负责人习惯用两样东西来跟老板交差:一是「AI 提到我们了」的回答截图,二是网站的「引流数据」。这两者都不适合作为硬性的验收依据。

首先,单张截图无法代表常态。AI 的回答具有概率性和随机性,同一句话问三次,给出的品牌推荐名单可能完全不同。一张出现了品牌的截图只能证明「它在某一次提问中出现过」,无法证明「它能稳定地向用户展现」。想要拿到一张好看的截图,只需要反复刷新重试即可,而你根本看不到中间失败了多少次。

其次,网站流量测不准。如今多数 AI 搜索(如 Perplexity 或 秘塔)的回答已经能够满足用户的即时需求,大部分用户看完回答就走,并不产生点击。即使产生点击,由于很多 AI 客户端不带 Referrer 标识,这部分流量在统计工具里也会落入 Direct(直接访问),根本无法追踪。

事实上,连企业自己站点的访客数据都需要经过严格清洗才可信。透镜GEO 对自己的站点做过一次实测,通过「执行过埋点 JS」这一口径来统计新访客,某天数据突然跳到平时的数倍,显示当天绝大多数访客都是新访客,而平时这一比例要低得多。

经过排查发现,是一个云服务商的 IP 段在当天对我们发起了密集的埋点请求,这是一个会执行 JavaScript 的无头浏览器。这直接导致当天的数据严重虚高。

连自己站点的底层数据都需要经过多层过滤才敢采用,如果直接用无法精确归因的网站流量去验收 AI 搜索的优化效果,链条太长,数据极易失真。

在GEO服务合同里应该写死哪些防注水条款?

在与 GEO 执行方或服务商签署合同时,不需要精通技术,也可以把以下几项过程数据的交付写入条款中。这些都是系统运行的自然产物,不涉及额外的工作量:

条款类型

合同建议写法

数据交付要求

每期交付物必须包含:完整测试问题清单、每一轮的原始回答全文存档、引用来源的网页明细。

计算口径固定

提及率的分子、分母定义在首期确认后不得变更。后续如需变更口径,须提供书面说明并对历史数据进行重算。

问题集变更约束

调整问题集必须逐条标注。新增题目在趋势图中须单独标识,不得与历史数据混跑。

过程数据归属

监测过程中产生的所有原始问答数据、问题清单归甲方所有,合作结束后须提供一键完整导出。

效果承诺界定

仅对可验证的执行动作与检索层收录结果做出承诺,不承诺模型参数内的特定描述,不承诺绝对排位。

特别是关于效果承诺,需要理性对待。

什么情况下GEO服务商给的效果承诺在技术上根本无法实现?

在 AI 搜索的生态中,有两件事是不应该被写进承诺条款中的:

不该承诺的事

为什么

承诺「在几个月内看到模型彻底改口」

已经进入大模型预训练权重(Parameters)里的记忆是极难在短期内擦除或修改的,这属于不可控层。

承诺「在所有 AI 引擎中实现绝对排位第一」

AI 搜索的实时生成结果受到地理位置、上下文、用户画像以及模型随机温度值(Temperature)的多重影响,不存在物理意义上的绝对第一。

敢于在这两件事上给出绝对承诺的,要么是不了解 AI 的技术机制,要么是笃定你无法进行系统性验收。

相反,真正可控且可验证的是实时检索层(RAG)的动作:你的内容是否被 AI 搜索的蜘蛛抓取,是否进入了它的检索知识库,以及在实时检索发生时,你的页面是否作为引用来源(Sources)出现在了回答下方。这一层是可以通过技术手段优化,并且可以通过工具进行精准监测的。

怎么在不引入第三方的情况下建立独立的GEO验收口径?

让执行优化服务的团队自己输出效果验收报告,在结构上是不合理的。这等同于让考生自己批改自己的试卷。财务报表需要独立的第三方审计,AI 搜索的可见性监测也是同样的道理。

即使企业目前没有引入第三方监测工具,最低限度的合规做法也是:必须把完整的问题清单与原始回答原文收回自己手中

只要这两样底层数据在手,无论何时,你都可以找其他技术团队进行复核与重跑。如果手里只留下一堆服务商汇报 PPT 里的百分比数字,一旦合同结束、时间流逝,这些数据就永远失去了复核的可能性。

透镜GEO 作为独立的 AI 搜索品牌可见性监测平台,不承接任何 GEO 优化执行服务。我们只负责客观地记录每一轮测试的问题、原始回答以及引用来源。将验收方与执行方在结构上分离开来,两边的数据对比才具有真正的评估价值。

常见问题

如果服务商只提供脱敏后的问题分类,不给具体提问,这种报告能收吗?
不能收。没有具体问题清单,就无法进行重跑和复核,脱敏分类无法作为技术审计的依据。如果对方坚持不给,可以要求在保密协议约束下提供,或者通过第三方独立监测平台进行背靠背的测试,否则数据真实性无法闭环。
已经签了合同、条款里什么都没写,现在还能补救吗?
能。完整问题清单和原始回答属于测试过程中的自然副产品,不需要服务商重新开发或履约,通常只需要在日常沟通中补充确认即可拿到。建议尽早提出要求,因为原始回答如果当时没有在数据库中进行留存,过去那几期的历史数据就永久性地丢失了,无法事后补救。
我们自己随便去 AI 界面上问几句来验证效果,行不行?
可以作为日常抽检,但不适合作为验收依据。AI 搜索的回答具有概率性,单次提问只能代表那一个瞬间的随机结果。科学的验证方法是使用同一批问题清单,在同一时间段内连续跑多轮,取平均值后再与对方的数据进行比对。
如果发现不同AI引擎测出来的提及率数据打架,应该以哪一个为准?
不要试图去算一个跨引擎的平均数。正确的做法是分引擎独立核验。因为不同AI引擎的抓取机制和模型权重完全不同,数据打架是正常现象。你应该根据自身用户画像,重点看核心目标引擎的数据,并用该引擎的原始回答和引用来源去逐一验证。
如果 AI 回答里引用了我们的页面,但没提到品牌名,这算不算有效提及?
这取决于你在首期确认的分子计算口径。如果你们的 GEO 目标是品牌曝光,那么在回答中没有出现品牌文本,就不能算作分子;如果你们的目标是为官网导流,那么只要引用来源里出现了你们的网页链接,就可以算作一次有效提及。这正是为什么必须在项目启动时就锁死分子、分母定义的原因。

相关阅读

你的品牌,AI 看得见吗?立即检测品牌