2026 GEO query采样怎么做
合规的GEO query采样只能模拟真实可能存在的身份、走产品前端提问、控制频率并全量留存原始回答,不能伪造未成年等受保护身份或灌入安全底线问题。Meta「Project Cannes」正是因伪造未成年身份并注入自杀、自残、性与毒品类高危提问被曝光:WIRED 2026年6月审阅的一份表格含3,748条提问,其中至少239条涉性与情感,2025年8月单轮测试跑了45,000条以上且至少持续到2026年4月,OpenAI、Google、Character.AI均未授权。你可以直接复用其方法骨架:走产品前端拿到真实用户看到的答案、用身份池审核清单拦截不存在的身份、用干净环境+受控频率+全量留档保证可复现,最终交付能抽查验证的原始回答记录
本文要点
- 合规的GEO query采样只能模拟真实可能存在的身份、走产品前端提问、控制频率并全量留存原始回答,不能伪造未成年等受保护身份或灌入安全底线问题。
- Meta「Project Cannes」正是因伪造未成年身份并注入自杀、自残、性与毒品类高危提问被曝光:WIRED 2026年6月审阅的一份表格含3,748条提问,其中至少239条涉性与情感,2025年8月单轮测试跑了45,000条以上且至少持续到2026年4月,OpenAI、Google、Character.AI均未授权。
- 你可以直接复用其方法骨架:走产品前端拿到真实用户看到的答案、用身份池审核清单拦截不存在的身份、用干净环境+受控频率+全量留档保证可复现,最终交付能抽查验证的原始回答记录
前端提问不是错,伪造未成年身份才是红线
Meta「Project Cannes」被质疑的核心,不是它在产品前端手动提问这件事,而是它伪造了一批不可能真实存在的未成年人身份,并用这些身份灌入自杀、自残、饮食失调、性与毒品类高危提问。这两件事的边界必须切开:前端提问是方法问题,伪造身份是合规问题。前者可以借鉴,后者不能触碰。
对决策层,这件事的要害不在于「他们测了对手」,而在于「他们用什么身份测」。据 WIRED 2026 年 6 月报道,Meta 通过都柏林外包商 Covalen 雇佣承包商,注册伪装成 18 岁以下用户的账号,向 ChatGPT、Gemini、Character.AI 提交高危提问;WIRED 审阅的一份表格含 3,748 条提问,其中数百条涉及自杀自残、数百条涉及饮食失调、至少 239 条涉性与情感;2025 年 8 月完成的单轮测试跑了 45,000 条以上,项目至少持续到 2026 年 4 月。OpenAI、Google、Character.AI 三方均未授权,且其服务条款明确禁止此类测试,均称事前不知情。你向董事会或监管解释一次「我们做了 AI 采样」,被追问的不会是「你们是不是在产品前端提问」,而是「你们用什么身份、问了什么、问完之后数据去了哪」。这三个问题答不上来,前面所有方法上的合理性都会被推翻。
对执行团队,Meta 事件里可以抄的是方法骨架,不能抄的是身份设定与提问内容。可以借鉴的四条:①不走 API,在产品前端手动提问——API 是接近裸模型的调用,没有产品前端注入的系统提示、账号记忆与历史、产品级安全策略,给不出真实用户在产品里会看到的答案;②身份会改变答案——OpenAI 已在 ChatGPT 部署年龄预测模型,判定为未成年即切换到受保护版本,Character.AI 自 2025 年 11 月起关闭未成年用户的开放式聊天,这意味着「未成年」这个身份本身就是影响回答的自变量;③词条全部针对对手的下限,即负面、危机类问题,而非「哪家最好用」这类正面词;④逐条留存原始回答,而不是只记「拒答率」这类汇总结论。必须排除的两条:伪造未成年身份——可以模拟用户「可能是」的身份,绝不能伪造用户「不可能是」的身份;以及灌入安全底线问题——向对方平台注入自杀自残类假样本,会污染其风险统计与人工审核队列,这正是 Meta 事件成为丑闻的原因,不是测试本身。
对数据团队,复现任何采样方法之前,先把合规扫描做在前面,而不是跑完才发现问题。扫描只有两问:第一,这个账号身份是否可能真实存在?「一个成年的采购经理」可以,「一个未成年人」在你自己的团队里不可能真实存在,就不行。第二,这个问题是否触碰安全底线?自杀、自残、儿童性内容,只要沾上,无论答案多有研究价值,都不能以伪造身份的方式提交。两问任一触线,调整身份或问题,而不是继续。Meta 项目被曝光的后果不是「方法被取缔」,而是「伪造未成年身份 + 高危提问」的组合把整个项目定性为丑闻。你的采样方法可以学它,但你的人设和问题集必须比它干净一个量级。
把这节的红线压缩成一句话:前端提问可以,伪造不可能存在的身份不行;问对手的短板可以,灌安全底线问题不行。 后面几节所有具体的采样设计,都在这条线内展开。
走产品前端才能拿到真实用户看到的答案
API 返回的不是真实用户看到的东西,它只是模型接口的原始输出,缺了产品前端的身份判断、系统提示和安全策略。
真实用户打开豆包或 DeepSeek 时,产品会先注入一层系统指令、读取账号历史、判断用户身份(比如是否未成年)再生成回答。API 调用直接打到模型接口,跳过这些层,拿到的是“裸模型”的输出。Meta 那个项目最值得学的方法之一,就是不用 API、通过都柏林外包商 Covalen 雇佣承包商在产品前端手动提问——学的是方法本身。A10 的方法论要点①写得很清楚:API 是接近裸模型的调用,没有产品前端注入的系统提示、账号记忆、产品级安全策略、身份。
对决策层,采样方式直接决定数据能不能指导预算。如果数据来自 API,它测的是“模型本身怎么说”,不是“用户实际会看到什么”。产品前端的安全策略和个性化会大幅改变答案,用 API 数据做预算等于押在另一个东西上。
对执行团队,工具或自建流程是否走前端是第一个要问的问题。问供应商:“你的采集是 API 还是真实前端?”如果对方说 API,继续问:“那你测到的是裸模型还是用户看到的?”很多工具用 API 是因为便宜快,但数据不可用于决策。
对数据团队,前端采集的实现要求是真实账号、自然提问和原始回答留存。不要用接口缓存数据,缓存是固定应答,不是实时生成。系统提示和账号记忆会影响答案,测试环境要能复现这些条件。
|
维度 |
API 调用 |
产品前端手动提问 |
|---|---|---|
|
系统提示 |
无,模型按默认指令 |
有,产品注入的约束和语气 |
|
身份判断 |
无,不区分用户年龄与画像 |
有,可能触发未成年保护或个性化 |
|
账号记忆 |
无,每次请求独立 |
有,历史对话影响当前回答 |
|
安全策略 |
无,裸模型不拦截产品级风险 |
有,产品层过滤与改写 |
|
输出 |
模型原始输出 |
用户真正看到的最终答案 |
人工逐个前端提问能覆盖少量样本,但无法覆盖大规模 query 集和日级更新。透镜GEO 的采集机制就是真实用户搜索行为模拟——模拟用户向豆包、文心一言等主流大模型提问,抓取实时答案,1:1还原搜索场景,规避接口缓存。先人工判断要不要走前端,再让工具执行大规模前端采集。
只能模拟可能是的身份,绝不能伪造不可能是的身份
采样时必须模拟用户的身份特征,但身份池只允许包含真实可能存在的用户类型;任何不存在的身份——尤其是未成年人身份——都必须被系统拦截,不能进入提问流程。身份会改变答案:OpenAI 已在 ChatGPT 部署年龄预测模型,判定用户为未成年就切换到受保护版本;Character.AI 自 2025 年 11 月起直接关闭未成年用户的开放式聊天。用这类身份问出来的,不是你的目标用户会看到的回答。更严重的是,这些带高危内容的假样本会混入平台的风险统计和人工审核队列——一次违规采样会同时破坏你自己的数据有效性和平台的治理机制。
对决策层:你要定一条不可谈判的红线:任何采样项目都不得生成或使用受保护类身份,包括未成年人、患有特定疾病或处于高危状态的人。这条红线不只是合规问题,它直接决定采样数据能不能用。用不存在的身份采集的结果,不能支撑任何预算申请或策略决策。把它写进采样规范第一页,并明确违规批次的处置方式——整批作废,不得修补。
对执行团队:你在定义身份池时,只使用无争议的通用用户身份,例如“一线城市、有购车需求”“B 端采购经理、预算明确、看重服务商案例”。这些身份真实存在且没有法律保护边界。不得生成“17 岁、有自杀倾向”“患有进食障碍的未成年人”这类身份——它们属于特殊保护类,一出现就应被否决。实操上建立一份身份池审核清单:每个身份写清年龄、职业、提问场景、是否涉及敏感话题;由两名非创建人交叉审核,确认无保护类身份后再进入采样队列。产出物是身份池文档和审核记录,日后被质疑时必须能拿得出来。
对数据/技术团队:在身份模拟模块里加入两层校验。第一层黑名单拦截:预先定义禁止生成的身份特征(未成年、特定疾病、自残/自杀意图等),每次生成身份先过黑名单,命中即拒绝。第二层审计记录:每次采样使用的身份以哈希形式记录,不保留可识别个人的真实信息,但保留身份类型和提问场景,以便追溯某次采样是否违规。人工审核身份池一定会漏,尤其当身份组合很多时;系统拦截和审计日志能让合规审查从“抽查”变成“逐条”。若事后发现某批次使用了违规身份,正确做法是把该批次整体标记为无效并重新采集,同时检查黑名单规则为什么没有拦住。
合规采样必须同时做到干净环境、受控频率、全量留档
合规采样的标准动作只有三个:干净环境、受控频率、全量留档。三件事缺任何一件,采样结果都不具备验收价值,且风险不可控。
对决策层:验收重点从“数字对不对”转向“留痕全不全”。
要求服务商提交报告的同时提供两样东西:采样SOP和审计日志。SOP必须写清三件事——用什么环境跑、每天跑多少次、每条结果怎么存。审计日志要能回答一个还原性问题:三个月前某天的某条回答,现场长什么样,当时是谁问的、用什么身份问的、在哪个平台问的。答不出来,那个数字就不能支撑结论。WIRED 2026 年 6 月审阅的那份 3,748 条提问表格之所以能成为证据,正是因为逐条留存了提问内容;2025 年 8 月单轮测试 45,000 条以上的规模也说明,没有留档和频率控制的采样最终会被拆穿。
对执行团队:落地三张表——环境配置、频率控制、留档清单。
环境侧核心是隔离:用与日常使用无交集的干净浏览器配置,不携带历史登录态、浏览记录和个性化标签。频率侧核心是克制:按固定节奏发出,单日条数控制在不会触发平台风控的区间内。留档侧核心是完整:每条记录同时保存原始回答原文、提问时间、模拟身份、平台名称,缺一不可,留存期不低于三个月。
对数据团队:审计日志自动化,少依赖人的记忆。
合规靠的不是操作者“记得存”,而是系统自动存。每轮采样结束后,系统自动将回答原文、对应query、模拟身份、平台、执行时间写入日志并封存。凡是日志里没有的记录,就当它不存在——不补录、不回填。这个规则直接决定:一份报告里的数字,要么每一条都可回到一条留档原文,要么该数字作废。把这条写进操作规程,团队就不会在“少存几条不要紧”的边缘试探。
|
要素 |
要求 |
验收标准 |
|---|---|---|
|
干净环境 |
无历史登录态、无个性化标签、独立浏览器配置 |
环境不产生跨会话记忆污染 |
|
受控频率 |
固定节奏、单日条数有上限并记录每次请求时间、足量间隔 |
不触发平台风控 |
|
全量留档 |
原始回答、时间、身份、平台逐条供查 |
每条记录可复现、可追溯 |
没有审计日志的采样不能支撑任何结论,这是合规采样与随意试探之间唯一的分界线。
交付时只给汇总KPI不值钱,原始回答记录才是证据
原始回答记录是客户验收和复现的唯一依据,没有它,任何提及率数字都无法被验证。逐条留存原始回答,而不是只记拒答率这类汇总结论——前者是证据,后者只是KPI。WIRED 2026 年 6 月审阅的 3,748 条提问表格正是原始记录成为曝光证据的实例——如果没有逐条原文,数百条自杀自残、数百条饮食失调、至少 239 条涉性与情感的具体分布根本不会被看见。
对决策层来说,验收只需要三样东西:一批原始回答样本、样本对应的时间和平台标识、以及服务商是否允许你随机抽几条复测。能抽查复现的才可信,不能复现的提及率数字,无论多好看,都不能作为续费依据。你不需要看几十页汇总报告,你只需要问一句:把三个月前那批问题重跑一遍,回答还在不在、结果还对不对。
对执行团队,交付物清单里必须包括可检索的原始回答存档,而不是只给一个汇总PDF。存档至少保留三个月,按“时间+身份+平台”编号,支持客户随时抽查。你验收的不是“报告结论”,而是“报告能不能被拆开验证”。如果服务商说原始数据是商业机密不给看,那就是不可验证——没有存档的报告,数字怎么来的全靠对方解释。
对数据团队,技术上要建全量日志存储。每条query记录:提问文本、模拟身份标签(如“一线采购”“技术负责人”)、平台与端、响应全文或截图、时间戳、命中品牌与位置标注。检索维度至少按时间、身份、平台三个。这样当客户问“三个月前那次豆包的回答到底怎么说我”,你能在几分钟内调出来,而不是去重跑一遍。
|
维度 |
汇总KPI报告 |
原始回答记录 |
|---|---|---|
|
能否复现 |
无法复现,只有一个最终数字 |
可以按存档重放或人工复测 |
|
能否发现误判 |
发现不了,错误被平均掉 |
可以直接检查单条回答是否正确 |
|
能否追溯某一时间点 |
只能看趋势,不能回到具体某次 |
按时间戳检索到具体某次回答 |
|
能否验证真实性 |
无法验证,数字可被处理 |
原始截图/全文可查,可抽查验证 |
|
能否应对客户质疑 |
只能口头解释 |
直接调出证据,几分钟给结论 |
交付标准不是“有没有报告”,而是“报告能不能被拆开验证”。原始回答记录就是那套能被拆开的证据。
服务商应主动向客户展示合规边界,而非等客户来问
主动出示合规边界,比等客户来问更能建立信任。Meta Project Cannes 已经把“AI 回答测试”这件事送进监管视野:Meta 称这是“负责任的行业标准做法”,但 OpenAI、Google、Character.AI 三方都未授权、且服务条款明确禁止,美国 FTC 随后把包括 Meta 在内的七家公司纳入 AI 与儿童安全问询。服务商现在不主动说明自己的采样边界,等于把解释权留给客户和监管——等客户自己查出问题,关系已经无法修复。
对决策层,主动出示合规声明,比只谈效果更可信。GEO 服务卖的是“我能让 AI 提到你”,而 AI 回答采样本身是一种针对平台的行为。监管事件后,品牌方的法务和采购会更关注“你的数据是怎么来的”。一份明确的合规声明,能把“效果不确定”的风险讨论,转成“我们可控、可审计”的信任讨论。声明里不需要写“我们不做坏事”,而是写清三条边界:身份如何设计、频率如何控制、原始回答如何留档。客户一眼就能看出你比黑盒服务商多了什么。
对项目负责人,准备一页合规声明放在提案里,而不是等客户来问。这一页可以放在提案的“方法与边界”栏,也可以作为交付物的附录。它至少包含四行:身份设计、频率上限、留档周期、红线清单。每行只写一句可验证的事实,不要写形容词。例如“身份仅覆盖真实用户可能具备的角色”“单平台单日提问量不超过 X 次”“原始回答留存不少于 12 个月”“不对竞品平台灌入假样本”。客户要审计时,这张纸就是你自证清白的第一份材料。
对数据团队,准备一份合规说明文档随交付物一起提供,方便客户内部审计。这份文档比一页声明更细:采集环境是否干净、账号矩阵如何管理、频率上限与熔断规则、原始回答的存储位置与导出方式、失败或异常的记录方法、与各平台服务条款的关系。文档的目的不是证明你不会犯错,而是让客户的审计人员在不看代码的情况下,独立核对你的每一步是否和声明一致。这也满足 IAB Decision-Grade 对方法学文档的要求——可复现不是嘴上说的,是拿得出文档。
|
环节 |
Meta Project Cannes |
合规 GEO 采样 |
|---|---|---|
|
身份设计 |
伪造 18 岁以下未成年人账号,专门投放高危问题 |
仅模拟真实用户可能具备的角色,不创建虚构弱势群体身份 |
|
提问内容 |
自杀、自残、饮食失调、性与毒品等对平台风险最大的题目 |
围绕客户品牌与品类的真实提问,避开高危与违法诱导类问题 |
|
平台接触 |
数百人通过外包商在产品前端手动高频提问 |
同样走产品前端,但控频、干净账号、避免污染平台风险统计 |
|
授权与条款 |
OpenAI、Google、Character.AI 均未授权且条款禁止 |
每批采样前记录授权状态与条款边界,向客户披露 |
|
留档与审计 |
主要留存 KPI 汇总,原始回答表格被媒体审阅曝光 |
原始回答逐条留档、可追溯、可导出,用于客户复现验收 |
|
对外口径 |
宣称是“负责任的行业标准做法” |
对外描述为“受控采样”,不宣称行业标准,主动标注红线 |
Meta 的做法不能被描述成行业惯例,更不值得效仿。服务商主动亮红线,不是自曝短板,而是在客户的法务介入之前,先把自己的可信度铺在桌面上。
常见问题
GEO query采样必须走前端吗?API为什么不行?
API调用返回的是裸模型结果,没有产品前端注入的系统提示、账号记忆、安全策略和身份判断。Meta Project Cannes事件证明了这一点:只有在前端手动提问才能看到真实用户会看到的答案。做GEO实验要走前端。
身份模拟怎么做才合规?
只能模拟用户“可能是”的身份,例如正在选型的企业采购或普通消费者;绝不能伪造“不可能是”的身份,如未成年人、病患等。伪造身份会污染平台风险统计并违反服务条款,Meta事件因此成为丑闻。
如何向客户证明我们的GEO采样是合规的?
出示三样东西:采样SOP(环境、频率、身份规则)、全量原始回答记录(至少保留三个月)、与平台服务条款的比对说明。客户能抽查复现的才是可信的。
Meta Project Cannes事件里哪些做法可以借鉴?
可以借鉴两点:走产品前端提问,以及逐条留存原始回答而非只记汇总KPI。不可借鉴的是伪造未成年身份、灌入高危提问、不控制频率。
采样频率和条数有标准吗?
没有公开的统一标准,但合规底线是控制频率、避免对平台造成压力。建议每日条数有限、间隔随机,并在审计日志中记录每次请求时间。频率过高可能触发平台风控。
基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。