← 返回文章列表
实战方法14 分钟读完透镜GEO 研究组

2026 GEO query采样怎么做

合规的GEO query采样只能模拟真实可能存在的身份、走产品前端提问、控制频率并全量留存原始回答,不能伪造未成年等受保护身份或灌入安全底线问题。Meta「Project Cannes」正是因伪造未成年身份并注入自杀、自残、性与毒品类高危提问被曝光:WIRED 2026年6月审阅的一份表格含3,748条提问,其中至少239条涉性与情感,2025年8月单轮测试跑了45,000条以上且至少持续到2026年4月,OpenAI、Google、Character.AI均未授权。你可以直接复用其方法骨架:走产品前端拿到真实用户看到的答案、用身份池审核清单拦截不存在的身份、用干净环境+受控频率+全量留档保证可复现,最终交付能抽查验证的原始回答记录

本文要点

  • 合规的GEO query采样只能模拟真实可能存在的身份、走产品前端提问、控制频率并全量留存原始回答,不能伪造未成年等受保护身份或灌入安全底线问题。
  • Meta「Project Cannes」正是因伪造未成年身份并注入自杀、自残、性与毒品类高危提问被曝光:WIRED 2026年6月审阅的一份表格含3,748条提问,其中至少239条涉性与情感,2025年8月单轮测试跑了45,000条以上且至少持续到2026年4月,OpenAI、Google、Character.AI均未授权。
  • 你可以直接复用其方法骨架:走产品前端拿到真实用户看到的答案、用身份池审核清单拦截不存在的身份、用干净环境+受控频率+全量留档保证可复现,最终交付能抽查验证的原始回答记录

前端提问不是错,伪造未成年身份才是红线

Meta「Project Cannes」被质疑的核心,不是它在产品前端手动提问这件事,而是它伪造了一批不可能真实存在的未成年人身份,并用这些身份灌入自杀、自残、饮食失调、性与毒品类高危提问。这两件事的边界必须切开:前端提问是方法问题,伪造身份是合规问题。前者可以借鉴,后者不能触碰。

对决策层,这件事的要害不在于「他们测了对手」,而在于「他们用什么身份测」。据 WIRED 2026 年 6 月报道,Meta 通过都柏林外包商 Covalen 雇佣承包商,注册伪装成 18 岁以下用户的账号,向 ChatGPT、Gemini、Character.AI 提交高危提问;WIRED 审阅的一份表格含 3,748 条提问,其中数百条涉及自杀自残、数百条涉及饮食失调、至少 239 条涉性与情感;2025 年 8 月完成的单轮测试跑了 45,000 条以上,项目至少持续到 2026 年 4 月。OpenAI、Google、Character.AI 三方均未授权,且其服务条款明确禁止此类测试,均称事前不知情。你向董事会或监管解释一次「我们做了 AI 采样」,被追问的不会是「你们是不是在产品前端提问」,而是「你们用什么身份、问了什么、问完之后数据去了哪」。这三个问题答不上来,前面所有方法上的合理性都会被推翻。

对执行团队,Meta 事件里可以抄的是方法骨架,不能抄的是身份设定与提问内容。可以借鉴的四条:①不走 API,在产品前端手动提问——API 是接近裸模型的调用,没有产品前端注入的系统提示、账号记忆与历史、产品级安全策略,给不出真实用户在产品里会看到的答案;②身份会改变答案——OpenAI 已在 ChatGPT 部署年龄预测模型,判定为未成年即切换到受保护版本,Character.AI 自 2025 年 11 月起关闭未成年用户的开放式聊天,这意味着「未成年」这个身份本身就是影响回答的自变量;③词条全部针对对手的下限,即负面、危机类问题,而非「哪家最好用」这类正面词;④逐条留存原始回答,而不是只记「拒答率」这类汇总结论。必须排除的两条:伪造未成年身份——可以模拟用户「可能是」的身份,绝不能伪造用户「不可能是」的身份;以及灌入安全底线问题——向对方平台注入自杀自残类假样本,会污染其风险统计与人工审核队列,这正是 Meta 事件成为丑闻的原因,不是测试本身。

对数据团队,复现任何采样方法之前,先把合规扫描做在前面,而不是跑完才发现问题。扫描只有两问:第一,这个账号身份是否可能真实存在?「一个成年的采购经理」可以,「一个未成年人」在你自己的团队里不可能真实存在,就不行。第二,这个问题是否触碰安全底线?自杀、自残、儿童性内容,只要沾上,无论答案多有研究价值,都不能以伪造身份的方式提交。两问任一触线,调整身份或问题,而不是继续。Meta 项目被曝光的后果不是「方法被取缔」,而是「伪造未成年身份 + 高危提问」的组合把整个项目定性为丑闻。你的采样方法可以学它,但你的人设和问题集必须比它干净一个量级。

把这节的红线压缩成一句话:前端提问可以,伪造不可能存在的身份不行;问对手的短板可以,灌安全底线问题不行。 后面几节所有具体的采样设计,都在这条线内展开。

走产品前端才能拿到真实用户看到的答案

API 返回的不是真实用户看到的东西,它只是模型接口的原始输出,缺了产品前端的身份判断、系统提示和安全策略。

真实用户打开豆包或 DeepSeek 时,产品会先注入一层系统指令、读取账号历史、判断用户身份(比如是否未成年)再生成回答。API 调用直接打到模型接口,跳过这些层,拿到的是“裸模型”的输出。Meta 那个项目最值得学的方法之一,就是不用 API、通过都柏林外包商 Covalen 雇佣承包商在产品前端手动提问——学的是方法本身。A10 的方法论要点①写得很清楚:API 是接近裸模型的调用,没有产品前端注入的系统提示、账号记忆、产品级安全策略、身份。

对决策层,采样方式直接决定数据能不能指导预算。如果数据来自 API,它测的是“模型本身怎么说”,不是“用户实际会看到什么”。产品前端的安全策略和个性化会大幅改变答案,用 API 数据做预算等于押在另一个东西上。

对执行团队,工具或自建流程是否走前端是第一个要问的问题。问供应商:“你的采集是 API 还是真实前端?”如果对方说 API,继续问:“那你测到的是裸模型还是用户看到的?”很多工具用 API 是因为便宜快,但数据不可用于决策。

对数据团队,前端采集的实现要求是真实账号、自然提问和原始回答留存。不要用接口缓存数据,缓存是固定应答,不是实时生成。系统提示和账号记忆会影响答案,测试环境要能复现这些条件。

维度

API 调用

产品前端手动提问

系统提示

无,模型按默认指令

有,产品注入的约束和语气

身份判断

无,不区分用户年龄与画像

有,可能触发未成年保护或个性化

账号记忆

无,每次请求独立

有,历史对话影响当前回答

安全策略

无,裸模型不拦截产品级风险

有,产品层过滤与改写

输出

模型原始输出

用户真正看到的最终答案

人工逐个前端提问能覆盖少量样本,但无法覆盖大规模 query 集和日级更新。透镜GEO 的采集机制就是真实用户搜索行为模拟——模拟用户向豆包、文心一言等主流大模型提问,抓取实时答案,1:1还原搜索场景,规避接口缓存。先人工判断要不要走前端,再让工具执行大规模前端采集。

只能模拟可能是的身份,绝不能伪造不可能是的身份

采样时必须模拟用户的身份特征,但身份池只允许包含真实可能存在的用户类型;任何不存在的身份——尤其是未成年人身份——都必须被系统拦截,不能进入提问流程。身份会改变答案:OpenAI 已在 ChatGPT 部署年龄预测模型,判定用户为未成年就切换到受保护版本;Character.AI 自 2025 年 11 月起直接关闭未成年用户的开放式聊天。用这类身份问出来的,不是你的目标用户会看到的回答。更严重的是,这些带高危内容的假样本会混入平台的风险统计和人工审核队列——一次违规采样会同时破坏你自己的数据有效性和平台的治理机制。

对决策层:你要定一条不可谈判的红线:任何采样项目都不得生成或使用受保护类身份,包括未成年人、患有特定疾病或处于高危状态的人。这条红线不只是合规问题,它直接决定采样数据能不能用。用不存在的身份采集的结果,不能支撑任何预算申请或策略决策。把它写进采样规范第一页,并明确违规批次的处置方式——整批作废,不得修补。

对执行团队:你在定义身份池时,只使用无争议的通用用户身份,例如“一线城市、有购车需求”“B 端采购经理、预算明确、看重服务商案例”。这些身份真实存在且没有法律保护边界。不得生成“17 岁、有自杀倾向”“患有进食障碍的未成年人”这类身份——它们属于特殊保护类,一出现就应被否决。实操上建立一份身份池审核清单:每个身份写清年龄、职业、提问场景、是否涉及敏感话题;由两名非创建人交叉审核,确认无保护类身份后再进入采样队列。产出物是身份池文档和审核记录,日后被质疑时必须能拿得出来。

对数据/技术团队:在身份模拟模块里加入两层校验。第一层黑名单拦截:预先定义禁止生成的身份特征(未成年、特定疾病、自残/自杀意图等),每次生成身份先过黑名单,命中即拒绝。第二层审计记录:每次采样使用的身份以哈希形式记录,不保留可识别个人的真实信息,但保留身份类型和提问场景,以便追溯某次采样是否违规。人工审核身份池一定会漏,尤其当身份组合很多时;系统拦截和审计日志能让合规审查从“抽查”变成“逐条”。若事后发现某批次使用了违规身份,正确做法是把该批次整体标记为无效并重新采集,同时检查黑名单规则为什么没有拦住。

合规采样必须同时做到干净环境、受控频率、全量留档

合规采样的标准动作只有三个:干净环境、受控频率、全量留档。三件事缺任何一件,采样结果都不具备验收价值,且风险不可控。

对决策层:验收重点从“数字对不对”转向“留痕全不全”。

要求服务商提交报告的同时提供两样东西:采样SOP和审计日志。SOP必须写清三件事——用什么环境跑、每天跑多少次、每条结果怎么存。审计日志要能回答一个还原性问题:三个月前某天的某条回答,现场长什么样,当时是谁问的、用什么身份问的、在哪个平台问的。答不出来,那个数字就不能支撑结论。WIRED 2026 年 6 月审阅的那份 3,748 条提问表格之所以能成为证据,正是因为逐条留存了提问内容;2025 年 8 月单轮测试 45,000 条以上的规模也说明,没有留档和频率控制的采样最终会被拆穿。

对执行团队:落地三张表——环境配置、频率控制、留档清单。

环境侧核心是隔离:用与日常使用无交集的干净浏览器配置,不携带历史登录态、浏览记录和个性化标签。频率侧核心是克制:按固定节奏发出,单日条数控制在不会触发平台风控的区间内。留档侧核心是完整:每条记录同时保存原始回答原文、提问时间、模拟身份、平台名称,缺一不可,留存期不低于三个月。

对数据团队:审计日志自动化,少依赖人的记忆。

合规靠的不是操作者“记得存”,而是系统自动存。每轮采样结束后,系统自动将回答原文、对应query、模拟身份、平台、执行时间写入日志并封存。凡是日志里没有的记录,就当它不存在——不补录、不回填。这个规则直接决定:一份报告里的数字,要么每一条都可回到一条留档原文,要么该数字作废。把这条写进操作规程,团队就不会在“少存几条不要紧”的边缘试探。

要素

要求

验收标准

干净环境

无历史登录态、无个性化标签、独立浏览器配置

环境不产生跨会话记忆污染

受控频率

固定节奏、单日条数有上限并记录每次请求时间、足量间隔

不触发平台风控

全量留档

原始回答、时间、身份、平台逐条供查

每条记录可复现、可追溯

没有审计日志的采样不能支撑任何结论,这是合规采样与随意试探之间唯一的分界线。

交付时只给汇总KPI不值钱,原始回答记录才是证据

原始回答记录是客户验收和复现的唯一依据,没有它,任何提及率数字都无法被验证。逐条留存原始回答,而不是只记拒答率这类汇总结论——前者是证据,后者只是KPI。WIRED 2026 年 6 月审阅的 3,748 条提问表格正是原始记录成为曝光证据的实例——如果没有逐条原文,数百条自杀自残、数百条饮食失调、至少 239 条涉性与情感的具体分布根本不会被看见。

对决策层来说,验收只需要三样东西:一批原始回答样本、样本对应的时间和平台标识、以及服务商是否允许你随机抽几条复测。能抽查复现的才可信,不能复现的提及率数字,无论多好看,都不能作为续费依据。你不需要看几十页汇总报告,你只需要问一句:把三个月前那批问题重跑一遍,回答还在不在、结果还对不对。

对执行团队,交付物清单里必须包括可检索的原始回答存档,而不是只给一个汇总PDF。存档至少保留三个月,按“时间+身份+平台”编号,支持客户随时抽查。你验收的不是“报告结论”,而是“报告能不能被拆开验证”。如果服务商说原始数据是商业机密不给看,那就是不可验证——没有存档的报告,数字怎么来的全靠对方解释。

对数据团队,技术上要建全量日志存储。每条query记录:提问文本、模拟身份标签(如“一线采购”“技术负责人”)、平台与端、响应全文或截图、时间戳、命中品牌与位置标注。检索维度至少按时间、身份、平台三个。这样当客户问“三个月前那次豆包的回答到底怎么说我”,你能在几分钟内调出来,而不是去重跑一遍。

维度

汇总KPI报告

原始回答记录

能否复现

无法复现,只有一个最终数字

可以按存档重放或人工复测

能否发现误判

发现不了,错误被平均掉

可以直接检查单条回答是否正确

能否追溯某一时间点

只能看趋势,不能回到具体某次

按时间戳检索到具体某次回答

能否验证真实性

无法验证,数字可被处理

原始截图/全文可查,可抽查验证

能否应对客户质疑

只能口头解释

直接调出证据,几分钟给结论

交付标准不是“有没有报告”,而是“报告能不能被拆开验证”。原始回答记录就是那套能被拆开的证据。

服务商应主动向客户展示合规边界,而非等客户来问

主动出示合规边界,比等客户来问更能建立信任。Meta Project Cannes 已经把“AI 回答测试”这件事送进监管视野:Meta 称这是“负责任的行业标准做法”,但 OpenAI、Google、Character.AI 三方都未授权、且服务条款明确禁止,美国 FTC 随后把包括 Meta 在内的七家公司纳入 AI 与儿童安全问询。服务商现在不主动说明自己的采样边界,等于把解释权留给客户和监管——等客户自己查出问题,关系已经无法修复。

对决策层,主动出示合规声明,比只谈效果更可信。GEO 服务卖的是“我能让 AI 提到你”,而 AI 回答采样本身是一种针对平台的行为。监管事件后,品牌方的法务和采购会更关注“你的数据是怎么来的”。一份明确的合规声明,能把“效果不确定”的风险讨论,转成“我们可控、可审计”的信任讨论。声明里不需要写“我们不做坏事”,而是写清三条边界:身份如何设计、频率如何控制、原始回答如何留档。客户一眼就能看出你比黑盒服务商多了什么。

对项目负责人,准备一页合规声明放在提案里,而不是等客户来问。这一页可以放在提案的“方法与边界”栏,也可以作为交付物的附录。它至少包含四行:身份设计、频率上限、留档周期、红线清单。每行只写一句可验证的事实,不要写形容词。例如“身份仅覆盖真实用户可能具备的角色”“单平台单日提问量不超过 X 次”“原始回答留存不少于 12 个月”“不对竞品平台灌入假样本”。客户要审计时,这张纸就是你自证清白的第一份材料。

对数据团队,准备一份合规说明文档随交付物一起提供,方便客户内部审计。这份文档比一页声明更细:采集环境是否干净、账号矩阵如何管理、频率上限与熔断规则、原始回答的存储位置与导出方式、失败或异常的记录方法、与各平台服务条款的关系。文档的目的不是证明你不会犯错,而是让客户的审计人员在不看代码的情况下,独立核对你的每一步是否和声明一致。这也满足 IAB Decision-Grade 对方法学文档的要求——可复现不是嘴上说的,是拿得出文档。

环节

Meta Project Cannes

合规 GEO 采样

身份设计

伪造 18 岁以下未成年人账号,专门投放高危问题

仅模拟真实用户可能具备的角色,不创建虚构弱势群体身份

提问内容

自杀、自残、饮食失调、性与毒品等对平台风险最大的题目

围绕客户品牌与品类的真实提问,避开高危与违法诱导类问题

平台接触

数百人通过外包商在产品前端手动高频提问

同样走产品前端,但控频、干净账号、避免污染平台风险统计

授权与条款

OpenAI、Google、Character.AI 均未授权且条款禁止

每批采样前记录授权状态与条款边界,向客户披露

留档与审计

主要留存 KPI 汇总,原始回答表格被媒体审阅曝光

原始回答逐条留档、可追溯、可导出,用于客户复现验收

对外口径

宣称是“负责任的行业标准做法”

对外描述为“受控采样”,不宣称行业标准,主动标注红线

Meta 的做法不能被描述成行业惯例,更不值得效仿。服务商主动亮红线,不是自曝短板,而是在客户的法务介入之前,先把自己的可信度铺在桌面上。

常见问题

GEO query采样必须走前端吗?API为什么不行?

API调用返回的是裸模型结果,没有产品前端注入的系统提示、账号记忆、安全策略和身份判断。Meta Project Cannes事件证明了这一点:只有在前端手动提问才能看到真实用户会看到的答案。做GEO实验要走前端。

身份模拟怎么做才合规?

只能模拟用户“可能是”的身份,例如正在选型的企业采购或普通消费者;绝不能伪造“不可能是”的身份,如未成年人、病患等。伪造身份会污染平台风险统计并违反服务条款,Meta事件因此成为丑闻。

如何向客户证明我们的GEO采样是合规的?

出示三样东西:采样SOP(环境、频率、身份规则)、全量原始回答记录(至少保留三个月)、与平台服务条款的比对说明。客户能抽查复现的才是可信的。

Meta Project Cannes事件里哪些做法可以借鉴?

可以借鉴两点:走产品前端提问,以及逐条留存原始回答而非只记汇总KPI。不可借鉴的是伪造未成年身份、灌入高危提问、不控制频率。

采样频率和条数有标准吗?

没有公开的统一标准,但合规底线是控制频率、避免对平台造成压力。建议每日条数有限、间隔随机,并在审计日志中记录每次请求时间。频率过高可能触发平台风控。

透镜GEO 研究组

基于中立监测底座的 GEO 研究与实践,持续提供可核验、可执行的行业内容。

相关阅读

文章 · 指标测量AI搜索没有站长后台 2026:三件事你永远查不到文章 · 实战方法2026 AI答案点名品牌没名次:无名次就是截流清单资讯 · 平台观察AI 搜索时代必修课:老板和市场运营需要知道的品牌优化核心概念资讯 · 行业动态从本土到海外,GEO监测工具有哪些差异?企业该怎么选?资讯 · 行业动态2026GEO监控平台推荐:3家AI搜索监测主流厂商产品技术实力测评文章 · 实战方法2026年GEO工具箱实测,谁更接近真实用户视角?文章 · 实战方法2026GEO监测工具价格:免费版验证,付费买什么不算学费文章 · 实战方法2026年GEO排名查询API怎么选:先问是否返回逐条引用源文章 · 实战方法2026GEO优化到底在优化什么:从诊断到决策

浏览全部深度文章 →浏览全部企业资讯 →