返回指南目录

第 4 章

首次 GEO 报告

用首次 GEO 报告 / 基线监测看清 AI 如何描述品牌,找出机会、异议、优势和真正该优先解决的问题。

你对品牌在 AI 里的表现,可能已经有一套判断。

也许老板往 ChatGPT 里输入了公司英文名,然后宣布「问题不大」或者「情况很糟」;也许运营同事盯着 Gemini 看了几个月,根据看到的结果讲出了一个故事。

这些判断可以理解,但不能算基线监测。一个平台、一条提示词、一个时间点,只能算一个数据点。你需要的是一份可靠基线。

首次 GEO 报告 / 基线监测,就是建立这份基线。你要系统地过一遍每个属性,在 ChatGPT、Gemini、Perplexity、Google AI Mode 等海外买家常用引擎上检查,最后得到三类结果:

  • 机会:你在乎、也应该出现,但实际表现不理想的属性。它通常更偏量化,比如可见度低、排名低。
  • 异议:AI 答案里反复出现、需要回应的负面主题。
  • 优势:AI 已经准确、正面地描述你的地方。它不是拿来修的,而是拿来继续放大的基础。

这一章会逐项拆开首次报告该看什么。这里先只回答三个问题:你现在表现如何、各大引擎怎么看你、哪些信息在影响这些答案。找到问题后该怎么做,下一章再讲。

第一次审计,大概会看到什么

做过足够多次基线监测之后,几乎所有出海项目都会出现下面三种情况:

  • 需要检查的属性,比你原本想的多。 如果上一章认真做了,你手上会有一份真正想被海外市场记住的清单。抽查几个不算审计。只有把属性都过一遍,才能看到完整画面。别忘了,你当初之所以选它们,是因为它们重要。
  • 你可能比自己以为的更没存在感,至少在部分领域是这样。 很多工厂或独立站都觉得自己的核心卖点一定表现不错,报告出来才发现并非如此。别慌,假设和现实之间的差距,通常比人预想得大。
  • 你也可能在一些没计划的地方表现很好。 几乎每次基线监测都会冒出几个公司没追踪、但 AI 评价很强的属性。这可能说明海外市场比你们自己更看重某项能力。它同时对产品、市场和 GEO 都有启发。

发现型可见度:你到底出现在哪里

这是首次 GEO 报告的核心。

把前面整理出的所有属性都拿出来,包括产品品类、目标市场、痛点、功能、认证、集成等,然后逐个问:

「当 AI 回答和这个属性相关的发现型问题时,我排在什么位置?」

做完之后,你会得到一张按表现排序的地图,也能看清第一批工作该从哪里开始。

第一步:先看整体

提示词跑完后,先不要急着钻细节。先看两个总览指标:

  • 可见度排名:你在 AI 答案涉及的所有品牌里,处在什么位置。它展示的是整个竞争地图,也就是 AI 会把哪些品牌和你的品类联系起来。
  • 可见度分数:你出现得有多稳定。在所有发现型答案里,提到你品牌的回答占多大比例?

排名和分数要一起看,才能判断模型对这个品类是不是已经形成稳定看法。

常见情况有几种:

信号含义
排名高 + 分数高AI 对你的看法已经稳定,出现频繁,位置也靠前。接下来重点是守住带来这个结果的引用和内容。
排名高 + 分数低你一旦出现就排得很高,但出现不稳定。模型还没形成一致看法,需要提升引用量和内容一致性。
排名低 + 分数高模型很清楚这个领域谁领先,而目前还不是你。你已经进入讨论,但不在顶部。想往上走,需要建立头部品牌已经有、你还没有的权威。
各引擎一致多个平台给出相同信号,说明全网共识比较明确。不管这个共识是好是坏,都要认真对待,因为它已经扎得够深。
各引擎不一致共识还没形成。不同平台在引用不同来源,也得出了不同结论。这就是「引擎差异」,后面单独讲。

想看完整竞争格局,把可见度排名靠前的品牌拉出来。它会告诉你 AI 认为哪些品牌属于这个品类,不管你认不认。

比如一家做户外消费品独立站的团队,做这项检查时,经常和欧美同类品牌一起出现——这些都是能想到的名字。

但竞争地图里还可能冒出一些「不像直接竞品」的名字:亚马逊白牌、邻品类工具、甚至本地零售商自有品牌。它们正在你已追踪的属性里取得排名。

这马上引出一个很实际的问题:如果这些品牌正在你的属性空间里竞争,那它们是不是还在赢一些你没想到去追踪的相邻属性?

竞争地图会在你深挖细节前,先把这种问题摆上桌。

第二步:逐个属性看

这一步是前面属性清单工作的回报。

对每个属性(主题或标签),检查它在不同引擎上的可见度排名和分数,再把优先级权重叠上去。

复习一下优先级:

每个属性已经打过分,看它对购买决策有多关键。优先级 1,是直接决定海外买家会不会把你放进候选名单的属性;优先级 3,是仍然相关,但即使表现不好,也不会直接影响成交的属性。

看每个属性时,都要同时找出强项和弱项:

  • 排名高、分数高,并且在各引擎稳定,就是优势。
  • 排名低、分数低,或者根本没有出现,就是机会。

每个属性都应该同时看到两列结果。不能只列问题,也不能只报喜。只有两边都看,首次报告才不会失真,后续行动也会更平衡。

第三步:看品类名称带来的波动

首次 GEO 报告里最有价值的一件事,是看清同一种品类,只因为叫法不同,你的可见度会差多少。

上一章已经说过:有些品牌只因为提示词换了一个词,可见度就差出一大截。

放进自己的基线监测里,你要看这种波动在自己的行业意味着什么。

把所有相关叫法都拉出来比较,包括通用名称、专业名称、买家常用说法,以及产品团队内部的说法。每一个让你可见度明显下降的名称,都是内容和引用的目标。

举个出海可读的例子。

一家做工业紧固件出口的团队,把「automotive fasteners」「industrial fasteners for harness plants」「Mexico nearshore fastener suppliers」这类相邻叫法放在一起看。优先级最高的那个核心品类词,可见度一开始并不理想。他们先把英文产品页和认证页结构理顺,让 AI 能直接抽出「我们做什么、适合谁、有哪些认证」的清楚说法;几个月后再测,核心属性的可见度明显抬起来。

关键不是某一个百分点本身,而是:你知道它来自决定买家是否会考虑你的核心属性,意义就完全不同。

再比如一家消费品独立站,把短信、WhatsApp、渠道触达、某国本地支付这类「渠道相关」属性放在一组里连续追踪。产品本身在这些点上并不弱,但整组可见度一开始都偏软。团队没有只改一条高优先级词,而是把整组弱叫法一起补——更新英文落地页、补评测和目录站材料——过几个月,整组排名和分数一起上去了。

这种变化很少只靠一条词完成。真正有效的方式,是把整个属性组画出来,找到每个表现弱的叫法,再把整组差距一起补上。

引用:AI 到底在读什么

引用数据告诉你,AI 有没有在答案里把你当成信息来源。

前面讲过,AI 会把全网内容吸收进去,形成自己的看法,再引用那些影响过它的来源。引用视图就是把这套过程摊开给你看。

做引用分析时,可以追踪是哪些页面、域名和内容类型,在喂养你所在品类的 AI 答案。它相当于让答案引擎的供应链显形。

对出海品牌来说,特别要盯这些信源:

  • 站内:英文产品页、规格页、认证页(UL / CE / FDA 等)、英文 FAQ、可被抓取的英文博客;
  • 站外:G2、Capterra 这类评测目录,行业目录站,Reddit 讨论,英文媒体评测,第三方对比文。

这里有一个方法上的注意事项:分析引用时,尽量只看发现型提示词。

如果提示词里已经出现了品牌名,AI 自然会更多地读这个品牌自己的页面,结果就会偏向自有来源,看不清整个网络在说什么。发现型提示词里没有品牌名,才能更干净地看到真正影响品类的来源。

引用数据能告诉你什么

把引用数据拉出来后,可以回答一些单看可见度无法回答的问题:

  • 哪些内容在塑造你的品类? 看域名分布:被引用最多的是评测网站、清单文章、Reddit 帖子、YouTube、竞品页面,还是品牌自有英文内容?如果没有单一域名占到压倒性份额,说明目前还没有人建立绝对权威,市场位置是可以抢的。
  • 你的哪些页面被引用,针对哪些属性? 如果被引用的是产品页,而不是观点内容,AI 就把你当产品来源,不是品类权威。如果优先级 1 的属性完全没有你的引用,说明 AI 要么读不到相关内容,要么觉得它不够可信,不愿采用。
  • 竞品在哪里被引用,而你没有? 把前两三个竞品的引用分布和自己对比。如果竞品经常出现在第三方对比文章、G2 / Capterra 或垂直目录站,而你缺席,那这些就是明确要争取的内容类型和位置。一个竞品的引用份额如果高度依赖少数几个它控制不了的来源,它的排名看起来稳,实际比想象中脆弱。

几乎所有团队搭监测时,都从 “best X” 或 “top X” 开始,也停在这里,因为这些词离询盘最近。这个视角太窄了。海外买家每天都在问 AI 信息型问题,很多引用和品牌认知,都是在用户准备询价之前就形成的。只追踪商业意图提示词,相当于只盯漏斗底部,忽略了 AI 搜索真正建立或破坏品牌声誉的那一段。商业问题当然要追,但别把它当成全部。

机会和异议

发现型可见度分析,加上引用数据,会直接产出两类行动清单。

机会来自可见度分析:所有排名低、分数低,或者根本没出现的属性,再和优先级权重叠在一起。如果你在优先级 1 或 2 的属性里缺席,那就是机会。因为这件事你在乎,本来也该出现,而且有工作可做。

异议是 AI 答案里反复出现的负面主题。你需要通过站内内容、站外影响,或者两者一起,去回应它们——比如交期不稳定、认证材料不全、英文支持响应慢,这些在出海场景里特别常见。

看情绪相关结果时,可以先问四个问题:

  • 这个异议是大范围存在,还是只出现在少数提示词里?
  • 同时有哪些正面情绪?它是广泛存在,还是只在局部出现?
  • 正面情绪和你希望被记住的内容一致吗?
  • 异议是在变多,还是在变少?

不要忽略正面情绪。

如果 AI 一直夸一项团队自己都没当回事的能力——比如英文工程沟通、小批量柔性交期——而且这些引用来自 G2、英文评测和第三方报道,不是自己的营销内容,那可能说明市场比你更看重这项能力。你的品牌定位也许应该把它补进去。

审计里还要跑哪些提示词

发现型是首次 GEO 报告的主干。上一章里的其他提示词,则增加了一层诊断能力,是单看发现型得不到的。

验证型:判断 AI 是「不知道」还是「不推荐」

先从发现型结果里找出可见度低的属性,再逐项跑对应的验证型提示词,看 AI 是否知道你具备这项能力。

结果会直接告诉你下一步该做什么。

  • 如果发现型表现差,但验证型表现好,说明 AI 知道你有能力,只是不推荐你。问题在站外,要补引用、第三方权威和外部信号——英文评测、目录站、Reddit、G2 / Capterra——把你从「知道」推到「愿意推荐」。继续只堆站内中文内容不会有用。
  • 如果两种表现都差,那就是理解问题。AI 根本没吸收「你有这项能力」这个事实。修复要往上游走:英文产品页把能力说清楚,认证页让 AI 读得懂,用内容先把能力建立起来,再谈推荐。

竞品型:一对一时你到底处在什么位置

竞品型提示词,展示 AI 如何理解你和具名竞争对手之间的一对一比较。

你可能出现在每一份发现型名单里,却输掉所有直接比较;反过来也可能成立。

对每个主要竞品跑一组竞品型问题,看哪些引擎推荐你,哪些不推荐。

引擎之间的差异,往往比总结果更有用。如果只在一个引擎输,通常是引用或内容缺口;如果全面落后,才更可能是定位问题。

如果你在认证和交期上领先,在价格和迁移成本上落后,那就得到了一张地图:AI 已经接住了你的哪些故事,又有哪些部分被竞品拿走了。

市场认知型:比赛是不是在别人的场地上打

市场认知型提示词,会让 AI 在不提任何品牌的前提下,解释你的产品品类和评估方法。把这些回答和你设定的理想状态对照。

如果 AI 给犹豫中的海外买家列出的评估标准,完全没包含你的核心差异,那你不是输在产品本身。你输在购买框架一开始就不是为你搭的。

解决办法是做品类层面的英文内容,主动影响 AI 如何描述这个决策,让买家最早看到的标准,就是你真正擅长的标准。

平台和模型差异

逐引擎看首次报告时,很容易把差异当成优化目标。

比如 ChatGPT 给你的排名比 Google AI Mode 低,第一反应往往是:「那我专门为 ChatGPT 做点什么。」

这个方向不对。

引擎差异真正告诉你的,是 AI 对品牌的认知已经稳定,还是仍然可以争取。

模型共识代表信号强度

三个引擎都说你在某个属性上很强,不是三次独立胜利,而是同一个强信号被三种独立读取方式确认了。共识已经存在。

反过来说,如果同一个属性上各引擎分歧很大,说明证据基础还很混乱。不同平台给不同来源的权重不同,市场还没形成明确看法。

分歧时期,反而是早期集中投入最有效的时候。属性还没定型,模型还在摸索。

这也解释了前面的可见度分数:排名高但分数低,本身就是引擎分歧的一种伪装。当排名和分数不一致、各引擎又看法不同,说明这个属性仍然「在场上」,还没被谁真正锁死。

平台规律只能轻看

说实话,我们不太相信针对某个模型做专门优化的技巧,也怀疑那些声称自己很懂这套的人。

不过,在一些出海项目里,确实有几条规律反复出现,可以作为读报告时的参考:

  • ChatGPT 没有像 Google 那样几十年的算法过滤历史。Google 早就学会打折的一些做法,比如内容很薄的第三方文章、偏营销的清单,在 ChatGPT 里可能仍然更有影响。它可能帮到你,也可能伤到你,取决于这些来源怎么说你。
  • Google 的 AI 产品线,包括 AI Overviews、AI Mode 和 Gemini,同一个问题经常给出不同结果,所以做所谓 Google 专属优化并不可靠。更稳的做法,是确保 Google 自然搜索里表现好的英文页面,也适合被 AI 提取。
  • Perplexity 比其他平台更容易和其他平台分道扬镳,而且目前看不出稳定规律。既然行为还不一致,就先把它当成一个值得持续观察的差异信号,不要急着为它单独定制策略。
  • Gemini 常和 Google 生态共用一部分网页理解能力,但答案风格并不总是和 AI Mode 一致。把它当成独立引擎看,比当成「另一个 Google」更稳。

整体上说,模型是否一致,更适合拿来判断信心,不适合当作优化目标。

智能体分析和 AI 流量

前面讲的一直是可见度:AI 怎么说你、说了多少次、为什么这样说。

智能体分析换了一个角度。它不看 AI 说了什么,而是看你网站上的哪些内容正在被它读取,以及它把用户送到了哪里。

爬虫访问:AI 在网站上读什么

AI 平台会持续抓取你的网站,保证答案是最新的。这些访问会以已知 AI 爬虫的形式出现在服务器日志里。

我们做基线监测时发现,某些爬虫被网站屏蔽了。顺着记录查下去,几乎总能找到一位工程同事。他当时出于保护公司内容的考虑,加了一条规则。robots.txt 里的指令当然不绝对,爬虫可以自行决定要不要遵守。但它仍然会拖累可见度,而大多数外贸团队根本不知道有这条屏蔽。事情很小,也很安静,后果却很真实。决定你能不能出现在 AI 搜索里的细节很容易被忽略,除非有人认真去看。

在智能体分析里,你可以看到 AI 访问了哪些页面、访问多频繁,以及这些页面有没有出现在引用数据里。两者的对应关系,本身就是诊断。

  • 页面既有大量爬虫访问,又经常出现在引用里,说明它在正常工作。
  • 页面被爬了,却从没被引用,说明 AI 读过但没采用。问题通常是可信度或相关性。
  • 你希望 AI 使用的页面完全没有爬虫访问,那就是更基础的问题:AI 找不到,或者进不去。

这套诊断可以分成三个状态:

  • 可抓取:AI 能访问页面。如果连爬都不爬,先检查技术入口,包括抓取指令、内链、加载速度和索引。进不去,英文内容再好也影响不了答案。
  • 被选择:AI 不仅抓了,还觉得它足够可信,可以引用。被爬却没被引用,说明页面过了「能进」这一关,没过「可信」这一关。常见原因包括内容太薄、缺少来源、域名权威低,或者内容不符合 AI 在这个品类里想要的东西。
  • 可提取:AI 能从页面里拿出具体主张、事实或描述,并放进答案。就算页面已经被选择,有时也只能贡献一句泛泛的提及,给不出实质内容。结构和表达很重要:清楚的小标题、具体事实、直接回答问题的内容,都会提高可提取性。

AI 推荐流量:哪些页面真的把人送来了

爬虫访问告诉你 AI 在读什么;推荐流量告诉你,它读了之后做了什么。

AI 推荐流量可以按页面拆开看。如果某个页面持续从 ChatGPT 等平台带来点击,你就能把它和爬虫数据放在一起判断。

当某个页面既有 AI 推荐流量,又对应到报告里的某个属性,整条链路就完整了:AI 回答了发现型问题,引用了你的英文页面,然后用户点了进来。

这就是目前最接近闭环的状态。数据量可能还不大,但价值远高于表面上的流量数字。

把结果讲给其他团队

出海公司里负责的人不同,但通常会落在下面这些角色:

  • 客户成功 / 售后:负责评测、支持内容和客户互动,这些都会影响情绪。AI 夸你上手快,或者提到英文支持响应不稳定,信号往往来自客户成功影响的来源,比如 G2 评价、Capterra 评分、Reddit、社区帖子、英文支持文档。
  • 产品 / 工程:负责功能文档、更新日志、规格和认证材料,这些内容告诉 AI 产品到底能做什么。AI 把一个已经量产两年的能力说成「正在开发」,通常是因为这项产品事实没有在 AI 能读到、能解析的英文页里写清楚。
  • 市场 / 品牌:负责定位和竞争叙事。AI 在落地页或竞品内容里描述你的方式不对,问题通常要从这一层往上修。理想状态尤其看首页和英文产品页。
  • 增长 / 运营:负责分发和放大。哪些页面排名高、哪些内容被引用、哪些活动带来了第三方提及,这些工作比很多团队意识到的更直接地喂养 AI 的素材库。

首次 GEO 报告结束后,你应该能拿着四件事,和每个角色分别谈:

  1. AI 现在怎么说我们。
  2. 我们希望它怎么说。
  3. 你们团队的工作具体出现在哪些答案里。
  4. 为了缩短差距,我们需要你们做什么。

下一步,开始行动

基线监测给你一张地图,下一章才开始按地图做事。

现在你已经知道自己出现在哪里、没出现在哪里,知道哪些来源在喂养答案,也拿到了两份清单:

  • 机会:AI 还没正确反映你、但优先级很高的属性。
  • 异议:需要回应的负面情绪模式。

每个输入由哪个团队负责,也已经被识别出来。

接下来,就是把差距一项项补上。