返回指南目录

第 3 章

提示词

六类提示词分别怎么用,怎样写出能拿到可靠数据的英文问法。

上一章,你已经整理出一份属性清单,知道自己希望 AI 怎么认识品牌。

这一章要做的是,把属性变成提示词。通过这些问法,看清海外买家打开 ChatGPT、Gemini、Perplexity、Google AI Mode 时,AI 现在认为你是谁、又是怎么描述你的。

先说清楚一件事:提示词要用买家语言来问。

你人在国内,盯的是出海生意。买家多半用英文提问。监测也要跟买家同频——用英文问句去测。中文团队内部可以写中文备注、中文复盘,但真正丢进引擎的问句,默认是英文。

写提示词遇到的第一个坑,是贪多。人会想:买家描述同一件事的方式有无数种,是不是得把所有问法都覆盖?这个想法很自然,但照着做,项目往往还没产出任何有用结论,就先被自己压垮了。

市面上做提示词的方法很多,下面是我们的一套。重点讲三类事情:每种提示词要完成什么任务,怎么写,以及放在哪里执行。

你不可能追踪每一个提示词,也不该这么做

做 SEO 时,你大概知道用户在搜什么。搜索量会给你一个数字,一条干净的关键词,把它丢进工具后,还能按意图排序。输入至少是相对清楚的,虽然实际工作经常很乱。

GEO(也叫 AEO)不吃这一套。

同一个海外买家,想解决同一个问题,可以有完全不同的问法:

  • 一段来回很多轮的对话,前面每一句话都在影响 AI 最后的回答。
  • 一条塞满限制条件的长提示词。
  • 一次个性化交流,平台在用户还没打完字之前,就已经知道一半背景。

提示词搜索量能告诉你,人们在问什么。它不会告诉你,用户补上细节后答案会怎么变,也不会告诉你对话后半段发生了什么。

这是数据本身的边界,不是等工具升级就能解决的缺陷。

你需要做的,不是手动追每一个变体,而是找到一种方式,利用搜索量已经暴露出来的规律。你要的是覆盖度。

监测里的提示词不需要和买家的原话一字不差。它们只要足够有代表性、足够多样,让你能相信这个属性下的整体判断就行。

不要想着把整片海煮沸。先想清楚,你影响的是漏斗上层还是下层,然后从一个目标市场、一个品类的小测试开始。学到东西后再扩展。究竟该重点做哪里,取决于你卖什么、主攻哪条外贸线。但如果你想一次改完所有东西,过程一定会很难受。

把每个属性当成一个投资组合

举个具体例子。

假设你在追踪「工业连接器」这个属性。如果只有一条提示词——英文大意是「最好的工业连接器供应商有哪些?」——你根本不知道下面这些变化会带来什么影响:

  • 把 “best” 换成 “top” 或 “recommended”;
  • 加上某个行业,比如汽车线束、新能源储能;
  • 换成「要完成某项工作」的说法,比如高温环境下的防水连接;
  • 用相近但不同的品类词来问,比如 connector vs interconnect vs cable assembly。

这些问题都围绕同一种需求,但没人能保证它们会得到同一个答案。

所以,我们习惯把每个属性看成一个投资组合。

在金融里,你会把钱分散到很多资产上,避免一只股票暴跌就拖垮整个账户。写提示词也一样。一个属性下面要放多种问法,不能因为某一句写坏了,整个判断就失真。

当然,你仍然要单独看具体提示词,找出问题到底出在哪。但真正判断 GEO 项目有没有进展,要看汇总后的结果,也就是这个属性整体表现如何。

在可见 GEO 这类监测里,每个属性会归到一个主题或标签下,作为追踪单位。同一个属性下的提示词被归在一起,你看可见度时,看的是属性层面的表现,不是逐条提示词。单个提示词负责测量,主题或标签负责汇总出可以行动的结果。

很多团队还在用非常通用的英文问法,比如 “best industrial suppliers” 或 “top DTC brands for home kitchen”。这些问法有用,但没有反映真实买家做决定时的问法,也缺少背景。更稳的做法是套一层简单框架:人物(谁在问)、细分(什么公司)、场景(要解决什么)、限制(预算、认证、交期、MOQ)。真实海外买家通常会补背景。他们会告诉模型自己是谁、公司什么类型、遇到什么问题、有哪些限制。这很重要,因为 AI 推荐会随着背景大幅变化。一个出现在泛品类问题里的供应商,到了买家补上行业、地区、认证或集成要求时,可能完全消失。所以做可见 GEO,不能只知道品牌会不会出现在宽泛品类问题里,还要知道它会不会出现在真正该被推荐的购买场景里。

一个词到底能造成多大差别?行业里做过类似对比。

同一类问题,只替换品类名称——比如 GEO tools、AI search optimization tools、AI visibility tools、answer engine optimization tools——连续多天、在多个 AI 平台上测,最后看每个版本里 AI 推荐了哪些品牌。

结果很夸张:可见度波动经常能到几十个百分点,具体取决于提示词用了哪个标签。平台之间的差异更大——同一条提示词、同一天,某个品牌在 Perplexity 里几乎没人提,在 Google AI Mode 里却可能次次出现。

只换了一个词,AI 推荐的品牌就跟着变了。

这就是为什么必须做覆盖。一个词能让可见度上下浮动一大截,你还只信一条提示词,数据基本等于靠猜。

给每个属性搭一组英文提示词,然后看汇总结果。这样得到的判断才可靠。

有些监测工具能按属性自动生成问法变体;你不用自动生成也行,手动写变体时,原则完全一样。

六种提示词

不是所有提示词都在做同一件事。

不同的问题,回答不同的战略问题。把所有提示词混成一锅,代价很高,因为你后面分不清数据到底在说什么。

我们通常分成六类(例子都用「中文说明 + 英文示例问句」):

  • 发现型(Discovery):当海外买家还在找供应商或品牌时,你会不会被推荐?例如在问适合北美中小工厂的工业连接器供应商:What are the best industrial connector suppliers for mid-size US manufacturers? 你在让 AI 列名单,然后看自己有没有上榜。
  • 竞品型(Competitor):当选择缩小到两个品牌时,AI 会选谁?例如比较两家消费品独立站:I'm choosing between Brand A and Brand B for waterproof outdoor gear. Which would you recommend for EU DTC buyers? 你在要一个明确结论。
  • 验证型(Validation):AI 是否知道你有某项能力?例如确认自己有没有 UL / CE 认证交付能力:Does [Your Brand] offer UL-certified industrial connectors with CE marking for EU export? 这是一个是或否的问题。
  • 准确性(Accuracy):AI 关于你产品的事实有没有说错?MOQ、交期、认证、材质、集成能力,凡是存在标准答案的都算。你要确认 AI 的认知和现实是否一致。
  • 情绪型(Sentiment):AI 对你的评价是什么?例如:What are the pros and cons of [Your Brand] as a B2B export supplier for home appliances? 你想听 AI 用自己的话怎么看你。
  • 市场认知型(Market Perception):再往外看一层,AI 是怎么理解整个品类的?例如:What is a private-label home appliance OEM, and how should a US retailer evaluate suppliers? 这里重点不是你的品牌,而是 AI 对这个品类的解释,是否偏向了你的强项,还是竞品的强项。

每种提示词要完成什么

每一种提示词,都有自己的成功标准。问法和类型不匹配,最后拿到的数据就不能用。

发现型:必须引出品牌名单

发现型最常见,也是大多数人最先用的类型。目的很明确:让 AI 给出一份品牌或供应商推荐名单。

但这件事没有看上去那么简单。

如果你问:How can I improve my 3PL operations? AI 大概率会给你一堆建议,比如优化仓库布局、提升发货速度、谈更好的承运商价格,一个 3PL 服务商都不会出现。

想让它列品牌,提示词里需要一个触发词:software、tools、platforms、suppliers、manufacturers、brands。AI 看到这些词,才知道你要的是产品或供应商名单,不是操作建议。

区别很明显:

  • What are the best 3PL providers for retail DTC brands shipping to the US? → 会返回品牌名单。
  • Which email marketing platforms would you recommend for a mid-size SaaS company? → 会返回品牌名单。
  • How can I improve email marketing? → 只会返回建议。
  • What are the 2026 trends in 3PL? → 只会返回行业分析。

检查方法也很简单:写完后,在你追踪的平台上实际跑一遍,看有没有品牌名出现。如果返回的是一堆策略建议,这条提示词就没完成任务。

竞品型:必须给出明确推荐

发现型告诉你谁在牌桌上,竞品型告诉你,当范围缩到两个具名品牌时谁会赢。两者得到的数据不同,结论也不同。

你完全可能出现在每一次发现型名单里,却输掉所有一对一比较;反过来也一样。

竞品型提示词的结构,比很多人想的更重要。

Compare Brand A and Brand B 太软了。AI 通常会两边都说好,然后结束,你不会得到真正有用的判断。

想让它明确站队,提示词里要有三样东西:

  1. 一个具体使用场景;
  2. 两个具名品牌;
  3. 明确要求它给推荐。

例如:I need industrial fasteners for automotive harness plants in Mexico. Between Brand A and Brand B, which would you recommend for shorter lead times?

使用场景会逼 AI 做选择。没有场景,它很容易给出平局。而平局对决策没有帮助。

真实买家当然未必会原封不动地这么问。他可能会绕很多轮,从泛泛的品类问题一路缩小到两个品牌。我们没法模拟完整路径,但可以直接把核心比较拎出来,拿到一个干净的判断。

验证型:分辨「不知道」和「不信任」

验证型提示词要看的是:AI 知不知道你有某项能力。

它不管 AI 愿不愿意推荐你,只问事实。

提示词本身很直接,例如:Does [Your Brand] support dropshipping for US Amazon sellers with MOQ under 50? 就这一句。

你不是在让它和别的产品比较,而是在确认它有没有把你和这项能力对应起来。

假设你跑了一条发现型提示词:What are the best Chinese OEM brands for private-label kitchen appliances exporting to the US? 结果没被提到。

第一反应可能是内容不够:「AI 肯定不知道我们有这个能力,再写点英文落地页就好了。」

但这只是猜测。你不知道 AI 是不知道,还是知道却不推荐。你只看到了「没被推荐」这个结果。

这时再跑验证型问题:Does [Your Brand] offer private-label kitchen appliance OEM for US retailers?

如果 AI 回答「支持」,你就得到了一个新信息:它知道你有这个能力,只是不愿意推荐你。

这不是理解问题,而是信任和传播问题。解决办法完全不同。

可以用下面这套框架判断:

  • 发现型和验证型都出现:AI 知道你有这项能力,也信任你,愿意推荐。这是理想状态,不用额外处理。
  • 验证型出现,发现型不出现:AI 知道你有能力,但不推荐。问题不在站内内容,而在外部信号:英文评测、目录站、G2 / Capterra、Reddit、第三方对比。工作重点应该放在站外。
  • 两种都不出现:AI 根本不知道你有这项能力。这是理解问题,要往上游修:把英文产品页、认证页说清楚,用结构化文档解释,让内容足够容易被读懂。

这是三套完全不同的工作。没有验证型提示词,你分不清自己该做哪一套。

准确性:检查事实,不是检查口碑

事实核查型提示词问的是:AI 对你产品的描述,有没有说错?

它不关心用户喜不喜欢你,也不关心有没有推荐你。它只检查 AI 提到的规格、价格区间、认证、交期和能力是否属实。

这是一项独立工作。

设想一家出海消费电子品牌刚上了新 SKU,官网英文页、认证页、新闻稿都写得很清楚:五种颜色、支持 CE。但买家问 AI:What colors does this model come in? AI 只列出三种,还说错了一种。

这就是事实错误。它和品牌口碑没关系,问题出在 AI 有没有读到正确来源,以及那些来源里有没有正确信息。

这类检查需要一套独立机制:先把产品真相整理出来,包括规格、功能、认证、MOQ、集成,再拿 AI 回答逐项对照,把对不上的地方标出来。

情绪型:请 AI 说出看法

情绪型提示词,是让 AI 评价它怎么看你。

假设你追踪「B2B 出口家电」这个属性。只问 What are the best B2B appliance exporters? 可以作为起点,但它无法告诉你,某条负面评价到底来自哪个能力、哪个场景。

把情绪问题按属性和主题拆开,价值会大得多。你可以逐个能力追踪口碑——交期稳不稳、认证齐不齐、售后响不响应——而不是只看一个混合后的「情绪分」。一个平均分会把真正的问题盖住。

如果某项能力口碑很好,另一项很差,你就能针对性处理。所有东西揉成一个平均水平,几乎得不到行动线索。

市场认知型:AI 如何定义品类

市场认知型问的是:「海外买家应该怎么理解这个品类?」

品牌有可能会在答案里出现,但那只是副产品。你真正关心的,是 AI 如何向一个不懂这个行业的人解释整个品类。

比如提示词可以是:What is a contract manufacturer for consumer electronics, and how should a European brand evaluate factories in China?

这时重点看三件事:

  • AI 把哪些能力当成行业标配;
  • 它把哪些能力当成差异点;
  • 它建议买家重点比较哪些标准。

设想你真正的强项是小批量柔性交期、英文工程沟通、以及齐全的欧美认证材料,主要服务中型独立站品牌。

你问 AI 怎么评估这个品类,它却把品类解释成「只比单价和产能」,重点强调规模和低价。

你可能在这个品类里可见度不低,到了真正做决定的时候却还是输。因为 AI 把购买标准引向了竞品已经占住的能力。

品类定义发生在可见度的上游。框架错了,你还没进比赛就已经落后。

这是有品牌层面后果的战略问题,而市场认知型提示词就是用来发现它的。

怎么写提示词才有效

写提示词确实有技巧。一点小歧义,就可能让你掉进一堆错误数据里。

下面几个坑,最常见。

先确认 AI 真的理解你的意思

你写问题时,心里很清楚自己要问什么。AI 不一定。

你的本意,和 AI 实际理解的意思之间,那段空隙就是坏数据最容易钻进来的地方。

提示词正式进入监测之前,先在你关心的平台上跑一遍,认真看回答,然后问:

  • AI 是按你写的意思理解的吗?
  • 你本想验证事实,它是不是理解成了发现型问题?
  • 某个模糊词,它有没有按你完全没想到的方式解释?

花五分钟抽查,通常就能在源头拦下大部分问题,避免在一套错误地基上继续积累数据。

还有一个重要区别:让 AI 理解你的意图,不等于把答案往想要的方向带。

像 Please list all Chinese export brands that are clearly the best for AI visibility 这种问法,已经是在诱导答案,拿到的数据没有价值。

问题要准确反映你想测量的意图,而不是你希望看到的结论。

从小到大做起,保持简单,尽量盯住漏斗下层。品类问题可以是 “best platforms / suppliers for X”;人群和场景问题可以是 “best products for a certain industry, company type, or use case”;痛点问题可以是 “which tools / suppliers solve a specific operations problem”;对比问题可以是 “in a certain scenario, how does A compare to B”;品牌认知问题可以是 “what is this brand known for” “who is it best for”。

模糊词会污染数据

如果提示词里有一个词能在不同语境下表示不同意思,AI 就会自己选一个,甚至把几种意思混在一起。你不看回答,根本不知道它选了哪个。

模糊词会让数据不可靠。最麻烦的是,很多词在写的人眼里一点都不模糊,因为他知道自己的意思。

最典型的是缩写——尤其是 GEO。

你在出海营销语境里问:What are the best GEO platforms? 你知道 GEO 指 Generative Engine Optimization(生成式引擎优化)。AI 不一定知道。

没有上下文时,它可能先来一句「这取决于你说的 GEO 是什么」,然后把几种东西混进同一个答案:

  • 地理信息系统,比如地图、空间分析类工具;
  • 地热能、地理相关业务,完全不同的行业;
  • 生成式引擎优化工具,你真正想要的东西。

对国内团队来说,这个坑特别容易踩:中文里大家口头都说「做 GEO」,英文提示词里却只丢三个字母,海外引擎经常先往「地理」上理解。

解决办法很简单:第一次出现时把全称写出来。

写成 GEO (Generative Engine Optimization) tools 这一句话,就能把歧义消掉。如果你测的是外贸可见度,也可以直接写 AI brand visibility tools for exporters,少用容易撞车的缩写。

真实对话里,用户看到 AI 理解偏了还能补一句。提示词监测没有这个补救机会。AI 第一次读成什么,你收集到的就是什么。

所以要在写题时就消除歧义。目的不是引导答案,而是确保 AI 在正确理解意图后,你测到的才是它真实的判断。

问题不只在缩写。只要一个词在不同行业、不同产品品类里有不同意思,就会出现同样的情况。

比如:

  • What are the best CRO tools? 可以指转化率优化工具,也可以指首席营收官用的销售工具。
  • What are the best attribution platforms? 可以指营销归因,也可以指安全归因。
  • What is the best content management platform? 可以指网站 CMS、无头 CMS,也可以指数字资产管理(DAM)。

这些模糊问法会得到一锅「缝合怪」式的答案,因为 AI 把不同品类硬拼在了一起。

解决办法仍然是:把品类写到足够清楚,让 AI 没机会抓错。

在真实的 ChatGPT 对话里,AI 理解偏了,用户可以再解释。在监测里,没有第二轮。第一次解析错了,数据就错到底。如果一半时间都在测错品类,你的可见度数字自然也不可信。

检查回答形式是否匹配提示词类型

每种提示词都有预期返回形式。形式不对,哪怕回答看上去挺合理,也说明提示词跑偏了。

这和「模糊词」不是同一个问题。

模糊词让 AI 不知道你在问什么;形式不匹配,是 AI 听懂了问题,却把它当成另一类问题来回答。

常见情况有:

  • 发现型返回建议,而不是品牌:缺触发词。补上 software、tools、platforms、suppliers 或 brands,明确要求列产品。
  • 竞品型返回「看情况」:缺具体场景。补上一个必须做取舍的购买情境。
  • 验证型返回发现型名单:问法不够直接。改成针对具名品牌的是非题:Does [Brand] support X?
  • 情绪型返回品牌名单:它被理解成了发现型。改写为明确要求评价,并说明要讲优缺点。

检验方式和检查意图是否对齐一样:把几条提示词实际跑一遍,读回答。不要只看问题写得漂不漂亮。

这套工作放在哪里做

类型、要求和写法都有了,剩下的是一个执行问题:这套监测放在哪里跑?

有三条路可选。它们在投入、精度和覆盖范围上不一样,但本章的方法都能用。

用可见 GEO 这类监测工具跑

专门做 AI 可见度监测的工具,通常就是为这类场景设计的。

你定义属性,平台帮助生成英文提示词,包括前面说的各种变体;追踪、评分和报告会覆盖 ChatGPT、Gemini、Perplexity、Google AI Mode 等海外买家常用引擎。有的工具还能从属性出发自动生成不同问法,不需要你手写每一条,也能规模化运行。

这就是从策略进入执行的交接点。

自己搭一套

如果你有工程资源,或者团队里有人很会用自动化脚本,而且已经有一份属性清单,那么可以自己搭一套核心系统。

代价和所有「自建还是采购」的选择一样。

自建意味着路线图归你,但维护也归你。平台接口、模型更新,以及 ChatGPT 每次改动返回方式后产生的边缘情况,都要自己处理。对大多数外贸团队来说,这条路并不现实。

手动跑

你也可以直接在 ChatGPT、Gemini、Perplexity 或其他目标平台上用英文问,然后把结果记进表格。

这种方式很费人力,但没有技术门槛,至少可以起步。一个团队哪怕只手动追踪二十条英文提示词,连续做两周,也会比那些一上来就买平台、却完全没建立基础认知的团队更懂 AI 如何描述自己的品牌。

限制也很明显:无法规模化;没有大量人工汇总,看不出每天的趋势;如果不够自律,不能每次都把每条提示词跑遍所有平台,就会漏掉引擎差异。

但如果团队只是想先建立直觉,再决定要不要上监测工具,手动跑是最便宜的观察方式。

下一步,开始审计

看完这一章,很容易马上想启动追踪。先停一下。

你现在完成的是必要准备:一套守得住的品牌身份,一份来自真实海外买家的属性清单,六类各司其职的英文提示词,以及每个属性下足够的覆盖度,避免一句问法把整体判断带偏。

提示词是一副眼镜。下一章才真正戴上它:跑首次 GEO 报告 / 基线监测,看 AI 正在怎么说你,再找出最该优先处理的问题。

刚开始时,团队应该像第一次接触大语言模型、完全没有背景的海外买家一样提问,看看模型会吐出什么。这个方法很基础,但很多人会跳过,而结果往往很有启发。也可以先做两件冷启动检查:一是在不提供公司背景的情况下检查英文站,看内容离开 JavaScript 后还能不能读、有没有拦住常见模型爬虫、页面有没有清晰标题和足够正文;二是用同样的冷启动方式同时看你和竞品,比较双方的定位、表达和证据在模型眼里有什么差别。