GEO 不是玄学,但现在还早:AI 搜索时代「被引用优化」的全景、工具盘点与落地打法

一句话先把结论甩出来:GEO 是真趋势,不是玄学,但现在还早、不稳、被严重神化。 这个领域今年最值钱的一句认知升级是——你要优化的不是「让大模型记住你」,而是「AI 联网搜索时会不会引用你」。这把战场从「参数化知名度」挪到了「实时检索 + citation」,也顺手划出了一条机会缝隙:国外引擎一堆现成工具能拼,国内引擎的引用监测基本是空白。

最近把 GEO(Generative Engine Optimization)这个话题彻底翻了一遍:看了 10 个 GitHub 开源项目、几篇顶会论文,又和一群同样在啃这件事的人来回对线。这篇是嚼过的判断,不是 README 的搬运。

如果你也在纠结「要不要现在投钱做 GEO」「市面那些工具哪个能用」「自己机构该不该买这服务」,这一篇够你少踩半年坑。


一、GEO 到底是什么,跟 SEO 的本质区别在哪

三个词别再混着用

  • SEO:优化你在百度 / Google 的「蓝色链接列表」排名,用户自己点进来
  • GEO / AEO(Generative / Answer Engine Optimization):优化让 AI 在生成答案时主动引用、提及、推荐你。用户看 AI 直接给的结论,链接都不点了。
  • AEO 侧重「被当成那条答案」,GEO 侧重「在生成式引擎里整体可见」。业内俩词混用,别在名词上较劲。

今年最值钱的一句纠正:别测错对象

做 GEO 监测时,有两个完全不同的东西,绝大多数人一上来就测错了:

❌ 直接问 LLM「这个行业排名前十是谁」—— 你测的是模型训练数据里的知名度(参数化知识),这是已经固化在权重里的旧账。

✅ 测 agent 联网搜索的引用效果 —— 模型 + 联网搜索 → 实时抓网页 → 在答案里给出 citation / sources。GEO 优化真正的战场在这里。

为什么这个区分这么关键?因为只有「实时检索层」是你今天写的内容能影响的;训练知识那一层,等模型下次训练才轮得到你,等不起也使不上劲。

这也解释了 GEO 跟 SEO 「既像又不像」:

  • 交集:都要让爬虫抓得到、内容要权威、要被多源提及(agent 联网搜索很多时候就是去抓「搜索排名高 + 权威」的网页)。
  • 本质不同:SEO 终点是「排名 → 被点击」;GEO 终点是「被写进那段 AI 答案 + 被列为 citation」。优化对象从「页面排名信号」变成了「可被检索切片、可被引用的结构化事实」。

所以那句老掉牙的「GEO 约等于 SEO 的延伸」只对了一半:技术地基同源,但目标函数变了

成熟度现状:有效,但有限、不稳、被神化

  • 有效但有限:普林斯顿的 GEO 论文(KDD 2024, arXiv 2311.09735)实测 9 种手法能把 AI 答案里的可见度提升 30–40%,其中 Cite Sources(+115%)、Statistics(+40%)最猛。这是目前最硬的学术证据。
  • 但同行在打架:C-SEO Bench(NeurIPS 2025)结论几乎相反——多数内容操纵手法基本无效,基础设施才最重要。AutoGEO(ICLR 2026)又证明「自动提取规则 + 重写」能在普林斯顿 baseline 上再 +50.99%。
  • 黑盒 + 概率游戏:AI 到底引谁是黑盒,同一个问题换个措辞、换个引擎,答案都不一样;引用来源每月变动 40–60%(这个月引你,下个月可能就不引了)。

没人能保证「稳定推荐你」。谁敢拍这个胸脯,谁就是在卖你东西。


二、工具全景:测评 / 优化 / 监测,哪个值得用

下面这些项目我一个个看透了,按「拿来真能干活」的角度分档,不按 star 数排

出客户诊断报告 → 首选 geo-seo-claude

  • zubair-trabzada/geo-seo-claude(约 8200 ⭐ / 1300+ fork,MIT)。
  • 形态:Claude Code skill,13 个子 skill + 5 个并行 subagent。命令覆盖 audit / quick / citability / crawlers / llmstxt / schema / report-pdf 等。
  • 评分 6 维:AI 可引用性 25% / 品牌权威 20% / 内容 E-E-A-T 20% / 技术 15% / 结构化数据 10% / 平台优化 10%。
  • 亮点:citability 打分(最佳被引段落 134–167 词、自包含、事实密集);查 robots.txt 对 14+ AI 爬虫的放行;还有一个反直觉的数据——品牌提及与 AI 可见度的相关性,是外链的 3 倍;一键出客户级 PDF 报告(含评分仪表盘)。

判断:要做 GEO 服务、给客户出诊断 + 交付物,这是最顺手的一个,装上就能跑。短板:它判断「是否被引用」主要靠分析网站自身信号 + 品牌提及扫描,并不是真去每个引擎问一遍——真查引用还得配监测工具。

要自动化 / 真查引用 / 接 CI → geo-optimizer-skill(工程最硬)

  • Auriti-Labs/geo-optimizer-skill(约 480 ⭐,MIT)。CLI + Python 库 + MCP server + Astro 集成,四种用法。
  • 命令:audit / citations / fix / llms / schema / track / drift / authority / coherence。8 个评分类别、47 条研究背书的方法、1720 个测试、7 种输出格式(含 SARIF / JUnit 直接进 CI)。
  • 关键能力geo citations --brand --domain(自带 key,Perplexity Sonar 返回真实 source URL)——这是少数「真去引擎问 + 抓引用」的开源命令。还能 --save-history --regression,像测试覆盖率一样卡部署门槛。
  • 学术根基最扎实,作者明确站队「技术基础设施 > 内容重写」:爬虫抓不到、解析不了,文案优化得再花哨也白搭。

判断:要做「能跑脚本、能自动监测、能接 MCP 让 agent 直接调」的底层引擎,选它。和 geo-seo-claude 互补——那个出报告漂亮,这个工程化能落地。

批量造内容 → gtm-engineer-skills

  • onvoyage-ai/gtm-engineer-skills(约 1200 ⭐,MIT)。12 个 skill 串成一条 GTM 流水线:research-brand → keywords → geo-content-research → planning → write-seo-geo-content → create-geo-charts → audit-content → build-resource-pages → improve-aeo-geo
  • 每个 skill 的产出喂给下一个;含一个零依赖的 Node AEO crawler(16 项检查);Codex 和 Claude Code 都支持。

判断:偏「批量造 GEO 友好内容 + 站点级修复」的流水线,真接单后给客户批量写 / 改内容时用,比 geo-seo-claude 更偏「内容侧」。

监测平台的三个梯度

项目定位值得抄的点短板
AWS llm-search-citation-analysis(Bedrock 方案)企业级监测参考架构share-of-voice、citation gap 分析(谁引了竞品没引你 = 你的 PR 靶子)、persona 模板重、贵($85–126/月)、只覆盖 4 个国外引擎,当蓝图别当工具
Viabled-Edge/ai-citation-agent方法论最清晰29 个 trust node 覆盖度(Wikipedia/G2/TechCrunch/Crunchbase…)+ citation 5 维打分(Authority/Data Structure/Brand Alignment/Freshness/Cross-Link)依赖 Airtable + 浏览器自动化,重,只 3 个国外引擎
X-RayLuan/ai-search-rank-tracker最轻量起步脚手架「输入品牌 + prompt → 跑多引擎 → 出可见度分」的骨架,json/md/csv 输出偏 demo 级

其中「trust node 覆盖度」这个框架特别适合做客户诊断——直观告诉客户「你在哪些权威源里缺席」。

学术前沿 → AutoGEO(是方法论,不是工具)

  • cxcscmu/AutoGEO(ICLR 2026,CMU)。自动从生成引擎里挖「内容偏好规则」→ 重写文档,在最大化可见度的同时保住准确性(用 GEO score 测可见度、GEU score 测效用两个指标)。

判断:直接用门槛高(要 GPU、要按引擎重新提规则)。它真正的价值是思路——别靠人猜手法,让 AI 自动从引擎反应里提规则再重写。做优化时可以借这个闭环:测 → 提规则 → 改 → 复测。

资源索引 → awesome-generative-engine-optimization

13 大类清单,国外成熟监测平台一抓一大把:Profound(企业级)、Otterly.AI、Peec.ai、AthenaHQ(YC 投)、Ahrefs Brand Radar、SEMrush AI Visibility Toolkit、HubSpot AI Search Grader(免费)。

顺手沉淀几个值得记的数据:

  • Wikipedia 占 ChatGPT 引用的 47.9%(Profound);
  • ChatGPT 占 AI 转介流量的 87.4%(Conductor,统计 13770 个域名);
  • AI 流量 2025 年涨了 527%
  • AI Overview 覆盖 52% 的搜索、让点击量减少 34.5%。

还有两个被频繁漏掉但值得知道的

  • aaron-he-zhu/seo-geo-claude-skills(约 2100 ⭐)—— 20 个 skill,CORE-EEAT + CITE 框架,支持 35+ AI agent,做选型时该一起比。
  • liangdabiao/GEO-Content-Optimizer-Skill(约 60 ⭐)—— 中文人做的中文 GEO 内容优化 skill,国内场景下值得先看它的中文化思路。

一句话能力边界(最重要的判断)

几乎所有「真查引用」的现成工具,引擎覆盖都只到国外那 4–5 个(ChatGPT / Claude / Perplexity / Gemini,偶尔 Grok),靠 Perplexity API 或浏览器自动化实现。国内主流引擎(Kimi / 文心 / 通义 / 元宝 / DeepSeek 联网等)的引用监测,开源世界基本是空白。

这就是「国内是机会窗口」这句话的技术依据,不是拍脑袋喊出来的。


三、可落地打法:从测到优化到监测的闭环

不管你是给自己的业务做 GEO,还是想对外接 GEO 的活,地基是同一套:测 → 优化 → 监测的闭环

监测方案(按「测 agent 搜索」的正确口径)

  • 国外引擎:ChatGPT Search、Claude Web Search、Perplexity、Google AI Overview / Gemini、Grok Live Search → 直接拼现成工具:用 geo-optimizer-skillgeo citations(Perplexity 真引用最稳)+ ai-citation-agent(trust node 诊断),必要时上 Profound / Otterly。
  • 国内引擎:没现成的,得自己做。方法是对每个引擎问标准问题 → 抓答案里的 citation / sources → 算「引用率 + 引用位置 + 引用上下文质量」。

⚠️ 坑:国内这些引擎大多没开放「搜索 + 引用」的 API,得爬公开页或复用已登录会话,稳定性大概 80%、DOM 一周一变。这是国内监测绕不开的脏活成本,别低估。机会大,但工程量也大。

优化方案(技术 infra 优先,和学术结论对齐)

顺序按「性价比 + 有效性」排(C-SEO Bench 已经证明:刷内容没用,infra 才行):

  1. 打技术地基:robots.txt 放行 AI 爬虫(GPTBot / ClaudeBot / PerplexityBot…)、生成 llms.txt、补 JSON-LD schema(LocalBusiness / Organization / FAQ)。一个反直觉的数据:schema 能把 LLM 的抽取准确率从 16% 拉到 54%
  2. 做可被引用的结构化事实:问答体 + 列表 + 表格 + 分级标题;段落控制在 134–167 词、自包含、带真实数字和出处。
  3. 争取被权威多源提及(最值钱):进 trust node(知乎 / 百家号 / 公众号 / 小红书 + 行业盘点目录),争取行业号、本地媒体写到你。国内不同引擎口味还不一样——文心偏百度系、通义偏阿里系、Kimi / DeepSeek 偏知乎类深度长文、豆包偏短平快。
  4. 定期复测:每月跑一遍监测看引用率变化(引用每月变 40–60%,必须持续盯)。

一个真实场景:给本地线下机构做 GEO

拿一个本地教培 / 线下服务机构举例,这是最典型的「该不该现在做」纠结场景:

  • 定位:低成本卡位、赌 1–2 年的红利,别指望它当下成为获客主力。国内「用 AI 找本地 / 培训机构」的占比,大概率还很低,主力仍是同城短视频、小红书、转介绍。
  • 打法:把「机构全名 + 地名 + 资质 + 课程 + 价格区间 + FAQ」做成 AI 能直接抄的事实页 + Schema;名称带地理词;在知乎 / 小红书 / 公众号铺 2–3 篇高质量结构化内容(少而真,绝不铺量伪原创);攒真实学员好评、争取本地号提及。
  • 附加值:做 GEO 基础的过程,顺手就把口碑和信息资产也做了,这钱不算白花。

四、关于「GEO 服务」这门生意的商业逻辑

如果你想的不是给自己做,而是对外接 GEO 服务,这里讲讲行业里普遍的形态,不针对任何具体玩家。

通用的服务三段式

市面上 GEO 服务基本是这么个结构:诊断 → 优化执行 → 持续监测

  • 诊断:跑一遍工具,给客户一份量化报告(你现在被引用 D 还是 F 评级),制造「量化焦虑」——这是成交的起点。
  • 优化执行:按上面那套 infra 优先的顺序,帮客户改技术地基、写结构化内容、铺权威源。
  • 持续监测:因为引用每月变 40–60%,监测天然是个订阅制的活,也是服务商最稳的现金流。

一个聪明的背书手法:dogfooding

服务商最强的活案例,是让自己的官网先被 AI 收录、提引用排名——「我连自己都做上去了」比任何 PPT 都有说服力。这种「拿自己练手、再把结果当案例」的打法(dogfooding),在早期市场尤其好用。

产品的演化路径

常见的路径是「文档 + skills 起步 → 沉淀成一个 plugin」:plugin 作为对外交付物,内含若干 skill,每个 skill 内部再调动多 agent 编排去干活。先把流程跑通、再固化成可复用产品,比一上来就憋大平台靠谱。

demo 的现实门槛

市面上大量 GEO demo 其实是 mock 数据版——UI、评分、CTA 都跑通了,但接真实查询还差两步:① 稳定的 AI key(成本和限流)② 缓存控成本。而且后端逻辑必须按前面那句纠正来:测 11 个引擎的 agent 搜索引用,而不是直接问 LLM 知名度。这一步偷懒,整个 demo 的数据就是假的。


五、关键洞见 + 红线(这部分最该收藏)

1. 最大的认知升级:GEO 的战场是「agent 联网搜索的 citation 层」,不是「大模型的训练知识」。监测必须测「联网搜索会不会引用你」,测错对象 = 全白做。

2. 学术两派要会用:普林斯顿说「40% 有效」,C-SEO Bench 说「多数手法无效」——真相是:内容层的小聪明(堆词、伪原创)刷不动,技术基础设施(可抓取 / 结构化 / 被多源真实引用)才是硬通货

3. 国内引擎空白是真机会,也是真脏活:机会窗口确实在(国外有 Profound 们、国内没人做监测),但国内引擎无开放 API、靠爬 / 会话复用、稳定性 80%、DOM 频繁变。机会大小约等于工程脏活量,别被「窗口期」三个字冲昏头。

4. 315 / 合规红线,必须守:GEO 行业的造假有三类——① 脚本批量给 LLM 投喂虚假内容刷引用;② 虚构案例骗中小企业(张口就「AI 排名第一」却拿不出数据);③ 工具报告里 fake 引用次数。做 demo 和案例必须用真实数据,否则客户拿录屏反手就能告你。

最妙的地方在于:红线和有效性是一致的。 C-SEO Bench 已经证明刷的根本没用,所以「别刷、做真的」既合规又有效——这反而是最强的卖点。

5. 工具选型一句话:出报告用 geo-seo-claude,自动化 / 监测 / 接 MCP 用 geo-optimizer-skill,批量内容用 gtm-engineer-skills,监测架构抄 AWS 方案的 citation-gap + persona,trust-node 诊断框架学 ai-citation-agent,demo 骨架仿 ai-search-rank-tracker,方法论闭环借 AutoGEO。别从零造轮子。

6. 甲方乙方两份认知要连起来:站在甲方视角(该不该买 GEO 服务),现在的答案多半是「先别花大钱、自己做好基础」;站在乙方视角(当服务商),机会恰恰在于——正因为市面服务大量在割韭菜,用「真实数据 + 国内引擎覆盖 + 透明报价 + 不保证收录」做差异化,正好能接住那些被坑怕了的客户。 两个视角不矛盾,是一枚硬币的两面。


附:信息可信度自查

  • 工具数据:上文的 star / fork 数均经 GitHub 核对(写作时点,会随时间变动)。
  • 学术来源:普林斯顿 KDD 2024(arXiv 2311.09735)、AutoGEO ICLR 2026(arXiv 2510.11438)、C-SEO Bench(arXiv 2506.11097)。
  • 需持续核实:国内引擎的引用抓取稳定性、各引擎是否开放 API(随时变);GEO demo 接真实 API 后的成本曲线。

GEO 这件事,结论摆这儿:值得现在就动手打基础,但别信任何「保证上 AI 第一」的承诺,也别指望它明天就给你带客户。 早期市场里,能活下来的往往不是喊得最响的,而是把脏活干扎实、把数据做真的那一拨。