GEO挖词终极融合方案
000
画布
|大纲
内容详情
认知前提(方案核心根基)
GEO与SEO挖词差异
- SEO挖词特征
- 核心挖取名词类词汇(用户主动搜索产品名)
- 示例:"CRM系统"、"护肤品推荐"特点:传统关键词工具可查搜索量
- 特点:传统关键词工具可查搜索量
- 示例:"CRM系统"、"护肤品推荐"特点:传统关键词工具可查搜索量
- 核心挖取名词类词汇(用户主动搜索产品名)
- GEO挖词特征
- 核心挖取场景化Prompt(用户对AI的自然提问)
- 示例:"10人小团队防飞单的合规便宜软件"特点:传统工具搜索量为0,命中后转化率极高
- 特点:传统工具搜索量为0,命中后转化率极高
- 示例:"10人小团队防飞单的合规便宜软件"特点:传统工具搜索量为0,命中后转化率极高
- 核心挖取场景化Prompt(用户对AI的自然提问)
GEO词库核心定位
- 词库本质是"用户焦虑+场景+诉求"的自然语料
- 价值:精准匹配AI回答逻辑,用户认可度高
词库三层结构(DS贡献)
L1产品词
- 定义:用户直接搜索的产品/服务名
- 示例:"CRM软件"、"AI写作工具"
- 价值:流量大但竞争激烈,做基础流量覆盖
- 示例:"CRM软件"、"AI写作工具"
L2场景词
- 定义:用户描述需求的自然语言
- 示例:"销售团队管理客户跟进用什么软件"
- 价值:GEO核心战场,传统工具无法挖掘
- 示例:"销售团队管理客户跟进用什么软件"
L3竞品词
- 定义:用户做品牌对比时的搜索词
- 示例:"XX和YY哪个好用"
- 价值:截流竞品用户,转化率极高
- 示例:"XX和YY哪个好用"
四路采集路径总览(豆包框架)
路径A:采购现成商用词库
- 通用词库(基础盘)
- 5118(全模型首推)
- 覆盖平台:百度、搜狗、抖音、小红书等全渠道
- 必买接口:用户需求图谱API、高频疑问词挖掘、行业长尾词包
- 费用:888-2999元/年,企业级API单独议价
- 词查查
- 特点:亿级长尾词,支持按省市筛选本地化GEO词
- 适用场景:本地服务类GEO内容布局
- 优采云(豆包独家推荐)
- 特点:1.3亿全网沉淀词,自带实时飙升热词与聚类工具
- 优势:导出后可直接入库,无需二次清洗
- 5118(全模型首推)
- 垂直电商词库(消费品类必买)
- 蝉妈妈
- 数据内容:抖音+小红书搜索词、商品词
- 费用:1800-5800元/月
- 飞瓜数据
- 数据内容:抖音/B站关键词、视频标签
- 费用:2000-8000元/月
- 千瓜数据
- 数据内容:小红书专项词云、笔记数据
- 费用:1980-4980元/月
- 魔镜市场情报
- 数据内容:淘宝/天猫/京东搜索词、对应销量
- 费用:5800-12000元/月
- 蝉妈妈
路径B:第三方API持续增量
- 主力对接API清单
- 5118需求图谱API
- 功能:返回种子词的搜前/搜后关联词链
- 5118高频疑问词API
- 功能:批量获取"怎么/如何/哪个好"类疑问句式
- 词查查本地词API
- 功能:获取分区域本地化GEO词
- 凯迪拓词API
- 功能:单接口聚合百度/抖音/小红书/淘宝多平台词
- 5118需求图谱API
- 微信指数接入(Gemini独家方法)
- 购买路线
- 渠道:GitHub、技术论坛第三方封装API
- 计费模式:包月/按调用点数计费
- 自建路线
- 方案一:Windows微信客户端Hook抓包
- 方案二:安卓模拟器+Appium+Charles抓包
- 价值:反映公众号生态真实流量,补充其他平台数据
- 购买路线
路径C:自研爬虫(长期成本最低)
- 搜索引擎下拉词模块
- 支持平台:百度、搜狗、360、神马、微信搜一搜
- 采集策略:种子词→下拉词→加字母前缀递归采集
- 深度:3层递归,单品类出词10-50万
- 小红书采集模块(Gemini系统方法)
- 下拉词死循环拓展
- 实现:调用小红书Suggest接口,种子词加"怎么/避坑/推荐"前缀
- 配套:亮数据住宅IP代理,降低反爬拦截概率
- 评论区痛点提取
- 方法:爬取行业Top100爆款笔记评论区
- 价值:获取用户口语化诉求,直接匹配AI提问场景
- 下拉词死循环拓展
- 知乎问题树采集
- 实现:按话题ID采集全量历史问题标题
- 筛选逻辑:关注人数多+回答数少=GEO空白市场
- 优势:知乎反爬强度低,高权重语料易获取
- 抖音热榜+搜索词采集
- 热榜采集:每15分钟同步抖音热榜,留存历史数据
- 搜索词采集:mitmproxy抓包APP获取Suggest接口
- 补充:按品类批量采集视频标题、话题标签
- 电商平台采集
- 支持平台:淘宝、1688、拼多多搜索Suggest接口
- 补充工具:淘宝直通车关键词规划师获取真实搜索量
- 特点:商业意图最强,转化率高于其他平台词
- 爬虫基础架构
- 调度层:Celery+Redis,支持优先级队列与平台独立限速
- 采集层:Requests池+Playwright集群+Appium适配多场景
- 代理层:亮数据+快代理+芝麻代理,分平台适配
- 存储层:ClickHouse存海量原始词,ES做语义检索聚类
路径D:GEO专属方法(差异化核心)
- D1 AI审讯室(大模型相关追问扒取)
- 原理:抓取大模型回答后底部"相关追问"词
- 支持平台:秘塔AI、Kimi、豆包、文心一言、DeepSeek
- 产出:100个种子词可产出2500条黄金GEO词
- 标记:最高权重标记,命中AI算法推荐语义
- D2 Citation截胡法(千问独家创意)
- 原理:提取大模型回答引用的URL,分析内容共性
- 流程:批量提问→提取引用URL→爬取全文→Claude分析
- 双重产出:AI偏好词库+AI高引用内容模板
- 价值:大幅提升内容被AI引用的概率
- D3 实体漏报率测试(Gemini独创)
- 原理:测试AI在相关提问中是否提及自有品牌
- 触发逻辑:回答无自有品牌则标记为P0优先级词
- 价值:主动发现GEO空白,快速补全布局
- D4 焦虑词生成器(千问独创)
- 原理:模拟用户极度焦虑时的AI提问场景
- 生成规则:痛苦场景+解决方案+时间紧迫感,口语化表达
- 产出:100个行业词可生成5000条高转化专属词
- 特点:传统工具无搜索量,转化率远高于普通词
- D5 社区真实Prompt扒皮(千问独创)
- 采集渠道:知乎、小红书、V2EX、掘金AI相关内容
- 流程:爬取用户晒出的AI提问截图/文本→Claude提纯
- 价值:获取最真实的用户AI提问句式
统一后置处理流水线
去重环节
- 精确去重:BloomFilter实现亿级去重,内存占用低
- 语义去重:Sentence-BERT合并语义相近的提问句式
过滤分类环节
- 质量过滤:去除单字、纯数字、乱码、无商业意图词
- 意图分类(DS框架)
- 了解型:"XX是什么"类基础认知提问
- 评估型:"XX好不好用""XX和XX哪个好"类对比提问
- 决策型:"XX在哪买""XX怎么开通"类转化提问
GEO专项打标
- 标记维度:AI引用频率分、AI追问词标记、实体漏报词标记、平台覆盖数
分层存储
- PostgreSQL:结构化词库,支持日常主查询
- ClickHouse:万亿级原始词存档,低成本存储
- Elasticsearch:支持语义搜索与词聚类分析
GEO综合评分模型
传统SEO维度(40%权重)
- 百度指数(15%):匹配公域搜索热度
- 平台覆盖数(10%):多平台出现的词通用性更强
- 竞争度反转(15%):竞争度越低得分越高
GEO专属维度(60%权重,核心差异化)
- AI引用频率(25%):被AI引用越多得分越高
- AI追问词标记(20%):来自AI推荐追问的词加权
- 实体漏报标记(15%):P0空白词最高优先级加权
MVP执行路线图
第一阶段:快速建库(第1-2周)
- 采购5118词库包+API开通(运营负责)
- 产出:基础词库100万+
- 百度/搜狗/360 Suggest递归爬虫开发(后端负责)
- 产出:新增50万词
- 知乎话题问题批量采集(后端负责)
- 产出:高质量场景词10万
- 焦虑词生成器首批运行(AI负责)
- 产出:GEO专属词5000条
第二阶段:社交平台+GEO专属(第3-4周)
- 小红书下拉爆破+评论区痛点采集(后端负责)
- 产出:口语化长尾词20万
- AI审讯室功能上线(后端负责)
- 产出:AI追问词2500条
- Citation截胡法首次运行(全栈负责)
- 产出:被引内容结构模板+专属词库
- 实体漏报率批量测试(后端负责)
- 产出:P0空白词清单
第三阶段:自动化+持续运营(第5-8周)
- 微信指数监控接入(后端负责)
- 产出:微信生态词补全
- 抖音/快手热榜自动采集(后端负责)
- 产出:实时热点词更新
- GEO综合评分模型上线(后端负责)
- 产出:全词库打分排序
- 内容生产系统对接词库(全栈负责)
- 产出:词库直接驱动内容选题
大模型独家贡献对照
千问贡献
- 核心内容:Citation截胡法+焦虑词生成器+社区Prompt扒皮
- 价值:从AI引用反推逻辑,最接近GEO本质
Gemini贡献
- 核心内容:实体漏报率测试+微信指数Hook+小红书评论策略
- 价值:主动发现GEO盲区,针对性强于被动挖词
豆包贡献
- 核心内容:优采云词库+四路体系架构+后置清洗流水线
- 价值:工程化最完整,冷启动速度最快
DS贡献
- 核心内容:三层词库分类框架+意图分类体系
- 价值:词库组织清晰,对接内容生产效率最高
