GEO关键词采集系统

AAI脑图#3620902026-07-24 08:10
000

内容详情

核心认知(GEO与SEO挖词区别)

GEO挖词本质

  • 采集目标
    • 场景化Prompt(用户向大模型的自然提问)
      • 示例:10人小团队求合规便宜的销售微信监控软件符合用户大模型提问的真实表达逻辑
        • 符合用户大模型提问的真实表达逻辑
  • GEO词特征
    • 自然语言完整问句
      • 非碎片化名词,是完整的用户诉求表达
    • 带有场景、痛点、情绪
      • 包含用户所处情境、核心需求与情绪倾向
    • AI会直接引用回答
      • 是大模型生成回答时优先匹配的内容依据

词库三层架构

  • L1 产品词
    • 核心名词类
      • 示例:论文降重、CRM系统为上层场景词、对比词提供核心锚点
        • 为上层场景词、对比词提供核心锚点
  • L2 场景词
    • 痛点+诉求组合
      • 示例:10人小团队怎么管销售对应具体用户场景下的真实需求
        • 对应具体用户场景下的真实需求
  • L3 对比词
    • 竞品比较类
      • 示例:早标网和PaperPass哪个好是用户决策阶段的高频提问类型
        • 是用户决策阶段的高频提问类型

采集渠道矩阵

搜索引擎层(打底词库)

  • 覆盖平台
    • 百度
      • 采集点
        • Suggest下拉框、相关搜索、百度指数、SEM关键词规划师数据类型为SEO长尾词、需求词,API/爬虫实现
          • 数据类型为SEO长尾词、需求词,API/爬虫实现
      • 核心接口
        • Suggest接口:https://suggestion.baidu.com/su?wd=关键词&cb=window.bdsug.sug&ie=utf-8免费递归挖词,每个种子词递归3-4层可出10万+词配合wd=关键词+a/b/c穷举字母后缀,同一IP每秒请求≤3次
          • 免费递归挖词,每个种子词递归3-4层可出10万+词
          • 配合wd=关键词+a/b/c穷举字母后缀,同一IP每秒请求≤3次
        • 百度指数API:https://index.baidu.com/api/SearchApi/index?word=关键词&area=0需Cookie模拟,返回PC+移动端搜索指数、需求图谱
          • 需Cookie模拟,返回PC+移动端搜索指数、需求图谱
        • SEM关键词规划师:https://e.baidu.com/tool/keywordplanner需百度推广账户,可拿月搜索量、竞争度、出价参考
          • 需百度推广账户,可拿月搜索量、竞争度、出价参考
    • 搜狗
      • 采集点
        • Suggest接口采集微信文章来源词,爬虫实现
          • 采集微信文章来源词,爬虫实现
    • 360搜索
      • 采集点
        • Suggest接口采集通用长尾词,爬虫实现
          • 采集通用长尾词,爬虫实现
    • 神马搜索
      • 采集点
        • 移动端搜索词采集移动长尾词,爬虫实现
          • 采集移动长尾词,爬虫实现
    • 微信搜一搜
      • 采集点
        • 公众号/小程序词采集B端服务词,Playwright模拟实现
          • 采集B端服务词,Playwright模拟实现

社交平台层(口语化长尾词核心)

  • 平台价值
    • 匹配用户大模型提问逻辑
      • 用户在社交平台的提问方式与AI提问一致
  • 覆盖平台
    • 小红书
      • 采集点
        • 搜索联想、笔记标题、话题标签、评论区、热搜榜采集生活/消费长尾词,Playwright+登录态实现
          • 采集生活/消费长尾词,Playwright+登录态实现
      • 核心接口
        • https://www.xiaohongshu.com/search_keyword/get_sug?keyword=xxx可抓前20页笔记标题,评论区提取“求链接”等口语化词
          • 可抓前20页笔记标题,评论区提取“求链接”等口语化词
    • 抖音
      • 采集点
        • 搜索联想、视频标题、话题标签、热榜采集泛人群热词,抓包/API实现
          • 采集泛人群热词,抓包/API实现
      • 核心接口
        • Suggest接口:https://www.douyin.com/aweme/v1/suggest/需mitmproxy/Charles抓包,登录态调用更稳定
          • 需mitmproxy/Charles抓包,登录态调用更稳定
        • 热榜接口:https://www.douyin.com/hot,每15分钟刷新
    • 知乎
      • 采集点
        • 问题标题、话题下问题列表、热榜采集高价值问答词,官方API实现
          • 采集高价值问答词,官方API实现
      • 核心接口
        • https://www.zhihu.com/api/v4/search_v3?t=question&q=关键词&offset=0&limit=20问题标题直接对应真实用户长尾提问
          • 问题标题直接对应真实用户长尾提问
    • B站
      • 采集点
        • 搜索联想、视频标题、热门话题采集年轻用户词,Suggest接口实现
          • 采集年轻用户词,Suggest接口实现
    • 微博
      • 采集点
        • 热搜榜、话题超话采集实时热点词,公开API实现
          • 采集实时热点词,公开API实现
  • 开源爬虫方案
    • MediaCrawler(GitHub 53K Star)
      • 支持7大主流社交平台,基于Playwright无需JS逆向
    • creatorhub
      • 纯Python+Playwright,Web面板管理多平台采集

AI搜索引擎层(差异化核心数据)

  • 平台价值
    • 反向采集AI原生数据,竞品无同类来源
  • 覆盖平台
    • Kimi、豆包、DeepSeek、秘塔AI
      • 采集方式
        • Playwright模拟采集相关追问列表、引用来源、回答高频词
          • 采集相关追问列表、引用来源、回答高频词
    • 文心一言、通义千问
      • 采集方式
        • 官方API(有免费额度)采集回答中的品牌词、功能词、比较词
          • 采集回答中的品牌词、功能词、比较词
  • 核心玩法
    • 相关追问逆向采集
      • 向AI提问行业核心词,抓取底部3-5个相关追问为AI算法推荐的高权重长尾词,GEO权重极高
        • 为AI算法推荐的高权重长尾词,GEO权重极高
    • 实体漏报率探测
      • 脚本让AI对比自有产品与竞品,识别未收录的提问句式归类为高危待补词,送入内容工厂饱和覆盖
        • 归类为高危待补词,送入内容工厂饱和覆盖

电商平台层(高商业意图词)

  • 覆盖平台
    • 淘宝/天猫
      • 采集点
        • 搜索联想、直通车关键词、生意参谋接口:https://suggest.taobao.com/sug
          • 接口:https://suggest.taobao.com/sug
      • 直通车工具
        • 入口:https://subway.simba.taobao.com,需卖家账号可拿月搜索量、点击率、转化率、竞争指数
          • 可拿月搜索量、点击率、转化率、竞争指数
    • 京东
      • 采集点
        • 搜索联想接口:https://fts.jd.com/suggest/psugg.action
          • 接口:https://fts.jd.com/suggest/psugg.action
    • 拼多多
      • 采集点
        • 搜索联想接口:https://apiv4.yangkeduo.com/search/searchSugV2
          • 接口:https://apiv4.yangkeduo.com/search/searchSugV2
    • 1688
      • 采集点
        • B2B采购词接口:https://suggest.1688.com/sug
          • 接口:https://suggest.1688.com/sug

落地技术栈与架构

推荐技术栈

  • 数据源层
    • 5118 API(商用词库打底)
    • 百度/搜狗/360 Suggest(免费接口)
    • Playwright集群(社交/AI搜索采集)
    • 第三方API(蝉妈妈/飞瓜/千瓜)
    • 开源爬虫(MediaCrawler等)
  • 调度层
    • Celery + Redis
      • 分布式任务队列,控制并发防封禁
  • 采集层
    • Requests池(API接口类采集)
    • Playwright集群(需JS渲染的平台)
    • 代理池(住宅代理,防IP封禁)
  • 清洗层
    • 精确去重:BloomFilter(亿级词量内存高效)
    • 语义去重:text2vec + 余弦相似度
    • 噪声过滤:过滤纯数字/乱码/过短词
    • 意图分类:信息词/导航词/商业词/交易词
  • 存储层
    • PostgreSQL:存储结构化词库
    • Elasticsearch:支持全文检索+聚类
    • Redis:热词缓存+实时榜单

第三方工具与API采购清单

商用词库平台(快速打底)

  • 5118
    • 核心价值:全网20亿+关键词,含需求图谱、长尾挖掘
    • 价格:VIP¥280/年、SVIP¥629/年、专业版¥1359/年
    • 推荐度:⭐⭐⭐⭐⭐
    • 核心接口:用户需求图谱API、高频疑问词挖掘API
  • 爱站网
    • 核心价值:竞品排名关键词、外链、流量估算
    • 价格:¥280-¥880/年
    • 推荐度:⭐⭐⭐⭐
  • 词查查
    • 核心价值:亿级长尾词,支持城市/地域筛选
    • 价格:企业版按月更新
    • 推荐度:⭐⭐⭐⭐

社交/短视频数据平台

  • 蝉妈妈
    • 覆盖平台:抖音+小红书
    • 价格:¥1800-¥5800/月
  • 飞瓜数据
    • 覆盖平台:抖音/B站
    • 价格:¥2000-¥8000/月
  • 千瓜数据
    • 覆盖平台:小红书专项
    • 价格:¥1980-¥4980/月
  • 新榜
    • 覆盖平台:公众号
    • 价格:按需购买

浏览器采集插件(运营拓词)

  • 松鼠数据-关键词采集助手
    • 功能:自动采集小红书、抖音下拉词,一键导出Excel
    • 获取方式:Chrome应用商店
  • 下拉框关键词采集大师
    • 功能:递归抓取搜索下拉框,最多3层
    • 获取方式:Firefox扩展
  • 简兮下拉词采集器
    • 功能:覆盖多平台下拉词,一次性买断
    • 获取方式:Windows软件
  • Crx搜搜下拉采集大师
    • 功能:支持多平台页面一键递归抓取
    • 获取方式:Chrome应用商店

开源爬虫框架(自建首选)

  • MediaCrawler
    • 覆盖平台:小红书、抖音等7大平台
    • 技术栈:Playwright
    • Stars:53K
  • creatorhub
    • 覆盖平台:抖音、小红书、快手
    • 技术栈:Python+Playwright
  • XhsCrawler
    • 覆盖平台:小红书、抖音等7大内容平台
  • smart-agent
    • 覆盖平台:B站、知乎等平台,纯HTTP直连

反爬解决方案

IP代理池(必配)

  • 快代理:按量/按天付费,有效率约85%
  • 芝麻代理:稳定性好,价格适中
  • 亮数据Brightdata:价格最高,中国节点质量最优
  • 太阳HTTP:国内源代理,适配百度/搜狗类平台

指纹伪装

  • playwright-stealth:绕过基础WebDriver检测
  • 随机化UA、视口、语言参数
  • 行为模拟:随机延迟、模拟鼠标移动轨迹

账号体系

  • 批量养号或购买成熟账号,覆盖主流平台
  • Cookie池管理:定期刷新,异常自动切换

词库质量评分体系

关键词表核心字段

  • 基础指标:baidu_index(百度指数)、search_volume(搜索量)
  • 来源指标:source_count(出现平台数)、platforms(来源平台列表)
  • GEO核心指标:ai_citation_score(AI引用频率0-1)、ai_platforms(引用AI列表)
  • 分类指标:intent(意图类型)、geo_city(城市标签)
  • 时效指标:is_trending(是否热词)、first_seen_at、last_seen_at

综合评分公式

  • total_score = 百度指数0.3 + 来源平台数100.2 + AI引用分1000.3 + 竞争度权重0.2
  • 竞争度权重:低=30、中=15、高=5

成本与收益估算

月度成本

  • 5118 API(专业版):¥299/月
  • 代理池服务:¥300/月
  • 服务器(采集+数据库):¥200/月
  • 合计:¥799/月

预期回报

  • 每月新增有效关键词:3000个
  • 内容转化率:每100篇内容→5个GEO引用
  • 月度新增引用:150次
  • 单次引用价值按50元计算,月度价值¥7500
  • ROI≈9.4x

关键成功指标

技术指标

  • 每日采集数:>5000个
  • 采集成功率:>95%

业务指标

  • P0关键词识别率:>10%
  • GEO引用月增长率:>20%

运营指标

  • 人工审核时间:<1小时/周

方案总结

核心路径

  • 百度Suggest递归打底
  • MediaCrawler扫社交平台
  • Playwright反向采AI引擎
  • 5118买词库交叉验证

预期成果

  • 8周内建成百万级GEO词库
  • 独有“AI引用分”核心数据,形成竞品壁垒

附录:分平台接口速查表

低反爬等级

  • 百度Suggest、搜狗Suggest、360Suggest、微博热搜、淘宝Suggest
    • 均为GET请求,无需复杂鉴权

中反爬等级

  • 百度相关搜索、百度指数、知乎搜索、B站Suggest
    • 需Cookie或HTML爬取,基础反爬策略即可适配

高反爬等级

  • 小红书Suggest、抖音Suggest、Kimi/豆包采集
    • 需登录态+浏览器模拟,配合代理池降低封禁风险