AI开发从炼金术到工程学

AAI脑图#5109222025-09-30 07:11
15800

内容详情

核心主张

上下文工程

  • 定义
    • 可测量·可迭代·可优化的AI交付方法论
  • 口号
    • 拒绝黑箱搅拌,用数据说话

上下文腐烂

现象

  • 远未达上限即失效
    • Claude 3 Sonnet 最稳
    • GPT-4 Turbo & Gemini Flash 显著下降

结论

  • 质量>长度
    • 塞得越多,模型越笨

两阶段检索

阶段1 粗筛Recall

  • 目标
    • 别漏
  • 方法
    • 向量语义+关键词+元数据过滤
  • 输出
    • Top几百条

阶段2 精炼Precision

  • 目标
    • 别塞废信息
  • 方法
    • 大模型Re-rank
  • 输出
    • Top20~30条入上下文
  • 成本
    • 模型调用几百次≈几分钱

生成式基准测试

痛点

  • 私有知识库无标准答案

三步法

  • 1.模型自动生成Q-A对
  • 2.人工抽检修正→黄金数据集
  • 3.量化评估换策略
  • ROI
    • 一个下午+几百条标注=极高回报

记忆=上下文工程

精准提取

  • 信息→上下文

可复用信仰

  • 记忆不是玄学,是数据操作

Chroma产品哲学

融资

  • 不追风口,慢工出细活

开发者体验

  • 5秒本地跑,零配置

云产品

  • Serverless按量计费,不卖节点

招聘

  • 极慢极挑剔,文化=产品

品味

  • 办公室/网站/T恤统一审美

落地Checklist

拒绝一把梭

  • 建立两阶段流水线

建黄金数据集

  • 自动生成+人工抽检200-500条
  • 记录命中率·MRR·NDCG baseline

持续优化

  • 换Embedding/重排序/加规则→看指标

监控腐烂

  • 每周跑基准
  • 长上下文指令遵循率下降>10%触发优化