AI开发从炼金术到工程学
15800
画布
|大纲
内容详情
核心主张
上下文工程
- 定义
- 可测量·可迭代·可优化的AI交付方法论
- 口号
- 拒绝黑箱搅拌,用数据说话
上下文腐烂
现象
- 远未达上限即失效
- Claude 3 Sonnet 最稳
- GPT-4 Turbo & Gemini Flash 显著下降
结论
- 质量>长度
- 塞得越多,模型越笨
两阶段检索
阶段1 粗筛Recall
- 目标
- 别漏
- 方法
- 向量语义+关键词+元数据过滤
- 输出
- Top几百条
阶段2 精炼Precision
- 目标
- 别塞废信息
- 方法
- 大模型Re-rank
- 输出
- Top20~30条入上下文
- 成本
- 模型调用几百次≈几分钱
生成式基准测试
痛点
- 私有知识库无标准答案
三步法
- 1.模型自动生成Q-A对
- 2.人工抽检修正→黄金数据集
- 3.量化评估换策略
- ROI
- 一个下午+几百条标注=极高回报
记忆=上下文工程
精准提取
- 信息→上下文
可复用信仰
- 记忆不是玄学,是数据操作
Chroma产品哲学
融资
- 不追风口,慢工出细活
开发者体验
- 5秒本地跑,零配置
云产品
- Serverless按量计费,不卖节点
招聘
- 极慢极挑剔,文化=产品
品味
- 办公室/网站/T恤统一审美
落地Checklist
拒绝一把梭
- 建立两阶段流水线
建黄金数据集
- 自动生成+人工抽检200-500条
- 记录命中率·MRR·NDCG baseline
持续优化
- 换Embedding/重排序/加规则→看指标
监控腐烂
- 每周跑基准
- 长上下文指令遵循率下降>10%触发优化
