AI代理上下文工程全景
6300
画布
|大纲
内容详情
上下文工程定义与兴起
概念
- 上下文工程
- 精巧艺术+科学:用最少必要信息填充上下文窗口
- 解决工具调用导致的上下文爆炸
- 时间线
- 提示工程
- 2022-12 ChatGPT发布后兴起
- 上下文工程
- 2024-05 "智能体之年"快速升温
- 提示工程
- 核心矛盾
- 上下文腐烂
- 上下文↑→模型性能↓
- 悖论
- 需大量上下文调用工具 vs 长上下文降低性能
- 上下文腐烂
五大通用技术主题
上下文卸载(Offload)
- 思想
- 非必要信息移出消息历史,需要时可检索
- 主流做法
- 文件系统卸载
- 工具输出→文件,仅返回文件路径/摘要
- 案例:Manus、Claude Code、Open Deep Research
- 文件系统卸载
- 进阶
- 分层行为空间卸载(Manus)
- 函数调用层:原子函数(读写、搜索、浏览器)
- 沙盒工具层:Linux CLI、MCP CLI
- 代码/API层:Python脚本调用预授权API
- 分层行为空间卸载(Manus)
上下文缩减(Reduce)
- 压缩(可逆)
- 工具结果保留唯一标识符(路径/URL),内容外化
- 摘要(不可逆)
- 结构化schema摘要:字段表单代替自由文本
- 保留最近完整工具调用示例防风格漂移
- 触发策略
- 先压缩→增益不足再摘要
- 阈值:128k-200k Token(腐烂前)
上下文检索(Retrieve)
- 文件系统+简单搜索
- grep/glob,低延迟,无需建索引
- 索引+语义搜索
- 向量库,适合长期/企业知识,需预热
- 选型建议
- 沙盒/编码场景优先文件系统;大规模知识场景引入索引
上下文隔离(Isolate)
- 子智能体模式
- 每个子代理独立上下文窗口,实现关注点分离
- 通信模式 vs 共享内存模式
- 通信模式
- 短指令-结果,低Token,易同步
- 共享内存模式
- 子代理可见完整历史,适合深度研究类任务
- 通信模式
上下文缓存(Cache)
- 稳定工具描述+顺序
- 避免KV缓存失效
- 分层接口保持正交
- 函数/沙盒/代码三层的调用入口统一,缓存友好
实战案例:Open Deep Research
三阶段流程
- 范围界定→研究→一次性写作
技术组合
- 卸载
- 研究计划写入LangGraph状态/文件,写作前召回
- 缩减
- 搜索结果实时摘要
- 隔离
- 研究阶段多子代理并行
Manus最新经验(生产验证)
上下文缩减双策略
- 压缩阈值管理
- 旧50%工具调用压缩,保留新示例
- 结构化摘要
- 高召回schema,丢弃前转储完整日志文件
上下文隔离设计
- 通信 vs 共享内存
- 按任务复杂度选型,权衡Token与同步成本
- 子代理即工具
- 主代理定义输出schema,子代理用"submit_result"约束解码返回
分层行为空间(卸载工具本身)
- 函数调用层
- 原子函数,schema安全,缓存友好
- 沙盒工具层
- 预装CLI,大输出直接写文件,利用grep/less等处理
- 代码/API层
- Python脚本+预付费API,内存计算后仅回传摘要
五大维度联动
- 相互影响
- 卸载+检索→缩减更高效
- 隔离↑→缓存效率↓
- 需动态平衡,避免过度工程
反模式警示
- 上下文过度工程
- 简化架构>堆叠技巧,每轮模型升级应删减脚手架
问答精要
工具与沙盒
- 系统提示列预装目录+常用工具名;模型用--help自学习
索引策略
- 会话级沙盒用grep/glob;长期记忆/企业知识再引入向量索引
长期记忆
- 显式"Knowledge"需用户确认;探索无参数在线学习收集集体反馈
模型演进适配
- 每1-2月用强弱模型切换测试架构未来适应性
数据格式
- 优先行级纯文本,慎用Markdown防过度列表
摘要提示
- 用结构化schema而非自由文本,确保高召回
搜索输出压缩
- 简单搜索→直接压缩存文件;复杂多查询→"agent-as-tool"子代理
智能体通信
- 共享沙盒文件系统+约束解码输出schema,实现MapReduce式聚合
模型选择
- 任务级路由:Claude编码、Gemini多模态、OpenAI数学推理;分布式KV缓存成本优于自建
工具数量
- 原生函数≤30,Manus保持10-20原子函数,其余下沉沙盒/代码
混合模式
- 直接函数调用+沙盒脚本执行,兼顾schema安全与图灵完备
规划演进
- 废弃todo.md,独立规划器智能体(agent-as-tool)减少Token浪费
多智能体设计
- 反对角色分工,采用通用执行器+规划器+知识管理器,降低通信复杂度
安全与防护
- 沙盒出站流量检查+敏感操作人工确认;与模型提供商合作增强提示注入防护
评估体系
- 用户五星评分>自动化可验证测试>真人实习生视觉/品味评估
RL与工具调用
- 行为空间开放(如MCP)导致奖励函数难固定;优先上下文工程+无参数在线学习
