OmniTools 8月19日消息,IBM研究院与Hugging Face近日在技术博客中发布一项关于智能体(Agent)上下文记忆机制的实证研究。研究指出,为智能体注入由历史经验提炼的指南集并非“越多越好”,其有效用量需根据模型自身能力进行校准。
研究基于ALTK-Evolve框架,在AppWorld多步任务基准(585个任务)上测试了8款模型,涵盖30B稠密模型至745B MoE模型。结果发现三类典型模式:强模型(如DeepSeek-V3.2)受益于完整指南集,任务完成率提升9.5个百分点;中等规模模型(如gpt-oss-120b)采用“核心指南+任务检索”策略效果最佳,任务完成率提升16.1个百分点且仅增加5% token开销;而部分高参数量模型(如GLM-5)则未显现显著增益,呈现饱和现象。
研究强调,所谓“记忆”并非回放历史对话,而是由智能体自主轨迹中提取的可复用策略、避坑提示与边缘案例构成的结构化指南集,全程不更新模型权重。该方法已在多个开源与闭源模型上验证其零标注、低成本、跨模型可迁移特性。