智能体记忆并非越多越好。一项覆盖八款模型的评测显示,智能体记忆需要像剂量一样按模型能力进行校准。对于能力较强的模型,注入完整的指南集效果最佳,例如 DeepSeek-V3.2(671B MoE)的任务完成率提升了 9.5 个百分点;对于能力较弱的模型,采用精选检索后的指南效果最好,例如 gpt-oss-120b(117B MoE)任务完成率提升了 16.1 个百分点,且只增加了 5% 的 token 消耗。该方法不需要更新权重,也不需要人工标注,而是从智能体过往轨迹中蒸馏出指南,并在推理时注入,从而实现按需记忆。
智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准
Hugging Face 发布一项关于智能体记忆的研究结论:记忆并非越多越好,需要按模型能力校准剂量。强模型适合完整指南集,弱模型适合精选检索;其中 DeepSeek-V3.2 提升 9.5pp,gpt-oss-120b 提升 16.1pp 且 token 增加仅 5%。方法无需更新权重或人工标注,而是从历史轨迹蒸馏指南并在推理时注入。
对 FDE 交付的启示是:智能体记忆策略应与模型能力匹配,而非一味增加记忆。强模型可注入完整指南,较弱模型用精选检索可显著提升任务完成率并控制 token 增量。该方法无需更新权重或人工标注,从历史轨迹蒸馏指南、推理时注入,为现场调整智能体行为提供了低成本路径;也提醒 FDE 在方案设计时把记忆剂量纳入评估。