📬 Daily Digest

今日推送

2026年09月02日 · 星期三
📄 arXiv 10
关键词:LLM Agent · Self-Evolving Agent · Long-Horizon Agent · Agent Harness
  📄 arXiv 论文   📕 小红书笔记
Self-Evolving Agent
2026-09-01
💡 一句话总结 提出HarnessEvolve框架,通过参考轨迹学习解决Agent自进化中的信用分配失败和捷径学习问题。
📋 详细解读
论文解读论文研究Self-Evolving Agent如何基于环境反馈优化自身的harness(提示词、技能、工具和执行逻辑)。核心创新在于解决两大挑战:信用分配失败(终端成功/失败反馈难以定位错误步骤)和捷径学习(记忆任务特定模式而非泛化)。实验表明,通过从参考轨迹中学习,Agent能更可靠地完成自进化,在多个基准任务上取得显著提升。
Long-Horizon Agent
2026-09-01
💡 一句话总结 为Long-Horizon Agent设计实时追踪模型,将事件日志增量折叠为类型化运行状态。
📋 详细解读
论文解读论文针对Long-Horizon Agent的追踪问题:人类观察者和Agent自身的上下文都有界限,轨迹会不断增长超越消费者容量。提出Live Trace Model这一append-only事件账本,增量折叠为类型化运行状态并编译为面向消费者的视图。实验验证了该模型对人和Agent两个消费者都有效,为长时程任务提供了可解释性保障。
Agent Harness
2026-09-01
💡 一句话总结 提出Harness-of-Harness框架,让编码Agent在自主开发过程中持续改进软件系统。
📋 详细解读
论文解读论文研究LLM编码Agent如何将高层需求转化为完整可用的软件系统。核心创新是Harness-of-Harness(HoH)框架,在现有编码Agent harness上运作,实现持续改进。框架允许Agent在多天自主开发过程中迭代优化,平衡功能性与可用性。实验表明该框架能显著提升代码质量和开发效率。
Agent Harness
2026-09-01
💡 一句话总结 构建CordisBench基准,评估LLM在动态Agent Harness中组件生命周期的推理能力。
📋 详细解读
论文解读论文聚焦动态Agent Harness带来的新挑战:本地插件变更会通过依赖传播并影响清理工作。创建了包含1200道题目的CordisBench基准,测试生命周期推理能力。基准结合了形式化设置与实际程序执行,对标Cordis运行时。实验揭示当前LLM在复杂依赖关系推理上的局限性,为Harness设计提供评估依据。
Long-Horizon Agent
2026-09-01
💡 一句话总结 提出ContextPipe,为Long-Horizon Agent提供数据库启发的上下文组装方案。
📋 详细解读
论文解读论文针对长时程Agent的上下文管理问题:运行时需决定提示词内容、顺序,以及在有限上下文窗口下的历史压缩策略。指出生产系统的上下文逻辑分散且缺乏统一设计。提出ContextPipe,借鉴数据库查询优化思想,实现上下文组装。框架提供了更高效的上下文管理和缓存策略,提升了长任务处理能力。
Agent Harness
2026-09-01
💡 一句话总结 提出MemoryWalker方法,解决Agent训练中上下文压缩导致的条件化问题。
📋 详细解读
论文解读论文针对生产环境Agent harness(如Claude Code)在rollout时压缩上下文导致的训练问题。指出压缩训练创造了树形学习目标而非序列,现有线性化方法存在时间旅行泄漏或训练分布偏移缺陷。提出MemoryWalker,通过改进历史建模方式解决条件化问题。实验表明该方法能有效提升Agent在压缩环境下的性能。
LLM Agent
2026-09-01
💡 一句话总结 提出渐进式风险授权机制,平衡递归LLM-Agent搜索能力与安全边界。
📋 详细解读
论文解读论文研究递归LLM-Agent在生成专业分支时的权限控制问题。区分了沙箱生成(外部控制防止伤害)和能力激活(分支跨越不可逆操作边界)。提出渐进式风险授权(PRV)机制,根据分支行为动态调整权限级别。安全分析表明该机制能有效控制递归Agent的不可逆操作风险,同时保持搜索灵活性。
LLM Agent
2026-09-01
💡 一句话总结 论证仅用结果奖励的RL对Long-Horizon Interactive Agent足够,无需密集奖励补偿。
📋 详细解读
论文解读论文挑战了长时程任务中仅outcome-only RL会触及性能天花板的共识。指出此前工作通过密集奖励、SFT先验、技能库等外部补偿掩盖了问题本身。论证在适当条件下,纯结果奖励对小型开源模型已足够。实验在多种长时程交互任务上验证了方法有效性,为训练范式提供了新思路。
Agent Harness
2026-09-01
💡 一句话总结 研究LLM是否具备创建和演进自身Agent Harness的能力,提出HarnessDev框架。
📋 详细解读
论文解读论文探讨Agent能力如何依赖外部执行基础设施(harness),以及模型是否能在固定权重下开发自身harness。研究表明改变harness会显著影响任务性能,但现有评估仅报告下游性能。提出HarnessDev框架,系统研究LLM的harness演进能力。实验揭示了当前模型在这一方向上的潜力与局限。
arxiv
2026-09-01
💡 一句话总结 提出EDGE框架,通过错误依赖图对多Agent系统中的多重错误进行归因。
📋 详细解读
论文解读论文针对LLM Agent失败中多个相关错误难以归因的问题。现有方法仅定位责任Agent或步骤,未显式建模错误间依赖关系。提出Error Dependency Graphguided(EDGE)框架,从观测错误构建依赖图并指导归因。实验表明该方法能准确识别多错误场景中的根本原因,为多Agent系统调试提供有效工具。