📬 Daily Digest

今日推送

2026年08月18日 · 星期二
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Self-Evolving Agent · Long-Horizon Agent · Agent Harness
  📄 arXiv 论文   📕 小红书笔记
LLM Agent
2026-08-17
💡 一句话总结 通过超图结构化技能记忆实现Self-Evolving LLM Agents,支持跨任务经验复用与动态演化。
📋 详细解读
论文解读论文研究Self-Evolving LLM Agents的技能记忆问题,提出HyperSkill框架。核心创新包括:超图结构化记忆同时保留技能组成关系和独立条目;自适应检索机制根据任务上下文动态组装相关技能;持续演化机制通过经验整合实现能力提升。实验表明该方法在复杂技能重用任务中显著优于基线,验证了结构化记忆对agent自演化的重要性。
Self-Evolving Agent
❤️ 23
💡 内容总结 SkillX论文解读:将强Agent成功轨迹构建为分层Skill库,解决self-evolving agent的孤立学习和经验泛化问题
Long-Horizon Agent Agent Harness
2026-08-17
💡 一句话总结 提出统一黑箱RL框架,通过Agent Harness实现长时域任务的稳定可扩展优化训练。
📋 详细解读
论文解读论文针对强化学习通过复杂Agent Harness训练长时域任务的核心挑战,提出统一的黑箱RL框架。核心创新在于解决Harness规模扩展时的稳定性问题,允许在不透明环境中直接优化agent行为。实验在多个长时域agent任务上验证了该框架的可扩展性和训练稳定性,显著优于现有方法。
LLM Agent
❤️ 9
💡 内容总结 浙大蚂蚁OneDayAgent论文:实现Long-Horizon Autonomous Agents,联合管理目标漂移、状态丢失和上下文溢出
Long-Horizon Agent
2026-08-15
💡 一句话总结 提出LongRCA Bench基准测试,专门诊断Long-Horizon Agent执行中的角色责任与根本失败原因。
📋 详细解读
论文解读论文指出现有失败归因基准主要针对短轨迹,长时域Agent诊断缺乏系统方法。核心贡献是LongRCA Bench基准测试,能够在数百步跨多阶段执行轨迹中定位导致失败的决策点和最早根本原因步骤。通过提供负责任角色识别和失败根因诊断能力,帮助开发者高效调试长时域Agent系统。
LLM Agent
❤️ 6
💡 内容总结 Evo-Harness:模型参数冻结,通过外部技能束在线学习让Agent把失败执行编译成可复用技能指南
LLM Agent
2026-08-17
💡 一句话总结 提出TRCA方法,通过过渡级评分分配解决Long-Horizon LLM Agents的稀疏奖励信用分配难题。
📋 详细解读
论文解读论文针对Long-Horizon LLM Agents优化中稀疏终端奖励难以进行细粒度信用分配的挑战,提出过渡级评分信用分配方法。核心创新是利用成功轨迹的过渡统计特性推导出步骤级信用,无需过程标注成本。实验表明该方法在多步交互任务中显著改善信用分配效率,提升长时域agent训练效果。
LLM Agent
❤️ 1
💡 内容总结 DeepSeek Harness源码逐文件解读:'一切皆插件'设计、waterfall中间件链、append-only事件日志
Long-Horizon Agent
2026-08-17
💡 一句话总结 提出BaT框架,通过阶段评分实现Self-Evolving医疗研究Agent,支持轨迹诊断与训练闭环。
📋 详细解读
论文解读论文针对医疗影像工作流自动化中专家轨迹稀缺问题,提出Self-Evolving医学研究Agent框架BaT。核心创新包括阶段级评分系统将多阶段工作流失败诊断本地化;结构化评估保留诊断信息用于后续训练;自演化机制通过评分反馈持续改进Agent性能。实验验证了阶段级诊断对训练迭代的有效性。
LLM Agent
❤️ 56
💡 内容总结 蚂蚁×浙大Agent Skill安全探索:SkillTrace从文本、代码、执行流程多维度追踪Skill复用痕迹
Long-Horizon Agent
2026-08-17
💡 一句话总结 提出统一执行模型AstronOS,为长时域Agentic系统提供跨调用持久身份和版本化状态管理。
📋 详细解读
论文解读论文指出现有Agentic系统执行和状态管理局限于单一对话或调用,无法处理跨多调用多阶段的真实工作流。核心创新是引入统一执行模型,维持工作项的持久身份和版本化权威状态,每步接收特定状态版本输入,输出推进状态演进。该模型为构建可靠长时域Agentic系统提供了基础架构支撑。
Long-Horizon Agent
❤️ 16
💡 内容总结 美团AutoDesign论文:固定模型权重只优化Harness的Context-Memory、Tools-Specs、Retry-Approval组件
LLM Agent
2026-08-17
💡 一句话总结 提出BATON框架,通过Agentic子任务探索和过渡感知记忆提升长时域机器人操作能力。
📋 详细解读
论文解读论文针对VLA模型链式执行长时域机器人操作时错误累积问题,提出在VLA基础上添加LLM Agent控制器。核心创新包括子任务探索机制和过渡感知记忆,使Agent能够识别并纠正错误传播,同时处理子任务间的隐式约束关系。实验在多阶段接触丰富机器人操作任务上验证了方法有效性。
Long-Horizon Agent
❤️ 165
💡 内容总结 LoongReflect论文解读:通过全局视角蒸馏让Long-Horizon搜索Agent及时发现分支走偏并退回重搜
LLM Agent
2026-08-16
💡 一句话总结 提出Agent Gym框架,支持通过人机反馈对LLM Agents进行持续部署后的行为校正与演化。
📋 详细解读
论文解读论文指出生产环境中LLM Agents面临行为固定与业务规则演进的根本矛盾,现有点无机制支持部署后持续行为修正。核心创新是Agent Gym框架,提供结构化人机反馈回路,使Agent能够在不修改权重的情况下根据真实环境反馈持续改进。实验验证了该框架在应对动态业务规则变化时的有效性。
LLM Agent
❤️ 22
💡 内容总结 Self-Evolving Coding Agents综述:以5类演化对象、3种演化时机为主线梳理框架、记忆和技能的持续更新
Long-Horizon Agent
2026-08-16
💡 一句话总结 提出HyMem框架,通过信息隔离的层级上下文管理提升Long-Horizon Agents任务性能。
📋 详细解读
论文解读论文针对LLM Agents处理复杂长时域任务时上下文污染导致的规划能力下降问题,提出层级上下文管理方法HyMem。核心创新在于通过信息隔离机制分离执行细节和高层规划信息,在保持关键上下文可访问的同时防止无关细节干扰。该方法为提升长时域Agents的上下文管理效率提供了有效方案。
Self-Evolving Agent
❤️ 109
💡 内容总结 清华姚班 -> UW PhD | Ask me anything
Long-Horizon Agent
2026-08-17
💡 一句话总结 提出Mint-Agent金融原生Agentic基础模型家族,兼顾精确执行与长时域可审计研究能力。
📋 详细解读
论文解读论文针对金融领域Agent需要同时满足可靠执行和长时域调研可审计的双重需求,提出金融原生Agentic基础模型。核心设计基于三支柱架构:数据、硬件支持、金融工具链。模型在保持精确数值操作能力的同时,支持复杂金融研究任务的持续推进和结论可追溯性,为金融AI Agent提供了专业化基础模型方案。
Self-Evolving Agent
❤️ 97
💡 内容总结 我们给6G定位做了个基础模型