📬 Daily Digest

今日推送

2026年08月25日 · 星期二
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Self-Evolving Agent · Long-Horizon Agent · Agent Harness
  📄 arXiv 论文   📕 小红书笔记
Long-Horizon Agent
2026-08-22
💡 一句话总结 ECHO提出认知启发的可审计记忆架构,为长期Agent提供可追溯的情境记忆管理
📋 详细解读
论文解读论文针对长期agent记忆系统的可追溯性和一致性挑战,提出ECHO认知记忆架构。该架构受情景编码、巩固、情境重激活和再巩固等认知机制启发,实现记忆的写入、检索和验证全流程可审计。核心创新在于将记忆生命周期管理与可验证性结合,使agent能够识别相关经验、解决记忆冲突并暴露决策来源。原型系统验证了架构的可行性,为构建可信赖的长期交互agent奠定基础。
Agent Harness
❤️ 126
💡 内容总结 DeepSeek Harness被曝9.8分极危RCE漏洞,影响0.1.1-rc.2版本,问题出现在Web服务/api接口的信任判断机制。
Agent Harness
2026-08-22
💡 一句话总结 HiMA-MDD提出层级多Agent harness架构,实现临床面试中可解释的多模态抑郁检测
📋 详细解读
论文解读论文针对临床面试中抑郁评估的复杂性问题,提出HiMA-MDD层级多Agent harness框架。该框架通过多智能体协作整合分散的语音、文本和视觉证据,逐层推理形成PHQ-8评估档案。核心创新在于设计层次化的证据聚合机制,使每个agent专注于特定粒度的判断,同时保持全局一致性。实验表明该方法在保持可解释性的同时,能够有效整合多模态线索,为临床决策提供透明可靠的辅助依据。
Agent Harness
❤️ 103
💡 内容总结 将Pi Harness接入Slime实现Agentic RL训练,在ShopSimulator环境下通过SFT和GRPO将成功率从0%提升至31%。
LLM Agent
2026-08-24
💡 一句话总结 TRACE构建自演化技能库,使LLM Agent具备一致性和极限感知能力,提升部署可靠性
📋 详细解读
论文解读论文针对LLM agent在产品部署中的一致性和可靠性问题,提出TRACE自演化技能库框架。该框架通过结构化存储和动态复用交互轨迹,使agent能够学习何时安全响应请求、何时需要拒绝超出能力范围的请求。核心创新在于引入limit-awareness机制,解决agent在边界情况下的一致性表现问题。CAR-bench评估表明TRACE显著提升了in-car assistant场景下的可靠性,降低了不安全输出的风险。
Self-Evolving Agent
❤️ 23
💡 内容总结 Zetta是一种高效闭环具身Harness,通过三层时间尺度循环实现物理智能体的在线自演化进化。
LLM Agent
2026-08-24
💡 一句话总结 AutoSaddler实现LLM Agent外部harness的自动化优化,通过智能搜索大幅提升长时任务鲁棒性
📋 详细解读
论文解读论文针对LLM agent在长期任务中可靠性不足的问题,提出AutoSaddler自动优化框架。该框架自动搜索最优的prompt配置、工具组合和控制逻辑,无需人工设计即可生成高效的外部harness。核心创新在于将harness设计从手工过程转变为可优化的自动化流程,解决了传统方法需要在大空间中进行昂贵搜索的难题。实验证明AutoSaddler能在多种长-horizon任务中显著提升agent鲁棒性,大幅降低人工干预成本。
Agent Harness
❤️ 23
💡 内容总结 Agent Harness排名文章,汇总主流Agent框架的评测对比,帮助开发者选择合适的开发框架。
Long-Horizon Agent
2026-08-24
💡 一句话总结 提出自反射策略优化框架SRPO,让大语言模型通过分析自身轨迹实现长期推理能力的内化提升
📋 详细解读
论文解读论文针对大语言模型在长期推理任务中信用分配困难的问题,提出自反射策略优化(SRPO)框架。该框架使LLM能够分析已完成的轨迹,将稀疏的结果反馈转化为可操作的指导,从而内化自我反思能力。核心创新在于将人类的自我反思机制引入LLM的后训练阶段,实现无需外部反馈的持续改进。实验表明SRPO在多个长期推理基准上显著优于现有方法,有效解决了长-horizon任务中的credit assignment问题。
Agent Harness
❤️ 54
💡 内容总结 探讨如何将编码智能体的Harness范式迁移到物理世界的具身智能体,分析世界状态可读性等核心挑战。
LLM Agent Long-Horizon Agent
2026-08-21
💡 一句话总结 Scroll将上下文作为可执行环境,实现长期Agent的程序化上下文管理和按需信息获取
📋 详细解读
论文解读论文针对长期agent上下文窗口受限的问题,提出Scroll程序化上下文管理框架。该框架将每个agent会话视为可执行的Session Environment,支持动态查询和按需加载历史信息。核心创新在于打破传统压缩方法的局限性,允许agent在需要时主动探索和检索历史上下文。实验表明Scroll能在保持上下文完整性的同时,有效控制token消耗,为长期交互任务提供可扩展的解决方案。
Agent Harness
❤️ 5
💡 内容总结 深入解析Claude Code底层架构,核心观点是Agent差距不在模型而在Harness,并详解Memory/Planning/Tool/Monitoring四模块。
Self-Evolving Agent
2026-08-22
💡 一句话总结 SSE-Bio提出结构化自演化Agent架构,解决生物医学多跳推理中的指令漂移问题
📋 详细解读
论文解读论文针对生物医学多跳问答中检索策略失效的问题,提出SSE-Bio结构化自演化agent框架。该框架通过智能检索策略和结构化推理流程,使agent能够在疾病、药物、蛋白质等实体间建立准确连接。核心创新在于将自演化机制与结构化工作流结合,使推理过程具备可解释性和可调整性。BioASQ基准测试表明该方法能有效处理复杂的多跳查询,提升生物医学推理的准确性和鲁棒性。
Agent Harness
❤️ 63
💡 内容总结 调研Memory Agents领域,指出不同memory substrate在不同条件下表现各异,不存在全局最优解。
Self-Evolving Agent
2026-08-23
💡 一句话总结 提出联盟感知技能可靠性机制,解决自演化Agent中技能质量评估和选择的核心问题
📋 详细解读
论文解读论文针对自演化LLM agent中技能可靠性的基本问题,提出联盟感知技能评估框架。该框架通过分析技能间的交互关系和上下文依赖,对技能质量进行细粒度评估。核心创新在于超越传统的单一技能评估,从技能组合的角度衡量可靠性。实验表明该方法能有效识别高风险技能组合,在保持任务性能的同时显著提升agent的稳定性。
LLM Agent
❤️ 485
💡 内容总结 被实习生带飞,2周做完一篇EMNLP
LLM Agent
2026-08-24
💡 一句话总结 InjecMEM揭示LLM Agent记忆系统的记忆注入攻击漏洞,仅需单次交互即可操控后续行为
📋 详细解读
论文解读论文针对LLM agent记忆系统的安全性问题,提出InjecMEM记忆注入攻击范式。该攻击仅需单次交互(无需读写权限)即可在记忆存储中植入恶意内容,影响后续相关查询的响应。核心创新在于发现记忆系统作为新型攻击面的可行性,并系统性地分析攻击条件与影响范围。安全分析表明当前记忆架构存在严重漏洞,为设计更安全的agent记忆系统提供了重要警示和防御方向。
LLM Agent
❤️ 227
💡 内容总结 中央民大人工智能招生 | LLM Agent
LLM Agent
2026-08-24
💡 一句话总结 NetConfArena提供可执行的网络配置基准测试,为评估LLM Agent在闭环网络任务中的可靠性奠定基础
📋 详细解读
论文解读论文针对LLM agent在网络配置自动化中缺乏可靠评估的问题,提出NetConfArena可执行基准测试平台。该平台提供真实的网络配置环境,支持评估agent在闭环场景下的行为和失败模式。核心创新在于超越静态命令生成测试,要求agent在动态环境中进行真实交互和验证。实验揭示了当前LLM agent在网络配置任务中的典型失败模式,为改进agent设计提供了针对性的评估依据。
LLM Agent
❤️ 222
💡 内容总结 EuroSys ’27|Agent 时代的 KV Cache 系统