📬 Daily Digest

今日推送

2026年08月27日 · 星期四
📄 arXiv 7
📕 小红书 10
关键词:LLM Agent · Self-Evolving Agent · Long-Horizon Agent · Agent Harness
  📄 arXiv 论文   📕 小红书笔记
LLM Agent
2026-08-26
💡 一句话总结 Self-Evolving LLM Agent通过经验驱动工作流和经验图记忆实现硬件内核优化自动化。
📋 详细解读
论文解读论文针对硬件内核优化问题,提出让LLM Agent能够从完成的任务中持续学习。现有方法虽提升了个体任务内的优化能力,但缺乏跨任务的经验积累机制。该研究设计了经验驱动工作流与经验图记忆系统,使Agent能够复用历史优化经验。实验结果显示,这种自演化机制显著加速了优化收敛,并提升了最终优化质量,展示了Self-Evolving Agent在实际计算任务中的潜力。
Agent Harness
❤️ 13
💡 内容总结 从可理解性、可扩展性、模型独立性等维度对比Codex、OpenHands、Goose、DeepSeek Harness与Pi五个开源Harness项目的实战评测。
Agent Harness
2026-08-26
💡 一句话总结 JIT-Agent提出通过即时harness演化实现智能体能力规模化,设计自适应harness生成模型。
📋 详细解读
论文解读论文研究了Agent能力不仅取决于底层模型,harness(包括记忆管理、规划策略、动作协议和工具编排)本身就能主导贡献。当前harness设计依赖人工、任务特定且不可扩展。JIT-Agent提出一种harness智能模型,能够根据任务动态合成适配的harness配置,实现harness层面的自动化与自适应。实验表明该方法可显著提升智能体在多种任务上的性能,且具有良好的可扩展性。
Agent Harness
❤️ 14
💡 内容总结 Harness Scaling实战验证:用120万条真实攻击日志测试Agent能力,Apodex成功完成从分析到生成防火墙规则的完整长链路任务。
LLM Agent
2026-08-26
💡 一句话总结 ProgRouter提出在线质量-成本权衡下的多Agent工作流动态编排方法。
📋 详细解读
论文解读论文研究多Agent LLM工作流中质量与成本权衡下的动态编排问题。现有级联路由方法仅做一次性查询级决策,无法适应动态演化的任务需求。ProgRouter提出在线进度引导的编排策略,能根据实时执行状态动态调整Agent组合与调用深度。在多个基准测试上的实验表明,该方法能在保持输出质量的同时显著降低运营成本,为长时域复杂任务提供了高效的Agent协同框架。
Agent Harness
❤️ 2
💡 内容总结 深度解析DeepSeek Harness两周使用体验,重点关注插件机制如何同时解决扩展、缓存和信任三个核心问题。
LLM Agent
2026-08-25
Agent Harness
❤️ 58
💡 内容总结 JIT-Agent-27B模型可针对每个任务即时生成专用Harness,将Harness从人工维护升级为可训练的动态组件,证明了Harness本身可独立于模型Scaling。
LLM Agent
2026-08-25
Self-Evolving Agent
❤️ 11
💡 内容总结 Recuris将Agent记忆解耦为工作记忆和经验记忆,通过验证门控机制实现长周期任务中的有界递归记忆进化环,解决状态模糊和技能错位问题。
arxiv
2026-08-26
Self-Evolving Agent
❤️ 52
💡 内容总结 Meta^n通过套娃堆叠让Agent自我进化,在ARC-AGI-2上远超Gödel Agent,各层角色自发涌现内层造工具、外层学会回滚纠错。
LLM Agent
2026-08-26
Self-Evolving Agent
❤️ 3
💡 内容总结 大模型Skill自我进化落地决策指南,提供三层架构+六个决策点+决策矩阵,区分在线生成、离线蒸馏和Verifier三种进化路径。
Long-Horizon Agent
❤️ 28
💡 内容总结 开源agent harness简历项目,支持deepresearch、长链路中断可恢复、上下文压缩、跨session持久记忆、受控自进化skill和全链路trace。
Self-Evolving Agent
❤️ 34
💡 内容总结 RSI-Exam评测AI Agent递归式自我改进能力,让Agent在数小时内自主发现问题、做实验、比较结果并改进Harness、Memory等外部组件。
Self-Evolving Agent
❤️ 180
💡 内容总结 蚂蚁灵波发布Zero-WAM, 利用人类视频上下文学习,探索跨任务泛化 机器