📬 Daily Digest

今日推送

2026年05月21日 · 星期四
📄 arXiv 6
📕 小红书 10
关键词:LLM Agent · skill learning · skill retrieval · skill refinement · skill evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
LLM Agent
2026-05-20
💡 一句话总结 APEX通过自主策略探索实现LLM Agent的自我进化,利用累积记忆与反思提升长时决策能力
📋 详细解读
论文解读论文提出APEX框架,解决自我进化LLM Agent在测试时缺乏探索能力的核心问题。采用记忆累积与反思机制,通过自主策略探索在交互环境中学习。核心创新在于无需模型权重更新即可实现持续学习。实验表明在长时决策任务中,APEX能有效平衡探索与利用,显著优于基线方法,为Agent技能演化提供新思路。
skill learning
❤️ 13
💡 内容总结 SkillRL通过递归skill增强强化学习让Agent学会技能组合,核心在于skill的复用与组合而非替换单个技能
LLM Agent
2026-05-20
💡 一句话总结 MemGym构建长时记忆评估环境,填补现有记忆基准忽视Agent动态记忆形成的空白
📋 详细解读
论文解读论文指出现有记忆基准主要评估多轮聊天中的个性化信息保留,忽视Agent执行过程中的动态记忆形成。MemGym提出长时记忆环境,专门评估Agent在代码生成等真实场景中的记忆能力。核心创新在于设计了反映现实Agentic环境的测试基准,弥补了实验室评估与实际部署的差距。实验显示当前Agent的记忆系统迁移性较差,为skill learning研究提供重要评测工具。
skill refinement
❤️ 22
💡 内容总结 深度解析Skill本质为动态提示词模板,对比手动提示词与Skill的差异,详解Agent工具调用的完整闭环流程和MCP协议实现
arxiv
2026-05-20
💡 一句话总结 Mem-π提出按需生成式记忆框架,替代传统检索式记忆增强LLM Agent
📋 详细解读
论文解读论文针对现有记忆增强Agent依赖相似度检索、返回静态条目导致上下文错配的问题,提出Mem-π自适应记忆框架。核心方法是按需生成有用指导而非从外部记忆库检索。创新点在于通过学习判断何时生成何种指导,实现动态上下文适配。实验证明该方法在多种任务中显著提升Agent性能,为skill retrieval提供新范式。
openclaw
❤️ 3
💡 内容总结 开源Agent全栈教程覆盖32章节,从零基础到OpenClaw源码精读,涵盖Skills、Workflow、Harness、Memory、ReAct等核心话题
LLM Agent
2026-05-19
💡 一句话总结 AgentAtlas提出多维度评估框架,超越单一成功指标全面衡量LLM Agent能力
📋 详细解读
论文解读论文诊断现有Agent基准碎片化问题,每个基准侧重不同度量维度如任务成功、工具调用有效性等。AgentAtlas提出统一的多维度评估框架,整合多个评估维度。核心创新在于构建超越结果榜单的全面评估体系,涵盖能力、安全性、鲁棒性等。论文为Agent评估标准化奠定基础,有助于更准确衡量skill retrieval和refinement效果。
skill evolution
❤️ 15
💡 内容总结 南大Solvita框架实现无权重更新的Agentic持续进化,Planner/Solver/Oracle/Hacker四Agent闭环协作解决竞技编程问题
LLM Agent
2026-05-20
💡 一句话总结 Insights Generator提出语料库级trace诊断方法,系统化发现LLM Agent执行中的失败模式
📋 详细解读
论文解读论文针对LLM Agent失败诊断依赖人工检查小量样本、形成临时假设的问题,形式化语料库级trace诊断问题。核心方法是通过跨trace群体分析发现仅在统计意义上显现的失败模式。创新在于将诊断扩展到生产规模语料库(单个trace达数万token)。论文为Agent调试提供系统化工具,支持skill refinement的过程分析。
skill learning
❤️ 14
💡 内容总结 Skill1论文实现经验库与模型Co-Evolve,用policy model统一打通skill selection、skill utilization和skill distillation
LLM Agent
2026-05-20
💡 一句话总结 审计12篇LLM Agent基准论文,揭示评估方法差异导致结果不可比的根因
📋 详细解读
论文解读论文对12篇知名LLM Agent基准论文进行系统性审计,逐维度记录评估执行细节。核心问题是相同基准相同模型却报告不同结果,原因涉及scaffold、采样设置、子集选择或评估器版本差异。创新点在于提出开放评分schema,促进评估透明化。虽然不直接研究skill主题,但为Agent研究提供方法论指导,间接支持skill evolution的可靠评估。
LLM Agent
❤️ 58
💡 内容总结 Code即Harness新范式让代码成为智能体循环中的执行介质,通过Program-of-Thoughts和形式验证实现确定性推理
LLM Agent
❤️ 29
💡 内容总结 Datawhale Agent-Learning-Hub提供9阶段可执行学习路线,从最小agent loop到multi-agent,覆盖RAG、tool use、memory等核心技能
skill evolution
❤️ 1
💡 内容总结 Synthos科研操作系统让AI Agent从工具进化为科研协作者,采用文言文压缩44KB+的Skill文档,实现碳硅共生自进化
LLM Agent
❤️ 7
💡 内容总结 一图详解AI Agent完整执行链路:Query→记忆检索→LLM意图理解→Skills路由→MCP工具调用→结果验证的闭环流程
openclaw
💡 内容总结 深度分析OpenClaw生态安全风险,提出从架构设计到运营部署的全链路纵深防御策略,涵盖供应链和默认安全原则