📬 Daily Digest

今日推送

2026年05月25日 · 星期一
📄 arXiv 3
📕 小红书 10
关键词:LLM Agent · skill learning · skill retrieval · skill refinement · skill evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
LLM Agent
2026-05-22
💡 一句话总结 提出OpenSkillEval基准,系统审计开源技能生态中LLM Agent与技能的交互质量与泛化能力
📋 详细解读
论文解读本文提出OpenSkillEval框架,自动审计开放技能生态中不同LLM模型和Agent框架与技能(skills)的交互效果。研究问题聚焦于如何评估技能质量、模型适配性及用户选择指导。核心创新在于构建系统化评估流程,覆盖技能调用、任务执行和结果验证三大维度。实验表明,当前主流模型在技能泛化上存在显著差距,为开源技能生态的规范化发展提供评测基础。
skill learning
❤️ 19
💡 内容总结 Princeton+Google的Continual Harness论文,让AI边打游戏边改自己的作战指挥系统,实现自我进化
LLM Agent
2026-05-22
💡 一句话总结 提出QGP指标和PushBench基准,测量和强化长时程LLM Agent的定量目标坚持能力
📋 详细解读
论文解读本文研究长时程LLM Agent在工具调用中的定量目标坚持(QGP)问题,提出PushBench基准进行量化评估。研究问题为Agent为何能做出看似合理的局部工具调用却无法坚持完成目标计数。核心创新在于定义QGP指标,将外部验证器引入工作单元完成判定。实验揭示当前Agent普遍存在目标坚持缺陷,为长时程任务优化提供评估标准。
skill evolution
❤️ 1
💡 内容总结 Skill-R1论文解读:让7B参数Agent学会管理技能树,实现检索、使用、蒸馏的端到端优化
LLM Agent
2026-05-22
💡 一句话总结 通过因果归因和结构异常检测对中毒的LLM Agent记忆进行后验审计
📋 详细解读
论文解读本文针对LLM Agent持久化记忆机制的安全漏洞,提出MemAudit框架进行后验审计。研究问题为如何检测被恶意注入的恶意记忆记录对Agent行为的影响。核心创新在于结合因果归因和结构异常检测方法,无需先验知识即可识别异常记忆模式。实验表明该方法能有效识别多种记忆投毒攻击,为Agent安全部署提供审计工具。
skill retrieval
❤️ 68
💡 内容总结 介绍SkillFlow工作,让Agent不仅记住答案而是整理出稳定解题方法,实现技能的自我进化和筛选
LLM Agent
❤️ 6
💡 内容总结 字节联合人大发布Agent-World,在23个智能体基准上超越GPT-5.2和Claude Sonnet等闭源模型
skill evolution
💡 内容总结 后训练时代重点:Post-training看state coverage,SWE Agent SFT看轨迹质量,自演化从prompt走向系统闭环
openclaw
❤️ 1
💡 内容总结 OpenClaw保姆级搭建实操,从0到1搭好24小时在线AI助理,覆盖自动执行任务、邮件处理等场景
skill refinement
❤️ 20
💡 内容总结 Codex自进化skill技巧:让AI每周复盘使用记录,找出重复工作流程,自动优化Harness配置
LLM Agent
❤️ 1
💡 内容总结 Constraint Decay论文发现:代码Agent在结构约束变多时出现能力衰减,需重视任务复杂度对Agent的影响
openclaw
❤️ 1036
💡 内容总结 分析AI Agent搜索能力的短板,指出通用搜索引擎只能摸到互联网表面,OpenClaw作为解决方案
LLM Agent
❤️ 7
💡 内容总结 Agent双闭环机制详解:执行闭环完成当前任务,学习闭环提升未来能力,包含轨迹、打分、训练、优化