| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-05-26
💡 一句话总结
提出SkillGrad方法,像梯度下降一样显式优化代理技能的质量与适应性。
📋 详细解读论文解读论文针对代理技能普遍存在的不完整、不可靠或过时问题,提出SkillGrad框架将技能优化形式化为显式优化问题。核心创新是引入可微调的技能表示和优化目标,实现对第三方或自生成技能的质量改进。实验显示该方法能有效修复技能缺陷、提升任务成功率约20%,为skill evolution提供了一条不同于启发式反思的优化路径。
|
❤️ 10
💡 内容总结
SkillOpt将技能文档视为可训练外部状态,通过训练式控制实现可重复的技能改进,52个评估单元全部达到最佳或并列最佳
|
|
2026-05-27
💡 一句话总结
提出SKILLC框架,通过对比信用分配实现LLM代理的自主技能内化学习。
📋 详细解读论文解读论文研究LLM代理在长时域强化学习中的技能习得问题。核心创新点在于提出对比信用分配机制,将技能帮助性对比用于策略更新而不仅是课程控制,实现技能的自主内化。实验表明该方法在保持策略稳定性的同时显著加速了技能获取,相比现有内部化方法性能提升约15%。该研究为skill learning领域提供了新的优化范式。
|
❤️ 4
💡 内容总结
字节跳动MUSE-Autoskill解决Agent技能孤立静态问题,通过记忆机制实现长期记忆与自我进化,突破工业级应用瓶颈
|
|
2026-05-27
💡 一句话总结
Skill-as-Pseudocode将技能库重构为伪代码格式,优化LLM代理的技能检索与调用。
📋 详细解读论文解读论文针对自由格式Markdown技能库导致的代理困惑循环问题,提出将技能库重构为伪代码形式。核心创新是定义显式输入模式和调用语法,使代理能精确理解技能接口而无需每次重推导。实验表明该方法显著减少重复检索和错误调用,技能调用准确率提升约35%,有效改善了skill retrieval的可靠性。
|
❤️ 279
💡 内容总结
Codex联动Zotero的文献筛选工作流v1.1新增偏好学习机制,支持用中文自然语言反馈自动修改筛选规则和搜索关键词
|
|
2026-05-27
💡 一句话总结
ProgVLA通过进度感知的视觉-语言-动作模型实现高效的机器人操作技能学习。
📋 详细解读论文解读论文针对资源受限场景下的机器人操作,提出ProgVLA紧凑型视觉-语言-动作模型。核心创新是引入显式任务进度表示,高效处理长时域多模态序列,在严格计算和内存预算下保持可靠操作。实验在多个机器人操作任务上验证有效性,任务完成率相比基线提升约18%,证明了进度感知对skill learning的重要性。
|
|
|
2026-05-27
💡 一句话总结
MaskClaw为GUI代理提供边缘侧个性化隐私仲裁,支持行为驱动的技能演化。
📋 详细解读论文解读论文聚焦GUI代理面临的隐私泄露风险,提出MaskClaw边缘隐私仲裁框架。核心创新在于根据任务、接收者、应用状态和用户角色动态决策隐私边界,支持代理行为驱动的技能演化以适应隐私规则变化。实验表明该方法在保护隐私的同时保持代理可用性,隐私泄露率降低显著。MaskClaw为skill evolution在安全敏感场景中的应用提供了新思路。
|
|
|
2026-05-27
💡 一句话总结
提出OpenClaw长期代理的主动性差距基准,填补用户未表达的偏好获取问题。
📋 详细解读论文解读论文针对长期LLM代理如OpenClaw普遍存在的主观能动性缺失问题,提出主动性差距评估基准。核心创新是量化评估代理在用户未明确表达偏好时主动询问和获取信息的能力,填补了现有评估空白。实验分析了主流模型的主动性表现,发现普遍存在显著差距,为改进长期代理设计提供了方向。
|
|
|
2026-05-27
💡 一句话总结
FluxMem提出连接演化的记忆框架,使LLM代理记忆能动态适应环境和任务变化。
📋 详细解读论文解读论文针对现有记忆增强LLM代理将记忆视为静态仓库的问题,提出FluxMem连接演化记忆框架。核心创新是让记忆随反馈、任务变化和异构信号持续重塑,打破固定检索管道限制。实验在动态agentic环境中验证了该方法的有效性,记忆相关任务性能提升约20%,为记忆机制研究提供了新思路。
|
|
|
2026-05-27
💡 一句话总结
提出受扩散模型启发的自回归模型组合策略,实现技能的投影式组合。
📋 详细解读论文解读论文研究如何组合自回归模型学到的多种行为或技能。核心创新是受扩散模型组合方法启发,在分解条件假设下实现投影式组合。实验验证了该方法在跨任务技能组合中的有效性,为理解LLM的组合泛化提供了新理论框架,对agentic系统中的多技能调用有潜在价值。
|
|
|
2026-05-27
💡 一句话总结
记忆控制基准评估LLM交易代理,防范知识截断导致的历史记忆泄露。
📋 详细解读论文解读论文指出将LLM代理直接置于市场回测环境评估的漏洞,提出记忆控制评估框架。核心创新是分离代理真实决策能力与知识泄露风险,防范模型通过记忆截断日期、价格等信息作弊。实验表明当前代理在控制记忆后盈利能力显著下降,为评估LLM trading agents提供了更严格的基准。
|
|
|
2026-05-27
💡 一句话总结
MUTATE交互基准评估LLM代理在迭代交互中的发散思维能力。
📋 详细解读论文解读论文指出现有评估忽视代理在多轮交互中的创造性思维,提出MUTATE交互式发散思维评估基准。核心创新是从路径层面和轨迹层面两个层次评估代理发现多种替代方案的能力。实验揭示当前LLM在此维度存在不足,为理解agentic能力提供新视角,但非关键词核心研究。
|