📬 Daily Digest

今日推送

2026年05月04日 · 星期一
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Agent · Skill · Skill Learning · Skill Retrieval · Skill Refinement · Skill Evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
Agent Skill
2026-05-01
💡 一句话总结 提出 Semia 审计框架,通过约束引导的表示合成方法系统评估 Agent 技能的可信度。
📋 详细解读
论文解读论文关注 Agent 技能的审计问题,研究如何验证技能配置包(结构化接口+描述性文本)的行为正确性。核心创新是开发约束引导的表示合成技术,能够在运行时动态重新解释技能描述并验证其执行效果。提出双条件正确性准则用于判定技能是否达到预期行为,为 Human-in-the-Loop Agent 运行时提供可信赖的验证机制。
Skill Learning
💡 内容总结 SKILLRL通过递归技能增强强化学习解决Agent每次任务重新做人的问题,让模型学会抽象可迁移的策略
Agent Skill
2026-05-01
💡 一句话总结 将技能视为可验证制品,提出信任模式和双条件正确性准则以解决 Agent 技能部署问题。
📋 详细解读
论文解读论文研究 LLM 驱动的 Agent 技能包如何成为一等部署制品,以及运行时如何验证技能行为。核心创新在于提出信任模式(Trust Schema)和双条件正确性准则,定义技能内容声明与运行时执行之间的验证逻辑,解决传统包管理器和操作系统中内容声明与实际行为不一致的长期问题。
Skill
❤️ 16
💡 内容总结 阐述Skillify核心理念:RAG是带书进考场每次重找,Skillify是读透记成笔记一次编译永久可用,对比三条技术路线
Agent
2026-05-01
💡 一句话总结 提出自适应熵调节方法 AEM 解决多轮 Agentic RL 中奖励稀疏和信用分配难题。
📋 详细解读
论文解读论文研究 LLM Agent 在多轮任务中的强化学习训练挑战,解决稀疏的结果奖励难以分配到单个步骤的问题。核心创新是引入自适应熵调节机制,根据训练动态动态调整探索程度,同时使用密集中间监督信号辅助信用分配。在多轮对话和交互任务上的实验表明,该方法显著提升学习稳定性和最终性能。
Agent
❤️ 50
💡 内容总结 深入分析single agent为何常优于multi-agent,指出multi-agent的高得分往往因消耗更多token,而非架构优势
Agent Skill
2026-05-01
💡 一句话总结 提出验证门控的技能编排框架 Affordance Agent Harness,解决开放世界场景中技能动态组合的难题。
📋 详细解读
论文解读论文研究开放世界场景中的 affordance grounding 问题,即如何识别智能体应交互的位置和方式。核心创新在于提出 verification-gated skill orchestration 机制,将检测、分割、交互想象等多种技能动态组合,并根据每个实例的难度自适应调整处理流程,避免固定管道的局限性。实验表明该方法在处理遮挡、反射等复杂场景时显著优于现有方案。
Skill Refinement
❤️ 336
💡 内容总结 详细记录公司内部Skill走查工具的开发过程,包括模型配置、组件库结合、两种使用模式及GitHub开源分享
Agent
2026-05-01
💡 一句话总结 构建 AgentFloor 基准测试,评估小模型在 Agent 工作流各环节的适用性并分析工具使用阶梯。
📋 详细解读
论文解读论文研究生产级 Agent 系统中模型路由问题,即哪些环节需要大模型能力而哪些可用小模型处理。核心贡献是创建 30 任务的确定性基准测试 AgentFloor,系统评估不同规模开源模型在各 Agent 工作流环节的表现,分析模型能力与任务复杂度匹配度,为实际部署提供模型选择依据。
Agent
❤️ 22
💡 内容总结 华为提出OneManCompany框架,将多Agent系统提升到组织层级,用Talents封装可移植的Agent身份进行治理
Agent
2026-05-01
💡 一句话总结 提出 Agent Capsules 运行时,通过质量门控的粒度控制实现多 Agent 流水线的自适应执行。
📋 详细解读
论文解读论文研究多 Agent 流水线的执行优化问题,核心挑战是合并 Agent 可节省 token 但会因工具丢失和提示压缩导致质量下降。创新性地将多 Agent 执行建模为带质量约束的优化问题,提出质量门控粒度控制机制,根据任务复杂度自适应决定是否合并 Agent。实验证明该方法在保持质量的同时实现显著的 token 节省。
Skill
❤️ 2
💡 内容总结 介绍营销出图Skill,内置60+品牌风格资产和8+高效提示模板,支持品牌DESIGN.md工作流批量生成营销资产
Agent
2026-05-01
💡 一句话总结 提出程序级调度方法 SAGA,将 Agent 工作流作为整体调度单元解决 GPU 利用率低下问题。
📋 详细解读
论文解读论文研究 AI Agent 在 GPU 集群上的推理效率问题,发现现有调度器将每个 LLM 调用视为独立请求导致中间状态丢失和延迟放大 3-8 倍。核心创新是提出 workflow-atomic scheduling,将整个 Agent 工作流作为程序级调度单元而非请求级,在步骤间保留中间状态。实验表明该方法显著降低端到端延迟并提升 GPU 利用率。
LLM Agent
❤️ 16
💡 内容总结 详解从普通RAG到Agentic RAG的演进,Agent如何自主判断是否查知识库、查哪个库、用什么query
LLM Agent Agent
2026-05-01
💡 一句话总结 提出 Agentic AI 编排层应符合贝叶斯一致性的观点论文,讨论 LLM Agent 在不确定性决策中的应用。
📋 详细解读
论文解读论文是关于 Agentic AI 编排的位置论文(Position Paper),研究 LLM Agent 在不确定性环境下做决策时的控制层设计问题。核心观点是控制层应采用贝叶斯方法来处理工具调用、专家咨询、资源投入等关键决策,确保决策与不确定性估计保持一致。虽然贝叶斯方法在 LLM 推理中的可行性尚不明确,但论文为这一研究方向提供了系统性论证。
Agent
❤️ 1
💡 内容总结 分享科研知识体系Agent搭建经验,实现Agent自动找论文、Zotero管理、论文总结,辅助科研人员维护长期知识库
Agent
2026-05-01
💡 一句话总结 提出 RunAgent 多 Agent 平台,通过约束引导实现自然语言计划的结构化执行。
📋 详细解读
论文解读论文研究 LLM 在结构化工作流执行中的可靠性问题,提出自然语言计划与确定性执行之间的桥接方案。核心创新是开发约束引导的执行机制,通过评分卡(rubrics)确保各步骤按计划执行,在自然语言表达力和编程确定性之间取得平衡。适用于需要精确流程控制的任务自动化场景。
Agent
❤️ 321
Agent
2026-05-01
💡 一句话总结 提出工具调用决策框架,评估并优化 LLM Agent 中工具调用的收益与成本平衡。
📋 详细解读
论文解读论文研究 Agentic AI 架构中工具使用的核心决策问题:何时调用工具以及何时不调用。核心挑战在于工具调用并非总是有益的,某些调用可能冗余甚至有害,特别是网络搜索工具存在外部信息收益不确定的问题。论文提出系统化评估框架,为 LLM 提供何时依赖外部工具何时使用内在知识的决策依据,提升 Agent 在不同任务场景下的工具使用效率。