📬 Daily Digest

今日推送

2026年05月11日 · 星期一
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · skill learning · skill retrieval · skill refinement · skill evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
skill retrieval
2026-05-07
💡 一句话总结 提出Group of Skills方法,通过组结构化技能检索增强智能体技能库可用性
📋 详细解读
论文解读论文研究了LLM智能体技能库中的技能检索问题。现有方法返回原子技能或依赖感知的捆绑包,但内部角色不明确,智能体需自行推断执行入口。论文提出Group of Skills方法,将相关技能组织为组结构化集合,明确标注执行入口、支持技能、可见需求和失败规避指导。核心创新是设计了组结构的技能表示和检索机制,通过内部角色明确化提升技能可用性。实验表明该方法能显著提升技能库的可复用性和智能体执行效率。
skill learning
❤️ 3
💡 内容总结 解读SkillOS论文,让大模型Agent通过Curator自动策展技能库,实现从历史经验中自我进化
LLM Agent
2026-05-07
💡 一句话总结 提出方向感知自适应学习方法,优化LLM智能体的测试时计算分配
📋 详细解读
论文解读论文研究LLM智能体的自适应测试时计算问题。现有方法假设门控信号与计算需求存在固定方向关系,将门控简化为效用校准问题。论文发现信号方向与计算价值存在复杂关系,提出方向感知自适应学习方法,考虑门控信号的方向信息。核心创新是揭示了方向依赖性在计算分配中的重要作用,并设计了考虑信号方向的动态门控机制。实验验证了该方法在多种推理任务中的有效性。
skill retrieval
❤️ 9
💡 内容总结 清华团队提出SRA技能检索增强新范式,解决Agent技能数量增长导致的上下文耗尽与准确率下降难题
LLM Agent
2026-05-07
💡 一句话总结 提出HCL-GP方法,通过层级策略分解实现LLM智能体的泛化策略学习
📋 详细解读
论文解读论文研究LLM智能体的泛化规划问题,提出层级组件学习方法HCL-GP。该方法结合泛化规划和层级任务分解,从成功执行中自动提取可复用组件并组织成组件库。核心创新在于学习参数化策略以跨任务实例泛化,并自动组织可复用组件。实验表明该方法在层级任务分解和策略复用方面优于基线方法,为智能体提供更高效的任务泛化能力。
skill refinement
❤️ 35
💡 内容总结 提出Skill Wiki下一代形态,将知识原子化并用14种关系连边,实现技能索引与按需加载的智能管理方案
arxiv
2026-05-08
💡 一句话总结 提出环境驱动的智能体发现框架,优化LLM的测试时计算扩展策略
📋 详细解读
论文解读论文研究LLM测试时扩展策略的自动化设计问题。现有TTS策略依赖人工设计推理模式,遗留大量计算分配空间未探索。论文提出环境驱动的智能体发现框架,让LLM通过与环境交互自动发现有效的推理策略。核心创新是设计了数据驱动的策略搜索机制,通过智能体交互探索计算分配空间。实验表明该框架能自动发现优于人工设计的推理策略。
LLM Agent
❤️ 16
💡 内容总结 通过两阶段流水线将复杂Agent编排转化为大模型重度思考技能,显著提升推理能力逼近模型上限
LLM Agent
2026-05-07
💡 一句话总结 研究智能体安全泛化失败原因,揭示执行能力与安全约束的泛化差距
📋 详细解读
论文解读论文研究AI智能体在多任务环境中安全泛化的问题。智能体需在新任务中执行并避免风险,但实证表明即使执行能力泛化,安全约束可能失效。论文分析执行泛化与安全泛化之间的差异来源。核心创新是揭示了执行能力泛化与安全泛化的不对称性,指出当前方法在安全泛化上的不足。实验表明需要专门针对安全泛化的训练方法,而非假设执行泛化可自动保证安全。
LLM Agent
❤️ 13
💡 内容总结 谷歌内部疯传的AI Agent手册,系统梳理Agent开发的核心方法与最佳实践
LLM Agent
2026-05-07
💡 一句话总结 提出POMDP框架建模智能体搜索中的上下文收集决策过程
📋 详细解读
论文解读论文研究LLM智能体在复杂环境中的信息收集决策问题。智能体需在大规模代码库、企业数据库等超出上下文窗口的环境中导航寻找相关信息。论文提出基于POMDM的上下文收集决策框架,建模不确定环境下的信息探索过程。核心创新是将上下文收集建模为序贯决策问题,平衡探索与利用。实验表明该框架能改善智能体的信息获取效率和任务完成质量。
skill learning
💡 内容总结 HEAVYSKILL论文提出并行推理加序贯裁决的agent编排方法,在LiveCodeBench上GPT-OSS-20B从69.7%提升至85.5%
LLM Agent
2026-05-08
💡 一句话总结 研究从早期经验学习智能体路由,实现轻量级LLM与全量智能体的有效切换
📋 详细解读
论文解读论文研究LLM智能体的路由问题,探讨何时使用轻量级LLM推理何时使用完整智能体执行。现有方法未充分利用早期交互经验进行路由决策。论文提出从早期经验学习的路由方法,基于初始交互模式预测任务复杂度。核心创新是设计了早期经验感知的路由策略,平衡性能与计算成本。实验表明该方法能有效减少不必要的计算开销同时保持任务成功率。
LLM Agent
❤️ 4
💡 内容总结 提出四层记忆架构压缩决策信息量,让Agent用30K token完成长程任务,含自我进化机制自动沉淀SOP
LLM Agent
2026-05-08
💡 一句话总结 提出AgentEscapeBench,通过密室逃脱风格评估LLM智能体的跨域工具推理能力
📋 详细解读
论文解读论文提出AgentEscapeBench评估LLM智能体的工具使用泛化能力。现有评估多关注熟悉工作流和短程交互,对跨域工具推理能力评估不足。论文设计密室逃脱风格基准,测试智能体推断、执行和修订新工具使用程序的能力,需处理显式长程依赖约束。核心创新是构建了需要跨模块推理和设计意图理解的复杂任务。实验评估了多种LLM在跨域工具推理上的表现,揭示了当前模型的局限性。
openclaw
💡 内容总结 OpenClaw六大核心概念解析:Gateway网关、消息通道、Skill技能、Memory记忆、Heartbeat心跳与Workspace四件套
LLM Agent
2026-05-08
💡 一句话总结 利用图表示学习增强LLM联邦微调中的模型操作与聚合安全性
📋 详细解读
论文解读论文研究联邦微调场景下LLM的模型操控攻击防御问题。联邦微调LLM易受对抗性模型操控威胁,现有方法缺乏有效检测机制。论文提出基于图表示学习的方法,增强模型聚合过程的安全性。核心创新是利用图结构建模分布式更新关系,检测异常模型操作。实验表明该方法能有效识别恶意模型更新,保护联邦学习系统的完整性。
skill retrieval
❤️ 1
💡 内容总结 字节Agent开发三面经验汇总,涉及Multi-Agent通信设计、记忆检索优化与评测体系构建等核心技术点
LLM Agent
2026-05-08
💡 一句话总结 发现扩展上下文窗口会系统性降低LLM智能体在多智能体社会困境中的合作能力
📋 详细解读
论文解读论文研究上下文窗口扩展对LLM智能体合作行为的影响。研究涵盖7个LLM和4种博弈游戏共500轮交互。发现扩展可访问历史在18/28的模型-游戏设置中降低合作能力,论文称之为记忆诅咒现象。核心创新是通过三个分析隔离了潜在机制,包括词汇分析等。实验揭示了上下文扩展对多智能体系统的意外负面影响,为设计更鲁棒的智能体系统提供重要警示。