📬 Daily Digest

今日推送

2026年05月26日 · 星期二
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · skill learning · skill retrieval · skill refinement · skill evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
skill evolution
2026-05-22
💡 一句话总结 构建SkillEvolBench基准测试,评估LLM智能体从情景经验到程序化技能的演化能力
📋 详细解读
论文解读论文提出SkillEvolBench基准测试,用于评估LLM智能体能否将解决任务的过程性经验转化为可复用的程序化技能。该基准包含180个任务,涵盖6种真实智能体环境。核心研究问题在于智能体积累的丰富轨迹数据是否能被有效提炼为可迁移的技能表示。实验结果显示当前LLM在经验到技能的转化方面仍有较大提升空间,为skill evolution研究提供了重要评测工具。
skill retrieval
❤️ 40
💡 内容总结 微软SkillOpt通过冻住大模型、用优化器改skill文档的方法,52个场景全部第一,GPT-5.5对话能力暴涨23.5分
openclaw
2026-05-25
💡 一句话总结 系统分析OpenClaw智能体的安全威胁,识别攻击向量并提出针对性防御策略
📋 详细解读
论文解读论文深入研究OpenClaw智能体框架的安全问题。OpenClaw是一类开放源码的智能体系统,具有持续运行、技能增强、持久记忆等特性。研究分析了该框架面临的各类攻击手段,包括提示注入、工具误用等,并提出了相应的安全防护措施。研究为OpenClaw智能体的安全部署提供了系统性指导,对构建可靠的自主智能体系统具有重要参考价值。
skill retrieval
💡 内容总结 企业场景下Skill Engineering决定系统上限,核心从Prompt Engineering转向Runtime+System架构设计,包含长任务和多Tool调度
skill learning
2026-05-23
💡 一句话总结 提出伙伴感知的层级技能发现方法,增强人机协作中智能体对多样化伙伴的适应性
📋 详细解读
论文解读论文针对人机协作中智能体难以适应不同伙伴行为的问题,提出伙伴感知的层级技能发现方法。传统深度层级强化学习方法仅关注智能体自身奖励,导致技能学习走捷径而非真正适应伙伴行为。该方法引入伙伴建模,使智能体能够识别并响应不同伙伴的动态行为模式。实验表明该方法显著提升了多智能体协作的鲁棒性和适应性。
LLM Agent
❤️ 14
💡 内容总结 SkillRouter用1.2B小模型实现技能库高效选择,发现技能实现代码是路由决定性信号,颠覆依赖名称描述的传统假设
LLM Agent
2026-05-25
💡 一句话总结 Auto-Robotist智能体将机器人设计搜索轨迹转化为自然语言技能库实现自主演进
📋 详细解读
论文解读论文提出Auto-Robotist自演进LLM智能体,解决传统进化机器人设计中搜索结果无法保留为可复用知识的问题。该系统将模拟器评估结果蒸馏为结构化的自然语言技能库,每个技能包含设计原则和参数。智能体能够从历史设计探索中提取可迁移的设计知识,实现真正的自我演进。实验表明该方法显著提升了设计效率和知识复用能力。
skill learning
❤️ 60
💡 内容总结 Auto-Skill-Forge让skill自我改进,通过定义yes/no checklist让AI自动诊断弱点、修改、测试、筛选,分数只升不降
LLM Agent
2026-05-23
💡 一句话总结 SEAL框架实现智能体与学习环境的协同演化,解决智能体-环境错位问题
📋 详细解读
论文解读论文识别出现有自演化方法的结构性缺陷:只单独适应策略或环境,提出智能体-环境协同演化的SEAL框架。核心问题在于训练过程中智能体能力边界变化,而提供监督的环境保持静态。SEAL通过双向耦合机制,使环境难度随智能体能力动态调整,避免过度简单或过于困难的训练场景。实验验证了该方法在多种任务中的有效性。
skill learning
💡 内容总结 Hermes Agent自学习闭环将成功经验提炼成可复用Skills存入持久化存储,实现越用越强的闭环学习循环
LLM Agent
2026-05-25
💡 一句话总结 提出自进化智能体原生检索范式,使检索过程更像推理而非单次查表
📋 详细解读
论文解读论文指出当前RAG系统将外部知识组织为扁平片段的检索方式不适合工具使用型智能体,提出检索即推理的新范式。该方法名为LLM-Wiki,使检索过程具备搜索、阅读、遍历和决策等推理特性,而非简单的上下文获取。核心创新在于将单次检索升级为持续推理过程,使智能体能够判断证据是否充分,提升检索与推理的一致性。
skill learning
❤️ 10
💡 内容总结 借鉴batch、learning rate、schedule等深度学习思想,将skill document从一次性prompt变为可训练外部状态,实现稳定可控优化
LLM Agent
2026-05-25
💡 一句话总结 MemIR通过类型化记忆表示解决长期智能体中的溯源-角色崩溃问题
📋 详细解读
论文解读论文针对长期运行LLM智能体中历史交互存储为非结构化文本导致的溯源-角色崩溃问题,提出MemIR类型化记忆中间表示方法。该方法在架构层面引入认知约束,将历史交互结构化存储,解决智能体的源监控错误。核心创新在于将记忆表示从扁平文本升级为带类型的结构化形式,为持久化智能体系统提供更可靠的记忆机制。
skill learning
❤️ 114
💡 内容总结 SkillOpt将skill视为可训练外部参数,像训练神经网络一样通过rollout、edit budget优化skill文档,实现Agent Skills自我进化
LLM Agent
2026-05-24
💡 一句话总结 GroupTravelBench首个多用户旅行规划的LLM智能体评估基准
📋 详细解读
论文解读论文指出现有LLM智能体基准仅关注单用户场景,忽略了真实世界中多用户冲突解决的挑战,提出GroupTravelBench基准测试。该基准评估智能体在多人旅行规划中识别和协调用户间冲突的能力。核心研究问题在于智能体能否处理多方偏好差异并生成协调方案。该基准填补了多智能体协作评测的空白,为评估社交智能体能力提供了新标准。
skill learning
💡 内容总结 Hermes Agent四大核心组件包括自主策展记忆、自主技能创建和Skill自我改进,通过GEPA遗传编程实现持续进化
LLM Agent
2026-05-25
💡 一句话总结 实证研究揭示LLM智能体对语义噪声比表面噪声更敏感的现象
📋 详细解读
论文解读论文通过68个测试单元研究chain-of-thought和ReAct型LLM智能体对不同噪声的敏感性。实验覆盖7个模型族、10个大语言模型,测试GSM8K、MATH和HotpotQA数据集。结果发现含义层面的扰动如同义词替换比呈现层面的扰动如格式调整对最终答案影响更大。这一发现为理解LLM智能体的推理脆弱性提供了实证基础,对提升智能体稳健性有指导意义。
skill retrieval
❤️ 13
💡 内容总结 Skill多了不能全塞进prompt,合理的做法是先做Skill Catalog只给模型看name+description,任务命中后再按需加载完整SKILL.md
LLM Agent
2026-05-25
💡 一句话总结 DiscoverPhysics基准测试通过偏离物理定律的模拟世界评估LLM真实推理能力
📋 详细解读
论文解读论文提出DiscoverPhysics基准测试,区分LLM是真正推理还是回忆已知科学知识。该测试创建22个物理定律故意偏离现实的模拟世界,要求LLM智能体发现运动定律。核心挑战在于智能体需超越已有知识进行原创性科学思考,而非依赖训练数据的记忆召回。该基准为评估前沿LLM的科学思维能力和真正推理能力提供了严格测试环境。
skill retrieval
❤️ 543
💡 内容总结 Codex团队分享自动蒸馏方法,让AI回顾会话、Memories和Chronicle识别模式,复用已有内容创建最小但有用的Skills