📬 Daily Digest

今日推送

2026年04月24日 · 星期五
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Agent · Skill · Skill Learning · Skill Retrieval · Skill Refinement · Skill Evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
Agent Skill Skill Retrieval
2026-04-22
💡 一句话总结 提出LLM决策与技能库智能体共同进化框架,通过游戏环境测试长时域任务中的多步推理与技能链式调用能力。
📋 详细解读
论文解读论文研究如何让LLM智能体在长时域交互环境中通过技能库不断进化。核心创新在于提出决策与技能库共同进化机制,智能体不仅学习如何做决策,还学习何时调用、何种技能。实验在多种游戏中验证,展示了智能体能够逐步积累和优化技能,在多步复杂任务中表现出更强的适应性和推理能力。技能库的动态更新机制使智能体能在部分可观测环境中做出更稳健的决策。
Agent
❤️ 19
💡 内容总结 分享如何让Agent显式报告Skill使用情况,解决Skill可观测性问题,提升调试效率
LLM Agent Agent
2026-04-23
💡 一句话总结 提出CI-Work基准测试,用于评估企业LLM智能体在不同信息流向场景下的上下文完整性保护能力。
📋 详细解读
论文解读论文研究企业LLM智能体使用内部上下文执行任务时的敏感信息泄露风险。提出CI-Work基准,模拟企业工作流中的五种信息流向方向,评估智能体是否能正确保护机密信息。核心贡献是构建了覆盖邮件、文档、数据库等多场景的测试集,并设计了上下文完整性评估指标。实验发现当前LLM智能体普遍存在信息泄露风险,呼吁加强智能体的权限管理和信息流控制能力。
Skill Learning
❤️ 2402
💡 内容总结 Claude Code Skill保姆级教程,手把手教你安装创建Skill、触发使用及寻找优质Skill资源
Skill
2026-04-23
💡 一句话总结 提出鲁棒策略门控机制实现人形机器人多技能间的平滑切换,解决战斗场景中的稳定性与敏捷性难题。
📋 详细解读
论文解读论文针对人形机器人执行动态格斗任务时的多技能切换问题。现有方法依赖单一技能策略的切换,难以保证长期动态任务的稳定性。核心创新是提出鲁棒策略门控机制,通过学习技能间的最优过渡策略实现平滑切换。实验在仿真和真实人形机器人上进行,验证了该方法能保持格斗过程中的平衡和动作连贯性,显著优于基线方法。
openclaw
❤️ 6
💡 内容总结 深入对比OpenClaw和Hermes两大Agent框架,OpenClaw重安全审计,Hermes专注自进化能力
Agent
2026-04-23
💡 一句话总结 发布AgenticQwen系列小模型,通过双数据飞轮机制训练工业级工具使用能力。
📋 详细解读
论文解读论文解决工业应用中需要小模型具备智能体能力但成本受限的问题。提出AgenticQwen系列模型,通过多轮强化学习在合成数据上进行技能训练。核心创新是双数据飞轮机制,同步优化模型的工具调用能力和任务完成能力。实验表明该模型在保持小规模(参数量有限)的同时,能有效完成多步推理和真实工具使用任务。
Skill
❤️ 7
💡 内容总结 介绍《玩转Skill》工具书,讲解Skill与OpenClaw协同使用,手把手教你打造专属AI助手
LLM Agent Agent Skill
2026-04-23
💡 一句话总结 提出智能体进化学习框架,解决开放环境中智能体如何有效利用记忆而非简单记住的问题。
📋 详细解读
论文解读论文研究LLM智能体在开放式环境中如何将历史经验转化为未来更好的行为。核心挑战不是"记什么"而是"如何使用记住的内容",包括检索策略和解释方式。提出自适应进化学习机制,通过多轮交互让智能体学会选择合适的检索策略、理解先验经验。实验证明该方法在数百个连续情节的复杂环境中显著优于传统无状态方法。
Skill Learning
❤️ 14
💡 内容总结 整理CoEvoSkills、SkillWeaver等最新Skill论文,涵盖自进化、技能发现等研究方向
Skill
2026-04-23
💡 一句话总结 提出总结和存储可复用推理技能的方法,在推理时检索技能引导未来问题解决,减少token消耗同时提升准确率。
📋 详细解读
论文解读论文针对LLM推理时token消耗过高的问题,提出从大量推理尝试中提炼可复用"推理技能"的方法。与从零推理不同,系统在推理时检索已存储的技能来指导解决新问题。核心创新是构建技能库并设计高效检索机制,使模型能像人类一样调用已学习的思维模式。实验表明该方法能显著减少长思维链的token消耗,同时保持甚至提升推理准确率。
Skill
❤️ 2
💡 内容总结 介绍OpenClaw的表格处理能力,强调Skill在任务流程连接中的核心作用
Agent
2026-04-22
💡 一句话总结 构建跨会话攻击基准CSTM-Bench,发现智能体防护机制的记忆缺陷,提出跨会话威胁检测算法。
📋 详细解读
论文解读论文揭示AI智能体防护系统的跨会话攻击漏洞。当前智能体的安全检查是无状态的,每条消息独立判断,攻击者可通过分散在多个会话中的信息传递恶意内容。核心贡献是构建CSTM-Bench基准,包含26种可执行的跨会话攻击分类法。提出跨会话威胁检测方法,能追踪信息在时间跨度上的累积效果。实验验证了该方法能有效识别当前防护无法发现的分布式攻击,为智能体安全提供新思路。
LLM Agent
❤️ 227
💡 内容总结 通俗讲解LLM、Agent、MCP、Skill四者的关系与区别,帮助理清AI概念体系
Agent
2026-04-23
💡 一句话总结 提出多样性引导的用户模拟方法,高效评估面向客户的LLM智能体可靠性,解决多轮交互评估的计算效率问题。
📋 详细解读
论文解读论文解决LLM智能体评估中多轮交互随机性高、计算成本大的问题。现有评估依赖完整对话的蒙特卡洛 rollout,效率较低。核心创新是提出多样性引导的用户模拟策略,通过引导对话轨迹的多样性分布,更有效地评估智能体性能。实验表明该方法能在保持评估质量的同时显著降低计算开销,对大规模智能体评测具有重要实用价值。
Skill Learning
❤️ 7
💡 内容总结 AI学习营分享什么是Skill,将其比喻为Agent的固定按钮,可大幅简化重复任务
LLM Agent Agent
2026-04-23
💡 一句话总结 提出动态工具门控和惰性模式加载机制,消除MCP/Tools协议中的token开销,提升可扩展智能体工作流效率。
📋 详细解读
论文解读论文针对Model Context Protocol (MCP) 引入的高额token开销问题。在多服务器部署中,每轮交互需传输约10k-60k token的模式定义,严重影响KV缓存效率。核心创新是提出动态工具门控机制,根据上下文需求选择性加载工具模式,实现惰性Schema加载。实验表明该方法能显著减少token消耗,同时保持工具调用的准确性,为大规模智能体系统提供更高效的通信协议。
Skill
❤️ 3
💡 内容总结 字节Agent开发实习面试经验,涵盖Agent架构、Skill设计、MCP与Skill区别等高频考点
Agent Skill
2026-04-23
💡 一句话总结 提出三层智能体架构,将研究问题自动转化为科学工作流规范,弥合科研问题与技术实现间的鸿沟。
📋 详细解读
论文解读论文解决科学家手动将研究问题转换为工作流规范的技术门槛问题。现有科学工作流系统能自动化执行但不能自动理解任务语义。提出三层智能体架构:LLM负责解释研究问题并生成工作流规格,底层包含调度、容错等自动化能力。核心创新是实现从"做什么"到"怎么做"的语义自动转换,使不具备基础设施经验的科学家也能构建复杂工作流。实验验证了系统在多个科学领域的适用性。
LLM Agent
❤️ 20
💡 内容总结 研究生分享Agent核心模块设计,包括Memory管理、任务规划、工具调用等实践经验