📬 Daily Digest

今日推送

2026年04月13日 · 星期一
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Agent · Skill · Skill Learning · Skill Retrieval · Skill Refinement · Skill Evolution · openclaw
  📄 arXiv 论文   📕 小红书笔记
Agent Skill
2026-04-10
💡 一句话总结 提出SkillMOO框架,利用LLM提议编辑和NSGA-II选择,自动优化Agent技能包的成功率、成本和运行时间。
📋 详细解读
论文解读针对软件工程LLM Agent技能包的手动调优困境,提出Multi-Objective Optimization框架自动化优化技能bundle。研究问题是如何同时优化多个冲突目标(成功率、成本、运行时)。核心创新包括LLM-proposed edits生成候选技能变体,以及NSGA-II survivor selection进行多目标筛选。实验表明该方法能在软件工程任务中自动发现性能更优的技能组合。
Agent
❤️ 13
💡 内容总结 深度拆解OpenAI Data Agent工程实践,指出上下文分层系统、数据源选择、语义携带、企业知识利用等核心设计要点。
Agent Skill openclaw
2026-04-10
💡 一句话总结 提出BadSkill后门攻击框架,通过模型投毒在Agent技能中植入隐蔽恶意行为,揭示AI Agent供应链安全风险。
📋 详细解读
论文解读研究针对AI Agent生态系统中安装式技能(Agent Skills)的供应链安全威胁。提出BadSkill后门攻击方法,通过在技能打包的模型文件中植入恶意行为,而非传统的提示注入或插件滥用。核心创新在于攻击者可伪装成良性第三方技能提供者,在技能模型中隐藏触发器。实验验证该攻击在多种场景下有效,需引起Agent平台安全重视。
Skill Refinement
❤️ 15
💡 内容总结 精选10个实用的Agent Skill平台插件,涵盖Self-Improving Agent、代码调试、浏览器操作等类型,提供具体使用建议。
Agent
2026-04-10
💡 一句话总结 提出自进化Agent形式化定义及SEA-Eval基准,评估Agent跨任务边界积累经验和优化策略的能力。
📋 详细解读
论文解读针对当前LLM-based Agent在跨任务边界无法积累经验或优化策略的局限,提出Self-Evolving Agent的形式化定义。核心创新包括基于数字具身和持续学习的SEA形式化框架,以及相应的评估基准。实验表明现有Agent在持续学习和跨任务优化方面存在显著不足,为Agent能力发展提供新评估标准。
Skill Refinement
❤️ 15
💡 内容总结 详细讲解将个人能力蒸馏为AI Skill的完整流程,包括数据采集、Prompt建模、工具挂载三个阶段的具体方法。
Skill
2026-04-10
💡 一句话总结 提出技能条件化视觉地理定位方法,使VLMs具备结构化地理推理和自主自进化能力。
📋 详细解读
论文解读解决视觉-语言模型在图像地理定位中缺乏结构化地理推理和自进化能力的问题。现有方法依赖隐式参数记忆,存在知识过时和幻觉推理问题,且推理是“一次性”缺乏反馈。核心创新在于引入Skill-Conditioned机制,使VLM能够基于技能进行推理并通过反馈实现自我改进。实验验证该方法显著提升定位准确性和地理推理结构化程度。
Skill
❤️ 1
💡 内容总结 《Open Claw实战指南》拆解四大模块,详述Agent、Skill、Workflow、MCP的架构关系和从部署到上手的实战路径。
Agent
2026-04-10
💡 一句话总结 提出Litmus (Re)Agent系统和基准,通过预测性多语言评估方法解决模型跨语言性能评估稀缺问题。
📋 详细解读
论文解读研究预测性多语言评估问题:当缺乏目标语言直接基准结果时,估计模型在该语言上的表现。核心创新在于提出跨语言性能预测框架,基于有限评估数据推断模型在目标语言任务上的表现。构建1500问题6任务基准实验验证,发现当前LLM在低资源语言上的性能难以准确预测,为多语言部署提供新评估范式。
Skill
💡 内容总结 字节Agent开发实习面经,记录MCP Tools与Skill区别、Claude Code记忆架构、Skill系统实现思路等技术细节。
Agent
2026-04-10
💡 一句话总结 提出CORA框架,基于共形风险控制为移动GUI自动化Agent提供可证明安全和用户可调的保障机制。
📋 详细解读
论文解读针对VLM驱动的GUI Agent从被动辅助向自主操作转变带来的安全和隐私风险。现有保障依赖提示工程和启发式方法,缺乏形式化验证和用户可调保证。核心创新在于应用共形预测理论,提供可证明安全风险控制和用户可调节保障机制。实验表明该方法在保持Agent执行效率的同时,显著降低用户面临的财务和隐私风险。
LLM Agent
❤️ 1
💡 内容总结 系统性梳理LLM、Agent、Skills、MCP四大核心概念的定义、关系和区别,帮助建立清晰的技术认知框架。
Agent
2026-04-10
💡 一句话总结 提出DRBENCHER合成基准生成器,评估深度研究Agent在需同时浏览和计算任务上的综合能力。
📋 详细解读
论文解读针对深度研究Agent日益增长的需求与孤立评估的矛盾,提出可生成需同时具备浏览和多步计算能力问题的合成基准。核心创新包括四标准:可验证性(黄金答案由执行计算)、组合性(多步骤)、多智能体交互、多模态。实验验证该基准能有效揭示当前Agent在知识密集推理和多步骤问题解决中的真实能力边界。
openclaw
❤️ 2
💡 内容总结 对比Claude Code、OpenClaw、Hermes三款AI工具的核心差异:缰绳式执行vs养殖进化vs自主学习。
Agent
2026-04-10
💡 一句话总结 提出SAGE基准,评估LLM客服Agent在真实客户行为和标准操作流程合规性上的表现。
📋 详细解读
论文解读针对客户服务场景LLM Agent评估挑战,现有基准依赖静态范式和单一维度指标。核心创新在于提出Service Agent Graph-guided Evaluation框架,考虑多样化用户行为和SOP合规性。实验构建真实客户服务评估环境,发现当前LLM Agent在处理异常用户行为和严格SOP遵循方面存在显著不足,为客服自动化提供新评估标准。
Skill Evolution
❤️ 1
💡 内容总结 深度解析Hermes Agent动态Skill生成机制的四层架构:Discovery、Prompt注入、Runtime加载、Evolution进化循环。
Agent Skill
2026-04-10
💡 一句话总结 提出HiL-Bench基准,评估前沿编码Agent在规格不完整时的判断能力——何时自主行动何时求助。
📋 详细解读
论文解读针对前沿编码Agent在完整上下文下表现优异但规格不完整时崩溃的问题,提出Human-in-the-Loop Benchmark。核心创新在于评估Agent的“判断力”而非仅执行正确性——即何时应自主行动、何时应寻求帮助。当前基准忽视此失败模式。实验发现当前Agent普遍缺乏自知之明,需要更复杂的不确定性估计和帮助请求机制。
LLM Agent
❤️ 3
💡 内容总结 开源Agent开发玩具项目,支持Plan-and-Execute架构、Skills插件系统、多模型切换和会话级记忆。
LLM Agent Agent
2026-04-10
💡 一句话总结 提出多层级指令层级框架,解决LLM Agent在系统消息、用户提示等多源指令冲突下的安全跟随问题。
📋 详细解读
论文解读研究大语言模型Agent接收来自系统消息、用户提示、工具输出等多源指令时的冲突问题。核心挑战是模型需可靠遵循最高权限指令以保证安全有效。创新点在于提出Many-Tier Instruction Hierarchy框架,超越传统固定小规模权限级别模型,实现动态多层级指令冲突解决。实验验证该方法显著提升Agent在复杂指令环境中的安全性和可靠性。
Skill Retrieval
❤️ 10
💡 内容总结 Hermes Agent新项目介绍,自动优化Skills的实现方案,展示Agent如何实现Skill的自动学习和进化。