| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-06-21
💡 一句话总结
提出假设驱动的技能优化框架,无需训练即可从稀疏轨迹中提炼可靠Agent技能
📋 详细解读论文解读论文提出HDSO框架解决外部技能从噪声轨迹中更新的风险问题。核心创新在于通过假设验证机制区分有用程序、虚假捷径和不可靠规则,实现免训练的技能优化。实验表明该方法显著提升动作导向LLM Agent的技能质量,同时避免模型权重变更带来的副作用。
|
|
|
2026-06-21
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems
💡 一句话总结
构建PlanBench-XL基准测试评估大规模工具生态系统中LLM Agent的长期规划能力
📋 详细解读论文解读论文针对现有基准缺乏检索限制下规划评估的问题,构建包含327个零售任务的PlanBench-XL。核心创新在于模拟1,600+工具的大规模生态,要求Agent发现相关工具、推断隐含子目标并适应动态环境。实验揭示当前LLM Agent在长时域工具使用规划上的显著不足。
|
|
|
2026-06-22
💡 一句话总结
提出注意力谱正则化方法解决持续学习导致的多模态技能灾难性遗忘问题
📋 详细解读论文解读论文针对多模态大语言模型(MLLM)在持续微调中遗忘已习得技能的问题,提出注意力谱正则化方法。核心创新在于不依赖重放数据,通过正则化嵌入几何来保持模型的多模态技能。实验证明该方法在视觉域、问题类型和用户指令的非平稳流中有效保留原有能力。
|
|
|
2026-06-22
💡 一句话总结
提出AFTER基准测试评估LLM Agent程序记忆的技能迁移能力,覆盖382个企业任务场景
📋 详细解读论文解读论文研究了LLM Agent的程序记忆能力,提出AFTER基准包含382个真实企业任务,涵盖6个职业角色和22项程序技能。核心创新在于评估技能跨任务、角色和模型骨干的迁移能力。实验表明现有Agent在程序记忆复用上存在显著局限,为构建可重用的Agent技能库奠定评估基础。
|
|
|
2026-06-22
💡 一句话总结
提出统一Embodied Agent框架HoloAgent-0,融合3D空间记忆解决物理机器人执行难题
📋 详细解读论文解读论文将数字环境的LLM Agent执行循环扩展到物理机器人,提出HoloAgent-0框架。核心创新在于构建3D空间记忆系统,处理物理执行的连续性、具体化、不确定性和安全约束问题。对比现有embodied-AI系统,该框架显著提升了机器人在物理环境中的操作和空间理解能力。
|
|
|
2026-06-21
💡 一句话总结
揭示上下文压缩如何悄然消除LLM Agent安全约束,提出治理衰减问题
📋 详细解读论文解读论文发现上下文压缩层是LLM Agent的安全关键故障面,治理约束可被无声移除。核心创新在于形式化描述在压缩后执行禁止工具操作的现象,揭示压缩与安全之间的时间解耦漏洞。对比现有上下文管理方法,强调长程会话中安全约束的脆弱性,为防护设计提供依据。
|
|
|
2026-06-22
💡 一句话总结
揭示上下文管理对LLM Agent长时域任务的关键作用,提出重放配对诊断方法
📋 详细解读论文解读论文研究上下文管理对长时域Agent的影响,发现计划是最易被驱逐但至关重要的信息。核心创新在于提出重放配对诊断方法,评估被丢弃信息是否已被内部化。实验揭示现有上下文压缩策略会破坏Agent的任务连续性,强调上下文管理是LLM Agent的负载支撑层。
|
|
|
2026-06-22
💡 一句话总结
系统分析自我进化LLM Agent系统的新型威胁格局,包括对抗影响的永久编码和自放大
📋 详细解读论文解读论文对自我进化LLM Agent系统进行系统性安全与隐私分析,组织化呈现新型威胁格局。核心创新在于揭示对抗性影响如何在无持续攻击者介入的情况下永久编码、自我放大和跨代传播。对比传统Agent系统,该分析强调自进化能力引入的质变威胁,为安全设计提供理论框架。
|
|
|
2026-06-22
💡 一句话总结
识别并形式化LLM Agent记忆系统中的记忆传染现象:评估偏差的跨时间传播
📋 详细解读论文解读论文发现并形式化了Memory Contagion现象,即评估者偏差通过Agent记忆跨时间传播。核心创新在于揭示现有记忆研究假设的缺陷:记忆被认为源自无偏体验。实验表明在持续整合过程中,Agent记忆会因偏差传播而逐渐退化,为理解Agent长期可靠性提供新视角。
|
|
|
2026-06-22
💡 一句话总结
研究LLM Agent技能市场中的恶意技能检测问题,提出基于注意力机制的防御方法
📋 详细解读论文解读论文针对第三方技能可能带来的供应链攻击风险,提出基于注意力分析的恶意技能检测方法。核心创新在于识别技能市场中单点恶意技能即可窃取数据、劫持Agent或建立持久立足点的威胁模型。实验验证了提示注入防御在技能加载环节的局限性,为Agentic系统安全提供新思路。
|
|