| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-06-28
💡 一句话总结
提出RESOURCE2SKILL框架,从多模态资源中提取可执行Agent技能
📋 详细解读论文解读论文研究如何充分利用多模态人力资源为Agent构建技能库。指出现有技能库多为手工编写或文本中心,视频等富多模态资源未被充分利用。核心创新是提出RESOURCE2SKILL框架,通过知识蒸馏将教程视频等多模态资源转化为可执行技能。在多个基准上验证了该方法能有效提取高质量、泛化能力强的Agent技能,显著扩展了技能库的覆盖范围。
|
|
|
2026-06-29
💡 一句话总结
提出本体感受仪表板概念,让LLM Agent自管理上下文窗口以突破工具调用瓶颈
📋 详细解读论文解读论文针对长程工具Agent受上下文窗口限制的问题展开研究。指出当前上下文管理方案存在学习压缩策略丢失证据或Agent无法感知管理过程的缺陷。核心创新是提出proprioceptive dashboard,让前沿模型能"感知"自身上下文状态,实现自我管理的上下文压缩。在ALFWorld等基准上验证了该方法能有效维持外部记忆,显著提升长程任务完成率。
|
|
|
2026-06-29
💡 一句话总结
提出WorldEvolver框架,通过自演化世界模型提升LLM Agent的长程规划能力与前瞻可靠性
📋 详细解读论文解读论文研究如何让LLM Agent具备可靠的前瞻能力。提出WorldEvolver自演化世界模型框架,在部署时持续修订上下文,同时保持下游Agent不变。核心创新在于解决不可靠前瞻被忽略或误用的问题,通过自我演化机制提升世界模型质量。实验表明该框架显著改善了长程任务规划的效果,减少了因错误预测导致的决策退化。
|
❤️ 108
💡 内容总结
介绍Agents-A1,35B MoE Agent专注于长流程任务连续执行,在long-horizon agent tasks上逼近更大规模模型表现。
|
|
2026-06-28
💡 一句话总结
提出TraceRetain框架,通过可解释特征评分实现LLM Agent的选择性记忆保留
📋 详细解读论文解读论文研究外部记忆对长程LLM Agent的作用与何时真正需要记忆保留。提出TraceRetain轻量框架,通过可解释特征(成功率、年龄、访问频率、冗余度等)对记忆条目评分。核心创新是在容量受限时驱逐最低分条目,平衡记忆质量与效率。在ALFWorld上验证了该方法在冻结模型下能有效利用外部记忆,显著提升长程任务表现。
|
|
|
2026-06-28
💡 一句话总结
构建多数据集基准,系统评估LLM Agent在微服务故障诊断中的推理能力
📋 详细解读论文解读论文针对当前LLM Agent评估过于关注最终答案的问题,提出AIOps多模态可观测性数据集。核心创新是引入过程导向评估,不仅评分最终答案,还追踪故障诊断中的系统推理链路。包含AIOps20等多个大规模数据集,在微服务故障诊断场景验证了评估方案的有效性,为Agent运维能力提供了更全面的评测标准。
|
❤️ 6
💡 内容总结
UIC发表ARGUS基准测试,系统性评测GUI Agent的35种不确定性量化方法,揭示上下文感知UQ方法选择的必要性。
|
|
2026-06-28
💡 一句话总结
提出PolicyGuard验证器,确保LLM Agent在多轮对话中遵循组织策略
📋 详细解读论文解读论文将Agent策略遵循问题从简单防护扩展到完整工作流。指出现有方案仅作为外部拦截器,无法处理多轮交互中的策略一致性需求。核心创新是提出对话锚定的子Agent验证器,在多轮交互中追踪策略合规性。在企业客服等场景验证了该方法能有效防止Agent在长程对话中偏离组织策略,显著提升合规性。
|
|
📋 详细解读论文解读论文研究如何让LLM Agent在缺乏先验知识的新型领域有效行动。指出当前Agent依赖参数知识或检索的范式在面对新问题时失效。核心创新是提出层级实验Agent架构,结合主动实验设计与推理能力。在物理定律探索等新领域场景验证了该方法能通过与环境交互获取新知识,显著扩展了Agent在开放世界中的能力边界。
|
❤️ 18
💡 内容总结
整理Codex 10个实用Skills,包括superpowers方法论、skill-creator封装、frontend-design生成等专业工具。
|
|
2026-06-29
💡 一句话总结
提出EPC诊断框架,检测LLM评估器中的多模态偏好崩溃现象
📋 详细解读论文解读论文发现专有LLM评估器的测量有效性可能在数周内失效的问题。提出EPC诊断框架,包含多模态偏好崩溃指数、评估器耦合矩阵和Jensen-Shannon散度三个组件。核心创新是通过8种实验条件共122个独立重复实验,系统追踪评估器与Agent的自适应耦合动态。研究表明在特定条件下会出现多模态偏好崩溃,为构建更可靠的Agent自我改进系统提供了诊断工具。
|
|
|
2026-06-29
💡 一句话总结
提出神经程序记忆机制,通过隐式激活转向赋予LLM Agent持久化程序能力
📋 详细解读论文解读论文研究如何将LLM从静态求解器转变为自主Agent。指出当前Agent缺乏持续的程序记忆能力,现有RAG方案主要注入显式文本指南。核心创新是提出Neural Procedural Memory机制,通过隐式激活转向让模型获得持久化程序记忆。在多步交互环境中验证了该方法能显著提升Agent的任务迁移能力和长期性能表现。
|
|
|
2026-06-29
💡 一句话总结
研究多党场景下LLM Agent的忠诚度问题,提出超越"帮助对话者"的代理原则
📋 详细解读论文解读论文针对日益增长的多党LLM Agent场景展开研究。在Agent同时服务委托方并与第三方交互的场景中(如与供应商谈判、筛选请求),传统的"帮助当前对话者"目标不再适用。核心创新是提出多党委托忠诚度框架,明确Agent应首先服务于委托方利益,同时合理处理与第三方的交互。在多种多党场景下验证了该原则能有效指导Agent行为。
|
|