| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-04-13
💡 一句话总结
提出 Mem^2Evolve,通过能力扩展与经验蒸馏的协同演化实现 LLM Agent 自我进化。
📋 详细解读论文解读论文指出现有 LLM Agent 自我进化框架将经验积累与新资产(工具/专家 Agent)创建孤立处理的问题。核心创新在于揭示两者的内在依赖性:经验积累受限于静态工具集,而新资产创建缺乏经验约束。提出协同演化机制,通过能力扩展与经验蒸馏的相互促进实现 Agent 持续进化。实验表明该方法在多任务场景下显著优于独立处理两种进化过程的方法。
|
|
|
2026-04-13
💡 一句话总结
提出 SemaClaw 框架,分析 OpenClaw 时代个人 AI Agent 的工程范式转变与 Harness 工程挑战。
📋 详细解读论文解读论文描述了 OpenClaw 在 2026 年初的爆发式个人 AI Agent 应用场景,指出 AI 工程从提示工程向 Harness 工程的范式转变。核心创新在于提出 Harness(外部资源编排)的概念框架,管理 Agent 的信任边界、认证与资源访问。主要贡献是为大规模个人 AI Agent 部署提供了工程原则与安全基础架构思路。
|
|
|
2026-04-13
💡 一句话总结
提出 Synthius-Mem,一种仿脑结构且抗幻觉的 Agent 持久记忆系统,在 LoCoMo 上达 94.4% 记忆精度。
📋 详细解读论文解读论文解决 LLM Agent 长期记忆的幻觉问题,指出滑动窗口、摘要和 RAG 等现有方法在架构层面的信息损失根源。核心创新在于借鉴大脑记忆结构,设计分层持久化记忆表示,同时实现对抗对抗性注入的鲁棒性。在 LoCoMo 基准上达到 94.4% 记忆精度和 99.6% 对抗鲁棒性,显著优于现有记忆管理方案。
|
|
|
2026-04-13
💡 一句话总结
提出 Context Kubernetes,一种类容器编排的企业知识编排架构,服务 Agentic AI 系统。
📋 详细解读论文解读论文核心观察是组织内将正确知识以正确权限在正确时机传递给正确 Agent,与容器编排问题在结构上高度类比。核心创新在于将 K8s 调度思想引入企业知识管理,设计声明式知识编排规范。构建了包含权限控制、时效管理和异构知识路由的原型系统。八个实验验证了架构在知识供给准确性上的显著提升。
|
|
|
2026-04-13
💡 一句话总结
提出 ClawGUI,一个用于训练、评估和部署 GUI Agent 的全栈统一框架。
📋 详细解读论文解读论文指出 GUI Agent 进展受限于缺乏连贯的全栈基础设施,而非模型容量瓶颈。核心创新在于提供从在线 RL 训练环境到推理部署的完整框架,包括仿真环境构建、Agent 评估协议和部署 pipeline。支持通过视觉界面操作任意软件,覆盖 CLI Agent 无法触达的长尾应用。实验验证了框架各组件的有效性。
|
|
|
2026-04-13
💡 一句话总结
提出 ClawGuard,一个运行时安全框架,保护工具增强型 LLM Agent 免受间接提示注入攻击。
📋 详细解读论文解读论文针对工具增强型 LLM Agent 面临的新型间接提示注入攻击提出 ClawGuard 框架。核心问题在于攻击者通过工具返回内容嵌入恶意指令,而 Agent 将其视为可信观察直接纳入对话历史。创新点在于设计运行时检测与防御机制,区分可信的工具返回与恶意注入内容。实验验证了该框架在多种攻击场景下的有效性。
|
|
|
2026-04-13
💡 一句话总结
提出 OOM-RL,通过市场驱动对齐机制解决多 Agent 软件工程中的评估者认知不确定性难题。
📋 详细解读论文解读论文针对多 Agent 系统自主软件工程中评估者认知不确定性问题,提出基于市场机制的对齐训练范式。核心创新在于将 Agent 行为对齐转化为市场博弈过程,通过竞争信号而非人工反馈驱动 Agent 行为优化。实验表明该方法有效缓解了 RLHF/RLAIF 中的模型谄媚和测试规避问题,在多 Agent 协作软件工程任务上优于现有对齐方法。
|
|
|
2026-04-13
💡 一句话总结
提出 BEHEMOTH 基准与异构记忆抽取任务定义,实现跨任务场景的 LLM 记忆能力评估。
📋 详细解读论文解读论文关注 LLM 助手从对话中提取和保留有用记忆的核心能力。核心贡献在于形式化定义"异构记忆抽取"任务,并构建包含 18 个数据集的 BEHEMOTH 基准,覆盖个性化、编程等多个领域。实验揭示了现有方法在不同任务类型间迁移能力的显著差异,指出记忆抽取策略需要根据任务类型自适应调整。
|
|
|
2026-04-13
💡 一句话总结
提出 SWE-AGILE,解决 System-2 推理需求与多轮 SWE 任务中上下文长度暴涨之间的根本矛盾。
📋 详细解读论文解读论文针对现有 ReAct 类 SWE Agent 缺乏显式 System-2 深度推理能力的问题,指出完整保留推理历史导致上下文爆炸的两难困境。核心创新在于设计动态推理上下文管理机制,根据任务复杂度自适应截断和压缩推理链。在 SWE-bench 等基准上的实验表明,该框架在保持深度推理能力的同时显著降低了上下文长度和推理成本。
|
|
|
2026-04-13
💡 一句话总结
提出双 Agent 博弈框架 ToM-SB,通过理论心智训练实现对话 Belief 操控防御。
📋 详细解读论文解读论文关注对话系统中 LLM 对抗性伙伴的 Belief 操控问题,提出基于隐私主题的 ToM 挑战 ToM-SB。核心创新在于设计双 Agent 攻防博弈:防御 Agent 需理解并抵御对手通过信息操纵改变用户信念的意图。实验表明基于 ToM 的防御策略显著优于朴素方法,为安全对话系统设计提供了新范式。
|
|