| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-07-12
💡 一句话总结
提出Agentic-DPO方法,从模仿学习转向基于专家轨迹的Agent策略优化,提升LLM Agent决策能力。
📋 详细解读论文解读论文研究LLM Agent从专家轨迹中学习的问题。传统SFT方法仅模仿动作序列,无法让Agent学会在每个状态下选择正确动作应对错误。作者提出Agentic-DPO,将专家轨迹转化为偏好对,通过直接偏好优化训练Agent学会选择优于对抗性错误的动作。实验表明该方法在多个Agent基准上显著优于SFT和现有在线学习方法。
|
—
|
|
2026-07-11
💡 一句话总结
构建AgentAbstain基准系统,评估LLM Agent是否知道在何时应该拒绝行动。
📋 详细解读论文解读论文指出当前LLM Agent评估主要关注任务成功率,忽视Agent是否知道何时应该放弃行动或承认失败。作者提出第一个系统性评估Agent'知情放弃'能力的基准。在模糊性、冲突约束或工具失败等情况下,正确识别并避免执行可能导致不可逆后果的行动与成功完成任务同样重要。实验揭示当前Agent在这一关键能力上的显著不足。
|
—
|
|
2026-07-11
💡 一句话总结
提出网络操作场景的间接提示注入攻击基准NetInjectBench,评估工具型LLM Agent安全性。
📋 详细解读论文解读论文指出工具型LLM Agent在网络运维中面临间接提示注入风险。工单、告警、日志、runbooks和ChatOps消息可能携带恶意注入内容。作者提出NetInjectBench,包含130个场景的基准测试,分离不受信任的artifact文本、信任的策略元数据和评估标签,涵盖40个良性、40个弱攻击和40个强攻击场景,用于评估Agent抵御间接提示注入的能力。
|
—
|
|
2026-07-12
💡 一句话总结
提出渐进式加载感知对比学习方法,检测Agent Skills中的跨层错位问题。
📋 详细解读论文解读论文研究LLM Agent Skills的质量检测问题。随着开源技能市场扩展,用户和Agent越来越依赖简短元数据选择第三方技能,难以检测技能描述与实际执行之间的不一致。作者提出渐进式加载感知对比学习方法,通过对比学习检测技能元数据与实际行为之间的错位,帮助用户和Agent做出更可靠的技能选择决策。
|
—
|
|
2026-07-12
💡 一句话总结
构建Mafia游戏测试平台,用于测量LLM Agent的心理理论和社交推理能力。
📋 详细解读论文解读论文指出LLM Agent的公共行为难以揭示其社交推理:投票正确的Agent可能在猜测,善于说谎的Agent不会留下其真实信念的痕迹。作者提出MafiaScope,将社交推理游戏Mafia转化为测量机器心理理论的仪器。每次公开发言后,每个Agent私下回答关于其他玩家信念的问题,为研究者提供Agent内部信念的测量窗口。
|
—
|
|
2026-07-13
💡 一句话总结
提出工具侧内存机制实现LLM Agent工具知识的跨任务复用和共享。
📋 详细解读论文解读论文研究LLM Agent工具使用的知识共享问题。现有方法在Agent侧通过参数更新、提示优化或Agent侧内存来改进工具使用,导致工具知识难以共享且仅限于过去任务中观察到的行为。作者提出ToolAtlas,将可复用工具知识存储在工具侧,使不同下游Agent能共享和复用工具知识,无需每个Agent单独学习。
|
—
|
|
2026-07-13
💡 一句话总结
提出分层架构解决LLM Agent工具选择的决策空间爆炸问题,实现高效的Agent编排。
📋 详细解读论文解读论文针对LLM Agent工具选择中的架构瓶颈问题。当Agent拥有扁平的单体工具注册表时,模型需同时评估数百或数千个选项,导致决策空间爆炸、上下文窗口饱和和路由准确性下降。作者提出形式化分层架构,采用基于栈的执行和惰性发现机制,将工具按层次组织,使Agent能高效定位和选择合适工具。
|
—
|
|
2026-07-13
💡 一句话总结
提出多Agent LLM系统用于自动化教科书审核,同时检查事实准确性、技术正确性和语言质量。
📋 详细解读论文解读论文研究教育材料质量审核问题。教科书审核需要同时检查事实准确性、领域技术正确性和语言质量,通用语法检查工具无法胜任。作者提出AI Textbook Auditor,一个模块化的多Agent LLM管道,通过不同Agent分别负责不同维度的审核,最终综合给出质量评估。实验表明该系统在多个学科教科书上能有效发现各类质量问题。
|
—
|
|
2026-07-13
Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents
💡 一句话总结
提出编译式标准操作程序和Capability-Gated运行时,使LLM Agent能安全遵循企业级SOP。
📋 详细解读论文解读论文研究企业Agent如何遵循长时域、条件性、安全关键的标准操作程序(SOP)。作者将机器可读的SOP约束编译为可执行伪代码,运行在程序引导的栈机上,栈机在LLM执行语义时对活动帧进行分页。通过三臂SOPBench研究区分表示和运行时,证明编译表示和运行时机制的有效性。
|
—
|
|
2026-07-13
💡 一句话总结
提出生产级LLM Agent的自动化红队测试方法,通过Agent对抗Agent发现安全漏洞。
📋 详细解读论文解读论文针对Claude Code、Codex等生产LLM Agent的安全测试问题。由于这些Agent操作不受信任的内容、文件和命令,安全失效可直接导致危害。现有方法主要优化攻击成功率和保留攻击产物。作者提出自动化红队方法,让一个Agent对抗另一个Agent,持续发现安全弱点并更新攻击payload,保持与模型和工具演进同步。
|
—
|