📬 Daily Digest

今日推送

2026年08月19日 · 星期三
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Self-Evolving Agent · Long-Horizon Agent · Agent Harness
  📄 arXiv 论文   📕 小红书笔记
Agent Harness
2026-08-18
💡 一句话总结 提出HarnessRisk基准,从全生命周期角度评估Agent Harness安全风险。
📋 详细解读
论文解读论文针对现有安全基准仅关注单一攻击机制的局限,提出HarnessRisk这一全生命周期导向的Agent Harness安全评估基准。核心贡献是构建了涵盖工具管理、持久状态、权限控制等不同Harness职责的安全失败场景库,支持跨设置的安全能力比较。实验评估了多个主流Harness框架,揭示了当前系统在权限隔离和状态管理方面的普遍脆弱性,为LLM代理安全部署提供了系统性评估工具。
Self-Evolving Agent
❤️ 569
💡 内容总结 澳门科技大学AI与机器人控制导师招生
Self-Evolving Agent
2026-08-18
💡 一句话总结 审计金融场景中自进化代理的能力提升、安全漂移和执行接口匹配问题。
📋 详细解读
论文解读论文研究自进化代理在金融应用中可能带来的安全隐患,对SkillOpt、Agent Workflow Memory和ReasoningBank三个系统进行系统性审计。核心创新是提出执行接口匹配的审计方法,揭示代理进化后可能丢失原有安全行为或产生新的攻击面。实验发现自进化机制在提升任务能力的同时普遍存在安全漂移问题,为金融代理的安全部署提供了重要警示和评估框架。
Self-Evolving Agent
❤️ 500
💡 内容总结 教授本人招生|上海交大AI学院 大模型自进化
LLM Agent
2026-08-18
💡 一句话总结 提出EvoTS-Agent自进化LLM代理,实现金融时序变化点检测的自动化模型选择。
📋 详细解读
论文解读论文针对金融时序数据非平稳性导致单一算法难以泛化的问题,提出自进化LLM代理EvoTS-Agent,能够将专家驱动的模型选择、特征设计和超参数调优自动化。核心创新在于代理可根据不同资产和市场环境自主调整检测策略,实现跨场景的一致性表现。实验表明该方法在多种金融数据上显著优于传统专家驱动流程,提升了变化点检测的适应性和可扩展性。
Long-Horizon Agent
❤️ 174
💡 内容总结 研0暑假做了一个电商售后场景的Agent项目
LLM Agent Long-Horizon Agent
2026-08-18
💡 一句话总结 提出Agentic ESOpt方法,低GPU需求下微调长期LLM代理。
📋 详细解读
论文解读论文针对长期代理RL微调的三大瓶颈:反向传播计算重、代理轨迹信用分配难、大模型训练不实际,提出轻量化微调方案Agentic ESOpt。核心创新是设计适合长期代理的稀疏更新机制和层次化信用分配算法,大幅降低训练对GPU资源的需求。实验验证了在有限算力下微调7B以上模型的可行性,为资源受限场景的代理优化提供了新路径。
Agent Harness
❤️ 111
💡 内容总结 AI 评测正在从Benchmark走向 Eval Harness
LLM Agent
2026-08-18
💡 一句话总结 提出任务感知Harness配置优化方法,降低关键基础设施中LLM代理的资源浪费。
📋 详细解读
论文解读论文针对关键基础设施中LLM代理的统一Harness配置导致资源浪费的问题,提出任务感知的Harness动态配置方法。核心创新在于根据任务需求选择性开放信息访问、工具调用和动作执行权限。实验表明该方法在保证任务完成质量的前提下显著降低资源消耗,同时提升安全隔离效果。研究为关键场景下的代理部署提供了高效的配置策略,对实际运维具有重要参考价值。
Self-Evolving Agent
❤️ 91
💡 内容总结 Coding Agents for Robot Learning合集
Agent Harness
2026-08-18
💡 一句话总结 提出Agent Lightning架构,通过解聚合设计连接LLM代理与强化学习训练。
📋 详细解读
论文解读论文介绍了Agent Lightning的完整架构设计,通过解聚合方式将代理系统与强化学习训练解耦,通过LLM端点代理实现灵活连接。核心创新是证明该架构已被后续框架广泛采用,成为代理强化学习的标准范式。研究详细阐述了控制流管理、上下文调度和训练反馈等关键技术,为构建可训练的代理系统提供了系统性方案,推动了代理RL研究的工程化进程。
Self-Evolving Agent
❤️ 84
💡 内容总结 和小伙伴看到了机器人的 "Aha" Moment!
Long-Horizon Agent
2026-08-18
💡 一句话总结 研究长期代理中的本体信任问题,检测任务漂移和累积偏差。
📋 详细解读
论文解读论文聚焦长期代理场景下的本体信任问题,指出代理可能在每步保持局部合理性但整体偏离授权任务。核心创新是提出基于任务本体的追踪方法,能够检测代理轨迹随时间的隐式漂移。研究分析了工具调用、参数推理等环节如何累积偏差,建立了长期运行中的信任评估框架。实验验证了该方法在多步复杂任务中的有效性,为长期运行代理的监督提供了新思路。
Self-Evolving Agent
❤️ 56
💡 内容总结 6分钟讲清多Agent:循环自查提效🚀
Agent Harness
2026-08-18
💡 一句话总结 提出LEGO-RL框架,解决编码代理Harness环境与策略梯度训练的不匹配问题。
📋 详细解读
论文解读论文针对编码代理强化学习中Harness执行环境与训练目标不匹配的问题,提出LEGO-RL框架。核心创新是设计Harness原生训练机制,通过环境隔离和奖励信号净化解决环境崩溃和奖励作弊问题。实验表明该方法显著提升了编码代理的强化学习训练稳定性和最终性能,为构建可靠的编码代理训练流水线提供了系统性解决方案。
LLM Agent
❤️ 52
💡 内容总结 Agentic ESOpt是Agent Fine-tune的未来吗?
LLM Agent
2026-08-18
💡 一句话总结 提出D²ACCI双循环诊断协议,定位代理记忆多阶段管道的故障环节。
📋 详细解读
论文解读论文针对LLM代理持久记忆多阶段管道难以定位故障的问题,提出双循环诊断协议D²ACCI。核心创新是通过 ingesting、retrieval、filtering、generation 各阶段的独立监控,实现端到端错误的精确定位。研究设计了针对性的诊断探针和评估指标,实验表明该方法能有效识别记忆管道中的性能瓶颈,为代理记忆系统的优化提供了诊断工具。
LLM Agent
❤️ 52
💡 内容总结 把 Agent 的执行轨迹画出来
Agent Harness
2026-08-18
💡 一句话总结 提出StartupBench基准,用市场验证的端到端工作流评估通用代理。
📋 详细解读
论文解读论文指出现有代理基准依赖研究者设定任务,可能无法反映真实用户需求,因此提出StartupBench这一基于市场验证工作流的评估基准。核心贡献是收集真实创业场景中的端到端任务,建立更贴近实际需求的评估体系。研究评估了多种LLM代理在真实创业工作流上的表现,揭示了当前代理能力与实际需求之间的差距,为代理发展提供了更实用的评估方向。
LLM Agent
❤️ 34
💡 内容总结 逼自己30天学会,其实你很会Agent智能体