📬 Daily Digest

今日推送

2026年08月13日 · 星期四
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Self-Evolving Agent · Long-Horizon Agent · Agent Harness
  📄 arXiv 论文   📕 小红书笔记
LLM Agent
2026-08-12
💡 一句话总结 提出轨迹适配的不确定性量化方法,评估LLM代理多轮交互中的决策置信度
📋 详细解读
论文解读论文将不确定性量化方法从单轮输出扩展到LLM代理的交互轨迹层面。核心创新在于考虑代理可提问、调用工具、更新状态等多轮决策过程,分析中间决策误差如何传播影响最终结果。实验对比多种不确定性量化方法在代理任务中的有效性,为评估代理可靠性提供新指标。
LLM Agent
❤️ 37
💡 内容总结 Self-Evolving Code Agent论文合集,涵盖SWE-RL、Anchored Self-Play等最新研究,详解agent自博弈训练范式
arxiv
2026-08-12
💡 一句话总结 提出ToolHazard框架,构建可扩展对抗环境评估LLM代理安全和对齐问题
📋 详细解读
论文解读论文针对LLM代理集成外部工具时的提示注入攻击问题,提出ToolHazard框架实现可扩展对抗环境生成。核心创新在于克服现有研究依赖手动实现或LLM模拟的局限,支持跨领域大规模安全评估。实验揭示代理对间接提示注入的脆弱性,为安全对齐研究提供标准化测试平台。
Agent Harness
❤️ 1
💡 内容总结 DeepSeek Harness完整解析,Model加Harness才是真Agent,深度绑定V4 Pro支持自进化优化
LLM Agent
2026-08-12
💡 一句话总结 实证研究揭示代理技能对LLM代理的双面影响,发现技能可能降低任务成功率
📋 详细解读
论文解读论文系统研究代理技能扩展LLM代理过程中产生的负面效应。通过大规模实验发现:部分技能提高成功率,部分无效甚至降低成功率,同时增加token消耗和执行时间。核心创新在于揭示技能对代理行为的塑造机制,提出技能质量评估框架,为构建可靠代理系统提供重要指导。
Agent Harness
❤️ 14
💡 内容总结 OneDayAgent提出长程开放式任务框架,通过三重机制解决目标漂移、状态丢失和跨环境转移失败问题
LLM Agent
2026-08-12
💡 一句话总结 构建BENCH2ROBUST框架,通过受控错误注入训练代理策略感知能力应对工具失败
📋 详细解读
论文解读论文针对工具调用LLM代理在真实环境中工具可能失败的问题,提出BENCH2ROBUST框架将标准基准转换为对抗性训练环境。核心创新在于训练代理学习三种策略:重试、切换或放弃,而非简单重复调用。实验证明该方法显著提升代理在工具不可靠场景下的鲁棒性,为实际部署提供可靠保障。
LLM Agent
❤️ 83
💡 内容总结 Self Improving Agent Harness七篇方法论总结,涵盖Meta-Harness、AHE等框架,揭示harness如何决定agent表现
arxiv
2026-08-12
💡 一句话总结 提出GPU环境下LLM代理控制路径优化方法,形式化ready-cohort边界以提升并行计算效率
📋 详细解读
论文解读论文研究LLM-agent服务中模型调用和工具交互的GPU计算优化问题。核心创新在于形式化定义ready-cohort边界,通过固定分区共享F和精确离线共享P来分析控制路径的并发工作暴露程度。实验表明,当GPU计算路由决策保留在设备上时,可显著减少主机往返开销,为LLM代理服务的部署提供新的性能优化思路。
Self-Evolving Agent
❤️ 15
💡 内容总结 Harness-R1论文解读,不改agent模型参数而训练harness engineer,根据失败轨迹自动修改运行时harness
Long-Horizon Agent
2026-08-11
💡 一句话总结 应用泛化理论分析代理评估,指出排行榜排名的是专精化而非能力
📋 详细解读
论文解读论文针对企业实践中将代理排行榜等同于能力排名的误区,基于三个开放代理基准进行实证分析。核心发现是代理主效应在总方差中占比不足3%,代理-任务交互效应占7-23%,表明排行榜反映的是专精化程度而非通用能力。创新意义在于为长周期代理评估提供方法论框架,指导更可靠的性能评估。
Long-Horizon Agent
❤️ 24
💡 内容总结 阿里LongHorizon-Harness论文解读,用MEA循环机制解决长程任务状态追踪问题,WeaveBench提升28.9pp
LLM Agent
2026-08-11
💡 一句话总结 对比分析不同技能学习方法,论证编程式技能学习在成本效益上的最优性
📋 详细解读
论文解读论文探索LLM代理适配新领域时的成本效益问题,对比多种技能学习方法。核心创新在于从成本视角而非纯性能视角评估技能学习策略,论证编程式技能学习方法在保持性能的同时最大程度降低资源消耗。实验结果表明该方法可显著减少token使用和执行时间,为资源受限场景提供实践指导。
Self-Evolving Agent
❤️ 106
💡 内容总结 做Agent自进化前,一定要看CS329A。。
LLM Agent
2026-08-11
💡 一句话总结 将金融分析框架映射为专家代理,通过对比研究验证LLM专业化的有效性
📋 详细解读
论文解读论文研究LLM专业化在金融分析任务中的价值,将16维度欧洲上市房地产分析框架映射为8个专家代理。核心创新在于对比整体提示与专家分解提示的效果差异,探索数值操作和综合判断是否需要特定领域优化。实验表明专业化提示在特定任务上优于通用提示,为垂直领域代理设计提供参考。
Agent Harness
❤️ 99
💡 内容总结 小红书Agent开发一面面经
LLM Agent
2026-08-12
💡 一句话总结 揭示技能选择和规划中的控制漏洞,指出第三方技能可能导致资源浪费
📋 详细解读
论文解读论文研究基于技能的LLM代理中第三方发布者可能引入的控制问题。核心发现是技能描述用于选择、指令体用于规划这一渐进式披露设计存在两个顺序控制点漏洞,恶意发布者可通过静态技能将正确任务导向不必要的高成本路径。创新在于系统分析技能供应链安全风险,为可信技能验证提供理论依据。
Long-Horizon Agent
❤️ 85
💡 内容总结 RL可能只是在追回SFT丢掉的OOD能力
LLM Agent
2026-08-12
💡 一句话总结 提出SQL检索增强生成的动态超图方法,改善结构化约束和多跳推理能力
📋 详细解读
论文解读论文针对现有密集检索在处理结构化约束和多跳推理方面的局限,提出基于查询时动态超图的SQL检索增强生成方法。核心创新在于构建在线知识图谱避免离线图方法的知识碎片化问题,支持增量更新。实验表明该方法在复杂SQL生成任务上优于传统RAG基线,为结构化数据检索提供新思路。
Self-Evolving Agent
❤️ 77
💡 内容总结 目前最好的agent框架学习项目适合写在简历