| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-08-25
💡 一句话总结
深入分析三个开源编码 Agent 工具链的源码级架构趋同性,揭示工具链而非模型成为行为约束的关键因素。
📋 详细解读论文解读论文对三个开源编码 Agent 工具链进行源码级多案例研究,分析其架构设计。指出 Agent 工具链(构建模型上下文、管理工具、运行循环、持久化状态的周围代码)是决定 Agent 行为的关键层,而非被包裹的模型本身。核心创新在于揭示工具链层正成为 Agent 行为的绑定约束,并识别三个工具链的架构趋同模式。为理解 Agent 系统设计提供重要洞察。
|
|
|
2026-08-25
💡 一句话总结
EviDx 构建证据感知的主动诊断 LLM Agent 系统,模拟临床医生的证据获取与假设更新过程。
📋 详细解读论文解读论文针对医学诊断中证据获取的主动性问题,批评现有 LLM 诊断系统仅做静态预测。提出 EviDx,一种证据感知的主动诊断框架,模拟临床医生获取证据、更新竞争假设、判断证据充分性的过程。核心创新在于将诊断建模为交互式证据寻求过程,使用 LLM Agent 主动查询检验假设。实验验证了该方法在诊断准确性和证据效率上的优势。
|
❤️ 6
💡 内容总结
通过system消息给Agent设定人设的方法论,演示如何在DeepSeek Harness中通过配置实现Agent角色定制和风格控制
|
|
2026-08-25
💡 一句话总结
Meta^n 通过递归输入而非操作本身实现元深度突破,解决自改进系统的稳定性与深度矛盾。
📋 详细解读论文解读论文指出当前自改进 LLM Agent 只改进答案而不改进生成过程,系统元层级固定,递归自编辑存在稳定性约束(需保留部分编辑机制)。提出 Meta^n 架构,保持元操作固定,改为递归操作输入而非操作本身,从而实现更深层级的元改进。核心创新在于打破传统元改进范式,实现接近任意深度的元递归。理论分析和实验验证了方法的可行性。
|
|
|
2026-08-25
💡 一句话总结
StarHarness 通过分层搜索进化企业环境 Agent 工具链,保持模型权重固定实现环境适配。
📋 详细解读论文解读论文提出 StarHarness 框架,用于在保持模型权重固定的情况下进化环境特定的 Agent 工具链。进化后的工具链可包含提示工程、任务框架、工具接口、技能、MCP 支持提供者和子代理结构等组件。核心创新在于通过分层任务分组(按基线失败行为划分)构建紧凑进化池,显著提升进化效率。实验表明该方法能在企业级任务中实现高效的工具链适配。
|
❤️ 11
💡 内容总结
DeepResearch Agent Harness是一套多智能体编排系统,融合GraphRAG、Web Search和持久化Memory,解决复杂研究任务的工程化问题
|
|
2026-08-25
💡 一句话总结
提出 Recuris 架构,通过递归体验-工作记忆解决长程任务中的状态追踪与技能调用错位问题。
📋 详细解读论文解读论文研究长程任务中递归自改进(RSI)的难题,即历史增长导致任务状态模糊和技能调用错位。提出 Recuris,一种递归体验-工作记忆架构,用于长程 Agent 工具链,工作记忆追踪任务进度并指导技能选择,将技能使用锚定在当前需求上。核心创新在于通过递归机制分离任务状态与技能库,实现动态技能调用。在多步长程基准测试中验证了方法有效性。
|
❤️ 85
💡 内容总结
PostTrainBench提出无梯度后训练评测框架,让Agent自主设计和执行模型优化过程,探索LLM Agent的自进化能力
|
|
2026-08-25
💡 一句话总结
提出分层 LLM Agent 中的贝叶斯自升级机制,在推理过程中动态判断升级时机以平衡成本与性能。
📋 详细解读论文解读论文研究 LLM Agent 系统的委托决策问题,区别于传统的路由前决策或验证后重试,提出第三种机制:Agent 在推理过程中识别自己可能失败,主动将控制权转移给更强模型。核心创新在于将代内委托建模为贝叶斯最优停止问题,在推理过程中动态决定升级时机。实验表明该方法能在保持性能的同时显著降低计算成本。
|
❤️ 3
💡 内容总结
OpenAI开源Codex Harness核心能力,开发者可基于Codex CLI、SDK等组件构建自己的Agent,竞争从模型转向执行能力
|
|
2026-08-25
💡 一句话总结
分析 LLM Agent 间模型切换的「交接税」问题,揭示非原生轨迹对任务完成质量的影响。
📋 详细解读论文解读论文研究编码 Agent 执行长程任务时,在不同模型间切换(升级到更强模型或降级到便宜模型)的质量权衡。每次切换要求接收方继续前任模型产生的非原生轨迹。核心创新在于定义并量化交接税,分析不同切换策略对任务成本和质量的影响。实验揭示了切换时机和方式对最终任务成功率的关键影响,为实际部署提供指导。
|
❤️ 4
💡 内容总结
lulu-agent开源项目实现本地AI Agent Runtime Harness,包含ReAct Loop执行骨架、分层上下文管理和长期Memory积累
|
|
2026-08-25
💡 一句话总结
PeakBench 基准测试评估 LLM Agent 的资源感知工具调用,填补并行化与调度维度的评估空白。
📋 详细解读论文解读论文指出 LLM Agent 通过工具调用解决问题,但现有基准主要评估工具选择、参数生成和串行执行成功率,忽略并行化和资源约束调度。提出 PeakBench 基准,聚焦资源感知工具调用中的并行执行与调度决策。核心创新在于填补 Agent 评估中缺失的调度维度,覆盖多种并行化场景和资源约束条件。基准测试揭示了当前 Agent 在调度能力上的不足。
|
|
|
2026-08-25
💡 一句话总结
研究 LLM Agent 工作流中的约束削弱机制,解决中间语言制品中未解决条件的处理问题。
📋 详细解读论文解读论文研究 LLM Agent 通过多角色、多阶段工作流协调复杂任务时,上游状态如何转化为中间语言制品(摘要、计划、记忆、交接笔记等)。核心问题是话题保留不足以约束动作:制品可能提及未解决的条件。提出约束削弱机制,在下游行动时动态处理上游未完成的条件。核心创新在于建模工作流中的条件依赖传播。实验验证了该方法对工作流执行正确性的提升。
|
|
|
2026-08-25
💡 一句话总结
WebMCP-Phalanx 为浏览器集成的 LLM Agent 强制执行信任边界,防范主体属性欺骗和工具生命周期失控。
📋 详细解读论文解读论文针对 W3C WebMCP 提案使 LLM Agent 能调用网页暴露工具的场景,指出在多方 Web 环境中集成 Agent 面临三个风险:主体属性欺骗、非受控工具生命周期和不足的溯源保证。提出 WebMCP-Phalanx 框架,在浏览器同源策略安全模型中为 Agent 可访问工具建立信任边界。核心创新在于将浏览器安全模型扩展到 Agent 工具调用场景,提供生命周期保证和溯源机制。
|
|