| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-08-26
💡 一句话总结
提出SKILL.state运行时架构,解决Long-Horizon Agent的上下文膨胀和状态管理问题。
📋 详细解读论文解读论文针对Long-Horizon Agent执行复杂任务时对话历史不断膨胀导致的延迟和上下文污染问题,提出SKILL.state运行时架构。核心创新在于通过结构化状态管理替代线性历史追加,使Agent能在长时程任务中保持高效的上下文利用。实验表明该架构能显著降低延迟,减少上下文污染导致的失败,为Long-Horizon Agent的实用化部署提供了关键技术支撑。
|
❤️ 68
💡 内容总结
详细讲解Agent评测不能只测模型输出,需将完整Harness编排逻辑纳入被测对象,并介绍Evaluation Harness的完整评测流水线设计
|
|
2026-08-27
💡 一句话总结
提出PILOT方法,实现Long-Horizon Agent在运行过程中的实时自我改进。
📋 详细解读论文解读论文针对现有自我改进方法仅在执行结束后处理经验的局限,提出PILOT框架实现Long-Horizon Agent的实时自我改进。核心创新在于利用运行中产生的经验同时重定向当前运行和更新模型,使Agent能即时应用和验证所学。实验结果表明该方法能显著提升Long-Horizon任务的成功率,并使Agent能够持续从错误中学习并适应新情况。
|
❤️ 17
💡 内容总结
JIT-Agent通过即时生成专属Harness让任意LLM大幅提分,并能从历史经验中自我进化,DeepSeek-V4-Flash超GPT-5.6
|
|
2026-08-27
💡 一句话总结
提出HarnessLens框架,实现Agent Harness的行为感知式智能演进,降低验证成本。
📋 详细解读论文解读论文针对Agent Harness适应成本高的问题,提出HarnessLens框架。该框架通过行为感知验证,避免对所有候选方案进行完整测试,从而降低验证开销。核心创新在于利用预算感知机制智能分配验证资源,在保持验证准确性的同时显著减少rollout数量。实验表明该方法能高效发现Harness回归问题,为Agent Harness的自动化演进提供了可行路径。
|
|
|
2026-08-27
💡 一句话总结
提出AgentFold系统,实现LLM Agent在蛋白质折叠模型设计中的闭环自主搜索。
📋 详细解读论文解读论文探索LLM Agent能否通过代码修改和计算密集型验证自主改进大型科学ML系统,以蛋白质折叠为研究场景。核心创新在于实现闭环Agentic Search,使Agent能自主进行文献推理、工具使用、实验规划和模型架构修改。实验表明科学LLM Agent能在蛋白质折叠这一复杂领域实现有意义的自主进步,为AI驱动的科学发现提供了新范式。
|
❤️ 8
💡 内容总结
ClawGym II通过复杂Agent Harness稳定执行黑盒强化学习,优化通用智能体在Harness驱动的长程任务中的表现
|
|
2026-08-27
💡 一句话总结
提出BekchiAI平台,同时实现LLM Agent技能测量和运行时行为观察控制。
📋 详细解读论文解读论文针对传统评估仅关注准确率、无法全面测量Agentic Skills的问题,提出BekchiAI基准测试和观察控制平台。核心创新在于同时覆盖工具调用排序、依赖规划、不信任输入判断和论证接地等Agentic Skills的多维评估,并提供运行时行为可视化。该平台使研究者能在一站式环境中测量、观察和控制LLM Agent的执行过程,为Agent能力诊断提供了全面工具。
|
|
|
2026-08-27
💡 一句话总结
提出Agentic Math评估框架,从过程层面评估LLM的Agentic数学推理能力。
📋 详细解读论文解读论文针对现有数学基准仅评估最终答案、无法诊断过程级失败的问题,提出从原子级到Agentic级的可解释评估方法。核心创新在于识别LLM从端到端数学推理向Agentic智能集成的转变,并设计能检测推理过程中逻辑缺陷的评估指标。实验表明该框架能更精准定位LLM数学能力的薄弱环节,为构建鲁棒的数学Agent提供指导。
|
❤️ 17
💡 内容总结
阐述AI评测从Benchmark走向Eval Harness的核心变化:Harness是连接任务、环境、轨迹、评分的完整评测基础设施
|
|
2026-08-27
💡 一句话总结
提出Agentic Data的关键评估维度,为LLM Agent交互数据生成提供系统性指导。
📋 详细解读论文解读论文针对Agentic Data Generation缺乏统一评估框架的问题,提出ACE Lens分析方法,从环境一致性、任务完整性、交互一致性和成功信号可靠性等维度评估数据质量。核心创新在于揭示高质量Agentic Data必须同时满足多个一致性要求,而非简单的数据丰富。实验表明该框架能有效指导数据生成策略,提升LLM Agent在外部环境中的交互学习效果。
|
❤️ 9
💡 内容总结
对比Codex Harness与DeepSeek Harness:前者是统一执行底座,后者强调插件化给开发者更大改造空间
|
|
2026-08-27
💡 一句话总结
提出Persona-Execution Separation架构模式,实现Evolving LLM Agent的可审计性。
📋 详细解读论文解读论文针对治理组织中LLM Agent需要同时满足人格自由演进和执行可追溯的需求,提出Persona-Execution Separation(PES)架构模式。核心创新在于将人格(指令、语气、自我呈现)与执行(状态化、可审计工作)分离到不同信任域,通过受治理的合约桥连接。该架构使组织能在允许Agent人格灵活演进的同时,保持执行操作的完整审计追踪。
|
|
|
2026-08-27
💡 一句话总结
提出DSA编排框架,实现多市场股票研究中LLM Agent的证据感知协同。
📋 详细解读论文解读论文针对股票研究系统需要组装异构证据、暴露数据缺失和控制生成观点的需求,提出DSA证据感知编排框架。核心创新在于组织LLM Agent工作流以协调异构证据、明确暴露数据和模型能力局限、控制生成内容对最终报告的影响。该框架为金融领域的LLM Agent系统提供了从信息收集到报告生成的全流程解决方案,提升了多市场股票研究的系统性和可靠性。
|
|
|
2026-08-27
💡 一句话总结
揭示现有安全机制在Autonomous LLM Agent多轨迹迭代中的失效问题,提出非衰减循环状态方案。
📋 详细解读论文解读论文针对Autonomous LLM Agent在长时间 unattended 运行中的安全问题,揭示现有安全机制仅定义在单一轨迹、跨轨迹安全状态重置的缺陷。核心创新在于提出非衰减循环状态设计,使安全状态能在多次轨迹迭代间持续保持。实验表明该设计能有效防止跨轨迹安全退化,为构建安全的长时程Autonomous Agent提供了理论基础和技术方案。
|
|