| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-08-19
💡 一句话总结
构建FM-Bench基准测试,评估LLM agent在长周期决策场景中的持续决策能力。
📋 详细解读论文解读论文提出FM-Bench基准,通过模拟足球俱乐部管理20年游戏时间,测量LLM agent在长周期环境中的决策能力。研究聚焦于动作累积后果和环境响应下的持续决策,而非单步任务执行。基准包含26个工具和340-400个决策点,为评估agent长期规划能力提供了标准化测试环境,填补了长程agent评估的空白。
|
|
|
2026-08-19
💡 一句话总结
提出SkillGate框架,通过策略性强化学习训练agent在长程任务中的技能选择能力。
📋 详细解读论文解读该论文聚焦于长期agent的技能选择问题。研究发现现有outcome-rewarded RL方法无法有效训练技能选择策略,因此提出SkillGate框架,在策略层面训练agent何时读取何种技能。通过将技能选择决策融入agent策略,解决了大规模技能库下的策略性调用难题。实验表明该方法显著提升了长程任务的完成效率。
|
|
|
2026-08-19
💡 一句话总结
提出LEDGER框架,通过声明-证据追溯图实现LLM agent工作流程的可审计性。
📋 详细解读论文解读论文关注LLM agent可观测性问题,提出LEDGER框架构建声明到证据的追溯图。方法将agent的长程技术工作流中的复杂工具调用、代码执行和文件编辑等事件进行结构化追踪。主要创新在于将可验证性与agent执行解耦,实现输出正确性和可信度的后验审计,为agent系统的透明度提供新范式。
|
|
|
2026-08-19
💡 一句话总结
构建CTIFoundry,为LLM agent原生设计网络威胁情报语料库框架。
📋 详细解读论文解读论文针对LLM agent在网络威胁情报场景中的应用,改进语料库设计。当前威胁报告和漏洞数据库仍为RAG场景设计,未考虑agent多步调查需求。CTIFoundry作为agent原生语料框架,旨在支撑查询时的多步骤威胁情报调查。属于应用层面探索,非核心agent能力研究。
|
|
|
2026-08-19
💡 一句话总结
提出CentaurBench,评估LLM辅助而非自动化真实工作任务的性能。
📋 详细解读论文解读论文挑战传统benchmark聚焦自动化任务的范式,提出评估模型辅助能力的新框架。研究关注点从模型独立性能转向提升其他agent或人类工作效率的能力。通过统一评估框架,测量模型在协作场景中的增值作用,属于LLM能力评估研究,非agent核心主题。
|
|
|
2026-08-19
💡 一句话总结
经验分析AI后训练中的缺失,区分LLM agent的执行能力与策略能力。
📋 详细解读论文解读论文通过实证分析探讨AI后训练的现状与不足。研究区分了LLM agent的两类能力:执行级能力(在选定策略内迭代)和策略级能力(修订高层判断)。提出AI-for-AI愿景中存在的概念混淆问题。属于AI训练方法论研究,虽涉及agent但非核心主题。
|
|
|
—
|
|
|
—
|
|
|
—
|
|
|
—
|