| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-05-22
💡 一句话总结
提出OpenSkillEval基准,系统审计开源技能生态中LLM Agent与技能的交互质量与泛化能力
📋 详细解读论文解读本文提出OpenSkillEval框架,自动审计开放技能生态中不同LLM模型和Agent框架与技能(skills)的交互效果。研究问题聚焦于如何评估技能质量、模型适配性及用户选择指导。核心创新在于构建系统化评估流程,覆盖技能调用、任务执行和结果验证三大维度。实验表明,当前主流模型在技能泛化上存在显著差距,为开源技能生态的规范化发展提供评测基础。
|
❤️ 19
💡 内容总结
Princeton+Google的Continual Harness论文,让AI边打游戏边改自己的作战指挥系统,实现自我进化
|
|
2026-05-22
💡 一句话总结
提出QGP指标和PushBench基准,测量和强化长时程LLM Agent的定量目标坚持能力
📋 详细解读论文解读本文研究长时程LLM Agent在工具调用中的定量目标坚持(QGP)问题,提出PushBench基准进行量化评估。研究问题为Agent为何能做出看似合理的局部工具调用却无法坚持完成目标计数。核心创新在于定义QGP指标,将外部验证器引入工作单元完成判定。实验揭示当前Agent普遍存在目标坚持缺陷,为长时程任务优化提供评估标准。
|
|
|
2026-05-22
💡 一句话总结
通过因果归因和结构异常检测对中毒的LLM Agent记忆进行后验审计
📋 详细解读论文解读本文针对LLM Agent持久化记忆机制的安全漏洞,提出MemAudit框架进行后验审计。研究问题为如何检测被恶意注入的恶意记忆记录对Agent行为的影响。核心创新在于结合因果归因和结构异常检测方法,无需先验知识即可识别异常记忆模式。实验表明该方法能有效识别多种记忆投毒攻击,为Agent安全部署提供审计工具。
|
|
|
—
|
|
|
—
|
|
|
—
|
|
|
—
|
|
|
—
|
|
|
—
|
|
|
—
|
|