| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-05-15
💡 一句话总结
系统揭示LLM Agent系统中技能库的缩放定律,为技能路由与演化提供理论指导。
📋 详细解读论文解读论文基于15个前沿LLM、1141个真实技能和300万次路由决策的实验数据,发现两条耦合缩放定律:路由精度随技能库规模对数衰减,执行效能随技能丰富度幂律提升。核心创新包括:精确的路由误差分析模型、揭示错误从近邻技能向远邻技能蔓延的规律、以及技能库规模对不同能力维度差异化影响。结论为大规模技能库设计提供量化指导,指出100-1000量级技能库是关键转折点。
|
|
|
2026-05-16
💡 一句话总结
提出SkillTTA方法,实现测试时自适应技能合成,使LLM Agent能动态生成任务特定临时技能。
📋 详细解读论文解读论文解决静态技能库无法满足测试时任务特殊需求的难题。提出SkillTTA(Test-Time Adaptive Skill Synthesis),通过检索相关训练轨迹并将其合成为临时任务特定文本技能。方法保持Solver模型固定,仅在推理时动态组装技能。核心创新包括轨迹相似度检索机制和技能合成prompt设计。实验证明该方法在多种任务类型上显著优于静态技能库基线,尤其在分布外任务上优势明显。
|
|
|
2026-05-18
💡 一句话总结
提出HASP框架,通过Skill Programs实现LLM Agent对可执行技能的结构化调用与自适应规划。
📋 详细解读论文解读论文指出现有技能常以文本指导形式存在,缺乏明确的干预机制。提出HASP(Harnessing LLM Agents with Skill Programs)框架,将技能编码为可执行程序并明确指定调用时机和方式。核心创新在于设计了技能程序的语言规范,使Agent能在执行循环中精确触发技能介入。实验表明HASP显著提升Agent在复杂长时序任务中的表现,技能调用准确率较基线提升显著。
|
❤️ 139
💡 内容总结
深入分析多轮Agent RL中context compression后的trajectory处理策略,探讨prefill变化对训练的影响。
|
|
2026-05-18
💡 一句话总结
提出SkillsVote框架,实现Agent技能全生命周期治理,涵盖收集、推荐与演化三个阶段。
📋 详细解读论文解读论文针对开放技能生态中冗余、不均衡、环境敏感的技能管理难题,提出SkillsVote框架。将Agent技能建模为耦合可执行脚本和非执行指导的经验模式,支持技能的全生命周期治理。核心创新包括:提出技能质量评估机制、基于使用反馈的技能推荐、以及可控的技能更新策略。实验验证了框架能有效防止低质量技能污染上下文,同时保持技能库的多样性和时效性。
|
|
|
2026-05-18
💡 一句话总结
提出SkillGenBench基准,全面评估LLM Agent从仓库和文档中生成可复用、可执行技能的能力。
📋 详细解读论文解读论文系统研究了大语言模型智能体自动生成技能(Skill Generation)的挑战,指出现有基准只评估技能使用而非技能生成。构建了SkillGenBench,包含从代码仓库和文档生成技能的任务,并设计了正确性、可复用性和可执行性三个维度的评估指标。实验覆盖多种LLM,发现生成高质量可执行技能仍是显著瓶颈,为后续技能生成研究提供标准化评估框架。
|
|
|
2026-05-16
💡 一句话总结
针对OpenClaw等个人AI系统,提出本地化部署方案,缩小本地模型与云端前沿模型的能力差距。
📋 详细解读论文解读论文直面个人AI助手(如OpenClaw、Hermes Agent)过度依赖云端模型的隐私和效率问题。发现直接替换云端模型会导致25-39个百分点性能下降,提出系统性本地化优化方案。核心创新包括:针对个人AI任务的本地模型微调策略、轻量化适配技术、以及任务感知的模型路由机制。实验表明优化后的本地模型在多个个人AI基准上接近云端模型表现,为隐私敏感场景提供可行方案。
|
❤️ 17
💡 内容总结
分析Hermes Agent自进化局限,SkillsBench显示AI自生成skill比人写差16.2pp,揭示缺乏外部评判的问题。
|
|
2026-05-17
💡 一句话总结
提出ContraFix框架,通过差异化运行时证据和技能复用修复LLM Agent智能体的智能体漏洞。
📋 详细解读论文解读论文针对LLM Agent在自动化漏洞修复(AVR)中仍存在显著失败率的问题,分析发现主要失败模式是语义误解。提出ContraFix框架,利用差异化运行时证据辅助Agent理解漏洞语义,并通过技能复用机制加速修复。核心创新包括:运行时状态对比分析、基于历史成功修复的技能模板库、以及语义一致性校验机制。实验在真实漏洞数据集上验证了方法有效性,修复成功率较现有方法提升。
|
|
|
2026-05-17
💡 一句话总结
提出因果干预记忆选择方法,改善长时序LLM Agent的上下文相关记忆检索质量。
📋 详细解读论文解读论文针对长时序LLM Agent记忆系统中语义相似但实际无关的检索问题,提出因果记忆干预方法。核心思想是区分记忆的主题相关性和因果相关性,避免误导性检索。方法利用因果推断识别对当前决策真正有因果作用的记忆片段。创新点包括因果图建模记忆依赖关系、干预后的检索重排序机制。实验表明该方法显著提升长时序任务中的决策质量。
|
|
|
2026-05-18
💡 一句话总结
构建LivePI基准,评估OpenClaw等AI Agent在间接提示注入攻击下的安全性与稳健性。
📋 详细解读论文解读论文研究AI Agent(如OpenClaw)在处理邮件、下载文件、网页等非可信输入时面临的间接提示注入(IPI)风险。提出LivePI基准,提供多样化的间接注入通道和真实攻击场景。核心工作包括:系统分类IPI攻击向量、设计多阶段评估指标、以及对比现有安全防护机制的有效性。实验揭示当前Agent对间接注入的脆弱性,为安全加固提供方向指引。
|
|
|
2026-05-18
💡 一句话总结
提出CommitDistill,面向软件仓库的知识中心化记忆层,辅助LLM Agent智能体高效复用历史知识。
📋 详细解读论文解读论文针对软件仓库中commit信息、讨论等非结构化知识难以有效利用的问题,参考MemGPT等typed-memory架构,提出知识蒸馏型记忆层。核心创新包括:从非结构化历史中提取结构化知识、构建类型化知识表示、以及基于知识的检索增强机制。方法使AI编码助手能充分利用项目历史信息,提升代码补全和修改建议的质量。实验验证了知识蒸馏在提升Agent任务执行准确性上的有效性。
|
|