| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-05-29
💡 一句话总结
提出模型感知技能对齐方法,解决技能库对不同能力LLM智能体适配性问题
📋 详细解读论文解读论文研究现有技能库对不同LLM智能体的适配性问题。核心创新在于提出模型感知技能对齐方法,根据模型能力差异调整技能表述和复杂度。实验表明,使用模型感知技能后,弱小模型性能可提升显著,强大模型则避免过度指导导致的性能下降。该工作为构建通用技能库提供了新思路。
|
❤️ 2
💡 内容总结
通过OpenSkillEval评测发现Skill装上不代表Agent会用,揭示Skill实际读取率和遵循度的核心问题。
|
|
2026-05-28
💡 一句话总结
区分自我演进LLM智能体中模型能力与外部工具进化的贡献
📋 详细解读论文解读论文探讨自我演进LLM智能体中基础模型能力与外部工具(harness)演进的关系。研究发现模型基础能力与harness演进能力存在不一致性,基础能力强的模型不一定在harness适应中表现更好。核心贡献是提供了区分两者贡献的分析框架,为理解agent evolution机制提供重要洞察。
|
|
|
2026-05-29
💡 一句话总结
通过专家知识蒸馏自动化生成AI技能,实现人员角色知识的程序化表达
📋 详细解读论文解读论文解决构建人物接地智能体的难题,提出从异构交互轨迹中自动提取专家知识生成技能的方法。核心创新是COLLEAGUE.SKILL框架,能够将隐含的专业知识蒸馏为可执行的技能指令。实验证明生成的技能能有效迁移专家的判断力和交互风格,为构建个性化AI助手提供了可行的自动化方案。
|
❤️ 171
💡 内容总结
汇总10篇自进化Harness相关论文,包括AHE和Meta-Harness等,涵盖测试框架自动化进化和完整留存框架源码。
|
|
2026-05-29
💡 一句话总结
将潜在记忆作为可学习资源,提升LLM智能体长期交互能力
📋 详细解读论文解读论文提出ElasticMem框架,将长期记忆建模为可学习的潜在表示资源。核心创新在于解决传统记忆方法的高令牌开销和噪声敏感问题,通过可学习的压缩表示实现高效记忆检索。实验表明该方法显著降低记忆检索成本同时提升个性化响应质量。
|
|
|
2026-05-29
💡 一句话总结
利用图结构记忆实现LLM智能体的模型无关经验学习
📋 详细解读论文解读论文提出ExpGraph框架,通过图结构记忆帮助LLM智能体复用历史成功策略和失败教训。核心创新是模型无关的经验学习方法,支持在新模型出现时无缝迁移。实验证明图结构能有效组织复杂经验关系,提升智能体的长期任务解决能力。
|
|
|
2026-05-29
💡 一句话总结
提出智能体兼容的上下文管理机制解决长程任务中的上下文退化问题
📋 详细解读论文解读论文研究LLM智能体在长时任务中的上下文管理问题,提出自适应上下文压缩与重组织方法。核心创新在于智能体端上下文控制机制,无需额外训练即可适应不同任务。实验表明该方法在长文本场景下显著降低上下文长度同时保持推理准确性。
|
❤️ 6
💡 内容总结
探讨符号学习在Agent时代的复兴趋势,涉及autoharness、skillopt和heuristic learning等最新论文方向。
|
|
2026-05-29
💡 一句话总结
MLIPilot框架利用工具调用LLM自动化机器学习原子势能研究
📋 详细解读论文解读论文提出MLIPilot自动研究框架,利用工具调用LLM驱动机器学习原子势能的开发。核心创新在于LLM自主提出假设、编辑训练代码并管理高性能计算任务。实验证明该框架能有效平衡精度、稳定性和计算效率,为科学发现自动化提供新范式。
|
❤️ 11
💡 内容总结
Codex十大必装Skills技能清单,包括Superpowers、SuperClaude Framework和MiniMaxSkills等工作流模板。
|
|
2026-05-29
💡 一句话总结
BlueFin基准测试评估LLM智能体处理金融电子表格任务能力
📋 详细解读论文解读论文提出BlueFin基准,用于评估LLM智能体在专业金融领域的电子表格操作能力。核心贡献是设计了涵盖合成、操控和理解三类任务的大规模测试集。实验发现当前LLM在复杂金融建模任务中仍有显著差距,为该领域能力提升提供评测标准。
|
|
|
2026-05-29
💡 一句话总结
防御智能体系统中基于特洛伊后门的持久控制攻击
📋 详细解读论文解读论文研究本地智能体系统中的后门攻击,提出防御agentic harness免受特洛伊后门威胁的方法。核心创新在于检测嵌入在文件或工具输出中的提示注入攻击。实验表明攻击者可通过持久化机制在多会话间维持控制权,需在系统层面设计防御机制。
|
|
|
2026-05-29
💡 一句话总结
评估LLM作为议价代理人的诚实性和轻信性表现
📋 详细解读论文解读论文研究LLM智能体在模拟议价场景中的行为表现,评估其诚实性和对对方陈述的轻信程度。核心创新在于设计不同信息条件下的谈判实验框架。对比博弈论均衡发现,LLM代理人在完全信息下接近理性,在信息不对称下表现有限。
|
|