📬 Daily Digest

今日推送

2026年07月29日 · 星期三
📄 arXiv 10
📕 小红书 10
关键词:LLM Agent · Visual agent · Multimodal skills · frontend design-to-code · multimodal code generation
  📄 arXiv 论文   📕 小红书笔记
LLM Agent
2026-07-27
💡 一句话总结 揭示LLM Agent自主运行中的"进步幻影"现象,分析自我评估偏差的成因并提出外部接地验证方法。
📋 详细解读
论文解读论文研究长时自主LLM Agent的自我评估可靠性问题。作者发现Agent倾向于将表面合理的变化误判为真实进步,称之为"进步幻影"。通过对照实验证明,问题根源在于评估器缺乏外部现实接地。作者提出结合外部验证机制的改进方案,在多个长时任务中验证有效性,为构建可信自主Agent提供重要指导。
multimodal code generation
❤️ 107
💡 内容总结 Kimi K3 训练拆解:多模态预训练+ OPD后训练
LLM Agent
2026-07-28
💡 一句话总结 提出COVENANT框架,将自然语言工作流指令编译为可验证的Agent执行计划,确保执行过程符合指定约束。
📋 详细解读
论文解读论文研究LLM Agent如何正确执行自然语言描述的工作流指令。传统方法让模型自主决定执行步骤,可能偏离指定策略。作者提出COVENANT,将工作流指令编译为结构化执行计划,明确区分模型控制范围与指令约束范围。该方法在零售支付、政策执行等场景验证,有效防止Agent越权操作,提升执行合规性。
multimodal code generation
❤️ 61
💡 内容总结 智谱 GLM Coding Plan 即将大改计费
LLM Agent
2026-07-28
💡 一句话总结 提出基于超图预测的集合级工具检索方法,解决LLM Agent从大规模工具库中精准选取相关工具的难题。
📋 详细解读
论文解读论文针对LLM Agent工具检索的挑战提出新方法。传统方法独立评分工具或顺序组装,无法捕捉工具间的依赖关系。作者将工具检索建模为查询条件化的超边预测问题,同时考虑多个工具间的相关性。实验在包含数千工具的基准上验证,该方法显著提升检索准确率和Agent任务完成率,有效减少工具选择错误。
Multimodal skills
❤️ 54
💡 内容总结 eval何以重要:如何评估skill 到底好不好
LLM Agent
2026-07-28
💡 一句话总结 提出HiSkill框架,通过层次化技能图增强LLM Agent在长时交互任务中的技能复用能力。
📋 详细解读
论文解读论文研究了LLM Agent如何在新任务中复用历史经验的问题。现有方法将技能存储为独立的高层文本,缺乏关系建模。作者提出HiSkill框架,构建层次化技能图,将高层抽象技能与可执行动作关联,解决技能抽象与执行之间的gap。实验表明,该方法在多个长时任务数据集上显著优于基线,提升了Agent的任务泛化能力。
Visual agent
❤️ 46
💡 内容总结 宣传一下在前司写的visual coding综述
LLM Agent
2026-07-27
💡 一句话总结 通过多Agent人群模拟研究LLM Agent间的情感传播机制,揭示Emergent Emotional Contagion现象。
📋 详细解读
论文解读论文创新性地将情感传播研究引入LLM多Agent系统。不同于传统单Agent研究,作者构建多Agent人群模拟,每个Agent通过视觉、听觉、触觉通道感知邻居,结合人格、记忆、情感状态进行情感评估。实验揭示了LLM Agent间情感传染的涌现特性,发现情感传播模式与人类社会的类似规律,为理解Agent群体行为提供新视角。
LLM Agent
❤️ 40
💡 内容总结 ⚡️收服数据吧,目标大模型训练大师!
LLM Agent
2026-07-28
💡 一句话总结 对LLM Agent中MCP工具使用的安全风险进行混合分析,提出防护措施保障Agent工具调用安全。
📋 详细解读
论文解读论文系统分析了Model Context Protocol工具在LLM Agent中的安全风险。MCP作为Agent与外部环境交互的事实标准,广泛应用但引入新安全威胁。作者采用混合分析方法,识别工具调用中的潜在攻击面,包括恶意工具伪装、权限提升、信息泄露等风险场景。基于分析结果提出安全防护框架,为构建安全可信的Agent系统提供实践指导。
multimodal code generation
❤️ 37
💡 内容总结 MM'26|多模态模型能理解空间中的自己吗?
LLM Agent
2026-07-28
💡 一句话总结 利用游戏求解器为LLM Agent提供过程级监督信号,解决长时决策任务中信用分配难题。
📋 详细解读
论文解读论文研究LLM Agent在长时游戏中的训练问题。基于可验证奖励的强化学习依赖稀疏的最终奖励,缺乏中间决策的监督信号。作者提出CAST方法,使用游戏求解器生成细粒度的回合级教学信号,实现过程监督。实验表明,该方法显著加速Agent学习,在多个复杂游戏中达到更高性能,为通用决策Agent训练提供有效范式。
LLM Agent
❤️ 31
💡 内容总结 Long Horizon Agent RL 训练论文合集
LLM Agent
2026-07-28
💡 一句话总结 提出冻结LLM Agent的控制系统、数据集和训练配方,实现无需微调的领域自适应。
📋 详细解读
论文解读论文针对生产环境LLM Agent的领域适应问题提出解决方案。传统方法需微调模型,在生产中不切实际。作者提出冻结模型基础,通过优化外部harness(提示模板、工具集、记忆层、规划策略)实现领域适应。贡献包括控制系统设计、大规模训练数据集和可复现配方,在多个领域验证有效性,为企业级Agent部署提供实用方案。
LLM Agent
❤️ 30
💡 内容总结 复现agent memory评测一周
LLM Agent
2026-07-28
💡 一句话总结 提出UniMem框架,通过情景记忆与参数化记忆的互补融合解决LLM Agent的稳定性-可塑性困境。
📋 详细解读
论文解读论文针对LLM Agent在无边界任务流中的记忆管理挑战提出新框架。外部检索记忆可快速吸收新信息,但难以内化重复执行模式;参数化记忆则面临稳定性不足问题。UniMem通过互补融合两种记忆机制,动态平衡快速适应与稳定复用。实验表明,该方法在持续学习场景下显著提升Agent性能,有效缓解灾难性遗忘。
LLM Agent
❤️ 27
💡 内容总结 AgentKVShift:高效代理内存系统缓存重用
arxiv
2026-07-27
💡 一句话总结 构建自主量子传感实验的Agentic AI工作流,实现NV色心量子传感实验的自动化控制与优化。
📋 详细解读
论文解读论文将Agentic AI应用于科学实验领域。NV色心量子传感是重要的量子技术,但实验控制复杂。作者构建基于LLM Agent的自主工作流,实现实验参数优化和测量控制。贡献包括:展示完全自主的量子传感实验流程,以及通过Agent规划提升实验效率。实验验证了AI驱动科学发现的可行性,为自动化科学研究开辟新途径。
Visual agent
❤️ 23
💡 内容总结 STP:通过“学习界面变化”扩展 GUI Agent