| 📄 arXiv 论文 | 📕 小红书笔记 |
|---|---|
|
2026-08-07
💡 一句话总结
论文系统分析LLM Agent的'horizon gap'问题,综述1547篇论文提出长期任务失败根因
📋 详细解读论文解读论文指出前沿语言模型在单步推理上表现出色,但在多小时任务上失败(丢失早期决策、过早宣布完成、偏离目标),称之为'horizon gap'。核心创新是对2024-2026年间1547篇arXiv论文进行系统综述,揭示长期Agent失败的根本原因涵盖规划、记忆、执行、训练和评估五个维度。为解决长时任务挑战提供了全面的问题诊断和改进方向指引。
|
❤️ 224
💡 内容总结
KDD Cup 2026 DataAgent冠军方案开源,使用Qwen3.5-35B-A3B小模型击败Codex+GPT-5.6-sol,适合入门Data Agent练手
|
|
2026-08-07
💡 一句话总结
论文提出将规划模块与情景记忆耦合,增强LLM Agent解决复杂软件问题的能力
📋 详细解读论文解读论文研究LLM Agent解决真实软件问题时的长程修复流程(通常数十至数百步)。现有仓库级Agent通常强化本地推理能力,但忽视计划维护和跨阶段观察记忆。核心创新是将规划模块与情景记忆系统耦合,使Agent能保持演化计划并记住跨阶段观察。实验表明该方法显著提升软件问题解决的完成率和效率。
|
❤️ 18
💡 内容总结
AppDeltaWorld提出移动GUI Agent数字孪生世界,通过预测状态变化高保真模拟手机应用作为Agent训练环境
|
|
2026-08-07
💡 一句话总结
Fisher-R1针对LLM Agent在假设检验中的推理错误,提出规范化训练与基准评估方法
📋 详细解读论文解读论文研究LLM Agent自动化科学假设检验时的可靠性问题。尽管Agent能完成端到端的数据检查、代码生成和分析,但常产生微妙推理错误导致错误结论。核心创新是识别并规范化这类推理错误,提出针对性训练方法。构建了包含subtle inferential errors的基准测试,评估显示当前模型在此类任务上存在显著不足,为提升Agent推理可靠性提供改进方向。
|
❤️ 21
💡 内容总结
推荐6个专治AI网页廉价感的skill,其中frontend-design断层第一,可避免Inter字体、紫渐变等AI味
|
|
2026-08-07
💡 一句话总结
PsychoAgent构建分离式认知架构,整合情感记忆与冲突感知控制提升LLM Agent决策质量
📋 详细解读论文解读论文提出人类认知启发的PsychoAgent架构,解决传统Agent仅基于主题相似性选择记忆的问题。核心创新是分离事实记忆与情感记忆,通过冲突感知执行控制器整合两者。情感记忆首先通过语义相关性过滤,再结合情感显著性重新加权。实验表明该架构能更好地模拟人类记忆检索机制,提升Agent在冲突场景下的决策质量。
|
|
|
2026-08-07
💡 一句话总结
SkillProx提出文本梯度下降方法让LLM Agent通过迭代执行和轨迹反馈自主进化技能
📋 详细解读论文解读论文研究LLM Agent如何通过积累技能知识来适应重复任务。现有技能更新方法缺乏显式诊断机制,SkillProx提出近端文本梯度下降方法,结合任务执行、失败诊断和轨迹引导的文本空间更新。核心创新在于显式失败诊断模块和基于梯度思想的技能优化机制。实验表明该方法能有效提升Agent在多任务场景下的技能适应性和执行成功率。
|
❤️ 2
💡 内容总结
Claude Vibing Coding必备10个核心Skill推荐,包含Frontend Design、Superpowers、MCP Server Builder等实用工具
|
|
2026-08-07
Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework
💡 一句话总结
提出长期Agent轨迹归因的统一基准和细粒度标注框架
📋 详细解读论文解读论文研究LLM Agent长程轨迹的细粒度归因分析问题。现有基准主要评估行为结果,缺乏对轨迹内部因果关系的深入分析。核心创新是定义轨迹归因任务并开发相应基准和标注框架,支持对Agent行为进行细粒度溯源。基准涵盖用户指令、工具使用、外部观察和记忆等多元素交互,为理解和改进Agent决策过程提供系统性评估工具。
|
❤️ 45
💡 内容总结
Meta提出EvoHarness-RL让Agent自动学习管理外部状态,通过BPE三阶段训练实现长任务Agent自进化
|
|
2026-08-07
💡 一句话总结
多Agent模拟研究揭示决策分散化对LLM资源分配偏见的影响
📋 详细解读论文解读论文研究多Agent系统中决策分散化对人口统计学偏见的影响。先前基准测试显示单一LLM在做生死资源分配决策时表现出可测量的偏见。核心创新是构建多角色多Agent模拟框架,研究相同决策分布在多个Agent的管道中(带审查步骤)时偏见的变化。实验揭示了多Agent协作如何影响偏见传播和检测,为真实部署中的公平性保障提供参考。
|
|
|
2026-08-07
💡 一句话总结
Agent Memory Distillation通过分层教师记忆蒸馏赋能小模型LLM Agent
📋 详细解读论文解读论文研究如何提升小模型LLM Agent的性能。传统记忆系统对大模型有效,但小模型难以生成足够的成功轨迹。核心创新是提出无训练框架Agent Memory Distillation (AMD),通过分层记忆结构将大模型教师Agent的结构化知识迁移到小模型学生Agent。实验表明该方法显著增强小模型Agent在复杂任务上的表现,为边缘部署提供可行方案。
|
❤️ 32
💡 内容总结
本周GitHub热门skill盘点,包括anti-ui-slop修正AI界面、find-skills搜索助手、grill-me追问检查等工具
|
|
2026-08-07
💡 一句话总结
研究提示词诱发的情绪如何影响LLM Agent在多Agent谈判中的表现
📋 详细解读论文解读论文探索情绪对多Agent谈判中LLM Agent表现的影响。现有基准通常将Agent视为情感中立,忽视人类议价行为的关键驱动因素。核心创新是在受控框架中为买卖双方Agent独立赋予提示词条件情绪,研究情绪对价格谈判策略的影响。实验表明情绪状态显著影响Agent的谈判策略和成交结果,为构建更类人的多Agent交互系统提供洞察。
|
|
|
2026-08-07
💡 一句话总结
CEDAR提出Agent编排的树搜索方法用于复杂系统目标导向优化
📋 详细解读论文解读论文研究复杂系统(人工生命核心对象)的目标导向优化问题。复杂系统通过非线性反馈驱动交互产生涌现行为,预测其动态是开放难题。核心创新是提出CEDAR框架,通过Agent编排的树搜索方法引导优化过程。Agent负责系统探索、状态评估和策略选择,树搜索提供结构化优化路径。应用于种群动力学、生物学、经济政策等领域的复杂系统优化任务。
|
|