AI 论文精读 · 2026 年 8 月 26 日

AI 论文精读 · 2026 年 8 月 26 日

每周精选 AI 前沿论文,洞悉学术前沿。


1. Recuris: 递归经验-工作记忆演化——面向长程任务的智能体框架

作者机构: Zhaochen Yu, Yingcheng Wu, Zhenfei Yin 等(Gen-Verse 团队)

研究问题: 递归自我改进(RSI)在长程任务中面临严峻挑战——随着交互历史的增长,任务状态变得越来越模糊,技能调用与当前需求之间的对齐度下降。现有方法难以让智能体在持续积累经验的同时,不断优化自身的行为策略。

核心方法: 论文提出 Recuris,一种递归经验-工作记忆(Experiential-Working Memory)架构。其核心设计包括:(1) 工作记忆追踪任务进度并指导技能选择,将技能调用锚定在当前需求而非完整历史成本上;(2) 执行过程本身转化为结构化证据,精确定位失败到具体记忆组件;(3) 元智能体(Meta-Agent)基于这些证据,对技能记忆进行验证门控的局部更新,形成有界的递归记忆演化循环。

关键发现: 在 4 个长程基准测试和 10 个模型上,Recuris 在 37 个模型-基准组合中的 35 个上取得了任务成功率提升。具体成果包括:在 tau-bench 上为 GPT-5.6 Sol 提升 +17.8 个百分点,为 Claude Opus 5 提升 +15.6 个百分点(达到 87.9%),为 Qwen3.6-27B/35B 在 SkillFlow 上提升 +16.6/+13.5 个百分点。随着交互长度的增加,优势进一步扩大——在最长的任务上提升达 +32.2 个百分点,常见的长程任务失败率下降高达 80%。

论文链接: http://arxiv.org/abs/2608.24876


2. SPO++: 流对齐策略优化——面向异步智能体强化学习

作者机构: Kai Ruan, Jinghao Lin, Qianshan Wei 等

研究问题: 基于群体相对比较的强化学习方法(如 GRPO)需要等待同一提示的所有兄弟采样完成才能计算优势值,这在工具使用轨迹长且变化大的场景下成本极高。单流策略优化(SPO)虽然通过持久化的提示级价值估计去除了这一依赖,但其优势归一化方法存在数学上的不匹配问题。

核心方法: 论文提出 SPO++,在 SPO 的基础上进行了两项关键修正:(1) 证明了轨迹级别的中心化(trajectory centering)通常无法正确中心化动作 token 级别的加权量,SPO++ 通过在动作 token 度量下标准化终端结果优势来修复这一错配;(2) 按生成证据的策略事件(而非学习器接收顺序)组织提示证据。在 ALFWorld 的两个模型规模以及 Math-TIR 上的对比实验表明,SPO++ 显著提升了在线学习效率。

关键发现: 消融实验确认,动作 token 度量下的标准化是最强的有效组件。SPO++ 在多个设置下均优于原始 SPO,为异步智能体强化学习提供了更高效的训练范式。

论文链接: http://arxiv.org/abs/2608.24870


3. LAION-BVD: 千万小时级开源视频数据集——多模态预训练的新基石

作者机构: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti 等(LAION 团队,多机构合作)

研究问题: 多模态视频预训练长期受限于数据规模——开源视频数据集通常仅有数万小时,而闭源数据集(如 YouTube-15M)规模虽大却不公开。研究人员需要一个真正大规模、开放可用的视频数据集来推动视频理解、音视频联合学习等领域的进展。

核心方法: 论文从 CommonCrawl 中收集了 13 亿个视频 URL,成功下载了 8000 万个视频,总时长达到 1000 万小时(约 1140 年)。通过内容感知的场景检测(content-aware scene detection)提取关键片段,并利用合成字幕生成技术为视频和音频生成描述。此外,研究人员还探索了将视频帧作为图像-文本数据的替代来源——提取场景变换帧,这些帧的视觉分布与标准网络图像语料库存在显著差异。

关键发现: 在该数据集上训练的模型在视频-文本和音频-文本基准测试上均达到了有竞争力的性能,且随训练规模或模型规模的增加持续提升。在图像-文本检索任务上,使用视频帧训练的模型也达到了强劲的表现。LAION-BVD 将向研究社区完全开放,显著扩展了开源多模态视频数据的规模边界。

论文链接: http://arxiv.org/abs/2608.24845


本文内容综合自多家学术来源整理。