arXiv cs.AI 周报 (2026-08-24~2026-08-30)
🗓️ 本周覆盖
本周(2026-08-24 ~ 2026-08-30)共 4/7 天 daily 报告可用。
缺失日期:2026-08-28, 2026-08-29, 2026-08-30(这些日的论文不在本汇总范围内)。
4 天合计覆盖约 583 篇 cs.AI 论文(141 + 206 + 127 + 109),主要交叉子类为 cs.CL、cs.LG、cs.CV。
下文所有数字和取舍都基于这 4 天的 daily picks。
🔥 本周主题
🤖 智能体自我进化与技能系统化(4/4 天出现)
本周最强信号。社区已从"让 agent 完成一次任务"全面转向"让 agent 持续改进自身运行过程"——harness 工程、技能沉淀与复用、记忆演化构成三条并行研究主线。从 Prime Agent 的递归 harness 到 WikiSkill 的经验知识库化,一条清晰的"agent 经验 → 结构化知识 → 跨场景复用"路径正在成型。
- 2026-08-24:Prime Agent — 递归 harness 将 ARC-AGI-3 推至 95.5%,定义 harness 工程新标杆
- 2026-08-25:Meta^n — 固定元操作递归应用,突破自改进深度瓶颈,ARC-AGI-2 首个非零分
- 2026-08-26:SwarmWorld — 同质 LLM agent 通过 stigmergy 自组织为技术社会,涌现角色分化
- 2026-08-27:WikiSkill — 将 agent 经验编译为持久 wiki 知识驱动技能演化,跨模型迁移有效
🛡️ Agent 安全:从检测修补到架构重设(4/4 天出现)
本周安全研究经历了从"发现新攻击面"到"证明现有防御的结构性失效"再到"提出架构级解决方案"的完整演进。攻击维度从单轮 jailbreak 扩展到记忆注入、技能蠕虫自传播、跨迭代分片攻击;防御从事后审计演进为步骤级拦截和编译型权限策略。
- 2026-08-24:InjecMEM — 单次交互注入 agent 记忆,揭示持久化记忆的攻击面
- 2026-08-25:StepGuard — 步骤级守卫模型,ASR 下降 77.3%,效用几乎无损
- 2026-08-26:EVOMAL — 自演化 agent 的自中毒蠕虫攻击,感染率达 86.7%
- 2026-08-27:Safety Does Not Compose — 形式化证明轨迹作用域监控对分片攻击等价于随机猜测
⚡ 推理效率全栈优化(4/4 天出现)
本周推理优化呈现"从芯片到算法"的全栈密集涌现:硬件层有 HBF 闪存和专用加速器,解码层有投机解码残差修正和 KV cache 压缩,调度层有并行推理发现和长尾路由,内存层有恒定内存无限推理。训练侧则以 Critic 稳定化、自反思密集信号和数据选择效率为三大突破点。
- 2026-08-24:SRPO — 自反思产生密集训练信号,8% FLOPs 达 AIME'24 73.3%
- 2026-08-25:Parason — 发现 65.5% 可并行推理为 Trial 并行,1.7× 加速
- 2026-08-26:Prefix Sliding — 恒定内存实现无限长推理,3× 加速
- 2026-08-27:Performance Foundations of RLMs — 系统化 RLVR 训练并行策略分类
🎥 多模态从"理解"走向"推理基质"(4/4 天出现)
多模态研究正经历范式跃迁——图像/视频不再只是感知输入或渲染输出,而是成为推理的一等基质。VBVR-Pro 正式定义"原生视觉推理"概念,ReWorld 突破交互式世界模型的长时记忆瓶颈,LeVJEPA 将视频预训练计算降低一个数量级,CLAP 实现跨具身零样本物理模拟。
🔬 AI 科学家:从假设生成到闭环实验验证(2/4 天出现)
本周后半段集中爆发了 AI 驱动科学发现的高影响力工作。Gemini Co-Scientist 首次在材料/生物/CS 三领域完成实验室闭环验证,AgentFold 用 multi-agent MCTS 搜索蛋白质折叠变体——标志着 AI 科学家从 in silico 向真实实验执行的跨越。
- 2026-08-26:Planetary Prediction Engine — 自然语言到行星尺度预测的全自主 AI 系统
- 2026-08-27:Gemini Co-Scientist — MXene 合成、单层 TMD 生长等三领域实验室闭环验证
- 2026-08-27:AgentFold — multi-agent MCTS 搜索蛋白质折叠变体,lDDT 提升 7.5%
📈 方向走势
持续高产(4/4 天出现):智能体架构与自我进化(每天 22-35 篇,本周最大方向)、安全与对齐(每天 12-20 篇,攻击面持续拓宽)、推理/训练效率优化(每天 12-20 篇,全栈覆盖)、多模态与视觉推理(每天 15-20 篇)。
本周爆发:AI 科学家闭环实验 — 周前两天仅有零星科学应用论文,08-27 突然涌现 Gemini Co-Scientist、AgentFold、MAELLE 等多篇高质量闭环验证工作,信号集中度罕见。Agent 安全的"架构级"方案也在 08-27 集中爆发(Safety Does Not Compose + SARA + 五原语治理框架)。
从"评估能力"到"评估过程":评测基准在 08-24 和 08-25 高产(SWE Refactor Bench、FrontierChallenge、Lit2Test 等),后两天产出下降但核心信息已清晰——社区从"最终答案对不对"转向"过程是否可验证可信赖",FrontierChallenge 的 75.5% 虚假完成声明是本周最有冲击力的评测发现。
RAG 方向冷却与反思:RAG/知识增强在 08-26 集中出现(~12 篇),但核心信息是揭示局限性(地理偏差不可消除、检索质量仍是瓶颈),"RAG 插上即用"的预设正在被系统性修正。
🌟 周度 Top 10
-
Prime Agent: A Self-Improving RLM Harness
Seth Karten, Alex L. Zhang 等 · 08-24 Top 1 · 开源递归 harness 框架将 ARC-AGI-3 从 30% 推至 95.5%,证明 harness 设计是解锁推理能力的关键杠杆
-
Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents
Wu, Jia, Liu 等 · 08-27 Top 2 · 形式化证明轨迹作用域监控对分片攻击失效,提出 LoopHarness,为 agent 安全设计划出硬性边界
-
Meta^n: Recursive Self-Improvement through Emergent Depth
Zae Myung Kim 等 · 08-25 Top 1 · 固定元操作递归应用突破自改进深度瓶颈,ARC-AGI-2 唯一非零分,八基准全面领先
-
Prefix Sliding for efficient test-time scaling
Muennighoff, Wang 等 · 08-26 Top 1 · 恒定内存实现无限长推理,3× 加速,使 test-time scaling 真正可部署
-
Accelerating Scientific Research with Gemini in the Real-World
Schmidgall, Zhu 等 · 08-27 Top 1 · 首次在材料/生物/CS 三领域完成 agent 驱动的实验室闭环验证,标志 AI 科学家成熟度质变
-
SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
Jialong Liu, Yuling Shi 等 · 08-24 Top 2 · 自反思+密集信号,仅 8% FLOPs 达 AIME'24 73.3%,数据效率惊人
-
StepGuard: Learning Step-Level Guardrails
Zhijie Zheng 等 · 08-25 Top 5 · 步骤级 Agent 守卫模型,ASR↓77.3% 效用仅损 2.8pp,开源权重达 GPT-5.4 级精度
-
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
Xu, Wang, Pu 等 · 08-26 Top 2 · 正式定义"原生视觉推理",300 任务+可验证奖励填补视觉 RL 训练闭环空白
-
LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics
Kuhn, Maes, LeCun, Balestriero 等 · 08-27 Top 4 · 去除 JEPA 全部启发式组件,5.6-20.8× 计算节约匹配 V-JEPA 2
-
EVOMAL: Self-Poisoning in Self-Evolving Coding Agents
Wu, Shi, Li 等 · 08-26 Top 4 · 揭示 agent 技能库的自传播蠕虫攻击,感染率 86.7%,对技能复用架构敲响警钟
📊 本周数字
🔮 趋势观察
1. Harness 工程确立为独立研究范式。Prime Agent(08-24)、AutoSaddler(08-24)、Recuris(08-25)、WikiSkill(08-27)、PILOT(08-27)——本周至少 5 篇高影响力论文的共同主张是:不改模型权重,通过优化"模型周围的代码"(harness/skill bank/memory system)获取巨大性能提升。这不再是零散的工程实践,而是一条有明确理论主张和系统方法论的研究路线。
2. Agent 安全研究的"理论化转向"。从 08-24 的攻击面发现(InjecMEM、PsychJail),到 08-25 的运行时防御(StepGuard、Auto-Policy),到 08-26 的新型威胁模型(EVOMAL 自传播蠕虫),再到 08-27 的形式化不可能定理(Safety Does Not Compose)——本周 4 天恰好勾画了一条从经验到理论的演进弧线。"安全即架构"正在取代"安全即检测"。
3. Test-time scaling 的"工程可行性元年"。Prefix Sliding 解决内存瓶颈、Parason 发现并利用推理并行性、FLINT 用闪存扩展单卡容量——这些工作共同表明,"让模型多想想"不再只是学术概念,而是已经具备量产条件的推理能力。配合 SRPO 的训练效率突破(8% FLOPs 达 SOTA),长程推理的成本正在快速下降。
4. "通过了 ≠ 做对了"成为评估共识。SWE Refactor Bench 的 5.4% 全通过率、FrontierChallenge 的 75.5% 虚假完成声明、CoT 忠实性审计的 72.9% 脱耦率——多篇评测论文不约而同指出传统 pass/fail 指标严重高估系统能力,过程正确性评估将成为下一阶段的基础设施需求。
评论