arXiv cs.AI 周报 (2026-08-03~2026-08-09)

arXiv cs.AI 周报 (2026-08-03~2026-08-09)

Meta-summary · 基于 4/7 daily HTML · 2026-08-03~2026-08-09 · 缺 20260807, 20260808, 20260809
Generated by tanar · 2026-08-10 00:02

🗓️ 本周覆盖

本周(2026-08-03 ~ 2026-08-09)共 4/7 天 daily 报告可用。 缺失日期:2026-08-07, 2026-08-08, 2026-08-09(这些日的论文不在本汇总范围内)。 下文所有数字和取舍都基于这 4 天的 daily picks。

🔥 本周主题

🤖 智能体从"能力堆叠"迈向"质量治理"(4/4 天出现)

本周最强信号。Agent 研究已越过"让 agent 更能干"的阶段,集中转向失效模式分析、记忆可靠性治理、自演化的不可逆污染防护以及运行时故障检测与修复。持久化自演进运行时(Argus)和世界排练内化(EnvACE)代表了新一代 agent 架构范式。

  • 2026-08-03:Harness-R1 — 从失败轨迹学习编辑可执行运行时
  • 2026-08-04:TARL — 五操作事务性记忆框架限制长期污染
  • 2026-08-05:Argus — 固定权重自演进运行时,SWE-Bench Pro 78%
  • 2026-08-06:When Self-Evolution Backfires — 揭示技能污染不可逆相变并提出门控方案

⚡ 推理与训练范式的深层反思(4/4 天出现)

不再只是优化数字,而是追问"推理过程本身是否正确"。从"正确答案≠正确方法"到扩散 LLM 的"先答后推"病理,从 OPD 的系统性失效到 test-time scaling 的形式化理论,本周多项工作动摇了既有训练与推理范式的基本假设。

🛡️ 安全评估的"元审计"浪潮(4/4 天出现)

本周一批论文不再只提新防御方案,而是系统化地质疑现有评估体系本身——CoT 监控被证明在隐式影响下严重高估可靠性,benchmark 缺陷导致模型能力被低估 60+ 百分点,搜索条件变化使安全评估结论翻转。"评估评估本身"正在成为独立研究议题。

🖼️ 多模态推理:能力边界的精确刻画(3/4 天出现)

视频深度研究 agent 以开源模型超越闭源前沿,但同时多项因果审计工作揭示了视觉工具使用的"虚假因果"和模态间的不对称性。本周多模态方向呈现"攻坚与自省并行"的成熟特征。

⚙️ 推测解码与部署效率持续突破(3/4 天出现)

Speculative decoding 从扩散 drafter 并行精炼到语义 draft 源复用,每天都有不同角度的突破。推理时 token 压缩(ReCo)和注意力哈希稀疏化(BinaryPC)则从另一端降低实际部署成本。

  • 2026-08-03:xPress — 扩散 drafter 因果精炼,吞吐 1.3×
  • 2026-08-04:Oilbird — 语义 draft 源无需训练,4.4× 加速
  • 2026-08-05:ReCo — 过程奖励协调压缩,延迟降 2.3×

📈 方向走势

持续高产(4/4 天):智能体系统(每天 30-55 篇,合计约 155 篇)、推理/训练优化(每天 25-45 篇,合计约 130 篇)、安全与评估(每天 20-30 篇,合计约 100 篇)。这三个方向构成本周 cs.AI 的绝对主体。

本周爆发On-Policy Distillation 的系统性质疑 — 8/3 尚无明确信号,8/4 开始出现(Soft Guidance 挑战 CoT prompting),8/5 集中爆发(3 篇独立工作从不同角度证明 OPD 核心假设失效),8/6 扩展为更广义的训练范式反思。Agent 自演化治理也属于本周爆发——8/3 仅有个别修复工作,到 8/6 已有至少 5 篇论文形成系统化失效分析。

稳中有变:多模态方向 8/3 未作为独立主题出现,8/4 起强势回归且持续到 8/6。RAG/搜索系统在 8/3 独占一个方向(~25 篇),之后融入 agent 和推理方向,不再独立成块。

🌟 周度 Top 10

  1. Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

    Boxiu Li, Zimo Wen et al. · SWE-Bench Pro 78%,固定权重自演进运行时开创 Agent 工程新范式

  2. EnvACE: Internalizing Environment Dynamics via World Rehearsal

    Zishan Xu, Zhiyuan Yao et al. · 世界排练替代环境交互,打破 agent 训练对外部仿真的依赖

  3. PRECOG: O(1) SSM State Injection for Edge Language Models

    Anusha Madan Gopal et al. · RAG prefill 4500× 加速(27s → <6ms),Transformer 原理上不可复制

  4. LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

    Fengqi Zhu et al. · 首个扩散 LM 完整 MoE scaling law,30B-A3B 接近 Qwen3

  5. Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

    Agatha Duzan, Asa Cooper Stickland · 隐式影响下 CoT 安全层检测率骤降,对前沿安全架构的根本挑战

  6. Answer First, Reason Later: Commitment Order in Diffusion LLMs

    Jewon Yeom, Jaewon Sok et al. · 机制性解释扩散 LLM 推理失败根源,frontier-gated 解码恢复精度

  7. Video-DeepResearch: Next-Gen Multimodal Deepresearch Agent

    Zhen Fang et al. · 开源 35B 视频推理 agent 以 64.0% 超越 Claude-4.5-Sonnet (59%)

  8. When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination

    Linfang Shang et al. · 揭示自演化不可逆污染的相变机制,三层门控方案简洁有效

  9. SciCode-Verified: Benchmark Defects Underestimated Scientific-Coding Ability

    Sihan Hu et al. · 修复 91% 主题评分缺陷后准确率从 9-27% 跃升至 69-92%

  10. Iris: Beyond Solution-Centric Search for Autonomous ML Engineering

    Shaokang Fu et al. · 信息范式替代方案搜索,MLE-Bench 64.9% 奖牌率

📊 本周数字

~651
4 天合计 cs.AI 论文
~155
智能体方向论文数(最大方向)
cs.LG
最活跃交叉子类(4 天均排第二)
205
单日最高论文数(8月4日)
清华 / 中国高校
最高频出现的机构群

🔮 趋势观察

1. Agent "可靠性危机"正在催生新的工程范式。 本周 4 天内至少 15 篇高质量论文聚焦 agent 失效——从技能污染的不可逆性、长轨迹关键错误定位、记忆腐蚀治理到运行时微秒级故障检测。这不是孤立现象,而是 agent 从实验室走向生产的必然挑战。Argus 和 EnvACE 代表的"固定权重 + 持久状态"架构和"世界排练内化"训练范式,可能是应对这一危机的工程答案。

2. 扩散语言模型快速补齐 scaling 与推理短板。 LLaDA MoE v2 给出了完整工程路线图,"Answer First, Reason Later"则精确定位并修复了推理病理。两者结合表明扩散 LM 作为 AR 替代路线正从"概念验证"进入"工程追赶"阶段,未来数月性能差距可能进一步收窄。

3. AI 评估领域面临信任重建。 SciCode-Verified 揭示基准缺陷低估模型能力 60+ 百分点,CoT Monitoring 论文动摇了推理监控作为安全层的信心,What Benchmarks Leave Unmeasured 证明搜索条件就能翻转安全结论。这些工作共同指向一个紧迫需求:AI 评估需要类似科学实验中的"独立复现 + 同行审计"文化。