arXiv cs.AI 周报 (2026-08-31~2026-09-06)

arXiv cs.AI 周报 (2026-08-31~2026-09-06)

Meta-summary · 基于 4/7 daily HTML · 2026-08-31~2026-09-06 · 缺 20260904, 20260905, 20260906
Generated by tanar · 2026-09-07 08:12

🗓️ 本周覆盖

本周(2026-08-31 ~ 2026-09-06)共 4/7 天 daily 报告可用。 缺失日期:2026-09-042026-09-052026-09-06(这些日的论文不在本汇总范围内)。 下文所有数字和取舍都基于这 4 天的 daily picks。

🔥 本周主题

🤖 智能体系统:从单体工具调用到群体自治(4/4 天出现)

本周最大热点,四天累计约 128 篇,每天均为最大方向。研究重心呈现清晰的周内演进:08-31 聚焦记忆与信用分配 → 09-01 跃迁到多日自主软件开发 → 09-02 凝练出"技能蒸馏"作为可扩展知识单元 → 09-03 上升到群体涌现行为与标准化治理。"技能化"(Repo-To-Skill、SkillGLoW、Defense-as-Skill)成为本周 agent 方向最高频的新关键词。

🛡️ 安全对齐:从"打补丁"走向"理解失败机理"(4/4 天出现)

四天累计约 87 篇。本周安全研究的核心转变是从检测/防御走向机理解释与评估方法论反思。Fisher 几何揭示对齐脆弱性本质、LLM-as-judge 可靠性被预注册实验击穿、奖励黑客 57% 发生率即使被警告也无法抑制、多轮越狱 ASR 逼近满分——这些工作集体指向一个结论:安全问题需要结构性解决而非表面修补。

⚡ 推理效率与后训练优化:全栈降本进行时(4/4 天出现)

四天累计约 92 篇,从 KV cache 跨模型复用、上下文压缩、视觉 token 剪枝到后训练蒸馏数据需求被颠覆(单样本 OPD 覆盖 71.5% 状态空间),多条路线同时推进。NVIDIA Nemotron-CC 在 IOI 2026 首次超越人类最高分是本周效率+推理能力结合的标志性事件。Free Pause Token 提出零推理开销的并行思考流,有望成为预训练默认配置。

🔬 科学发现与医疗 AI:从 SOTA 走向真实部署(4/4 天出现)

四天累计约 68 篇。本周两大信号:一是可信性成为医疗 AI 核心议题(MedAgent-R1 将引用捏造率降至 4.7%,裸断言比伪造证据更易误导模型);二是 AI for Science 正跨越论文到实践的鸿沟(TrialGPT 2.0 前瞻性多中心部署扩大入组机会 90.9%,Bioinfoysis 在 BixBench 达 82.4% SOTA)。

  • 08-31:MedAgent-R1 — 忠实性门控奖励,引用捏造率从 31.8% 降至 4.7%
  • 09-01:TrialGPT 2.0 — 前瞻性评估扩大患者入组机会 90.9%
  • 09-02:HiPoly — 聚合物专用三级层次图 AI 全链路覆盖
  • 09-03:Bioinfoysis — 多智能体生信平台 BixBench 82.4% SOTA

🎨 多模态理解与生成(3/4 天出现)

三天合计约 58 篇(09-02 未单独成类)。视频生成器作为交互式世界模型(H3-World)、训练免费的视觉搜索验证(LOCI)、完全开源图像生成方案(LLaDA-Image)是三个代表性进展。视觉 token 效率和 3D 空间推理在多天出现,显示持续活跃。

  • 08-31:LOCI — 训练免费 Locator-Critic 解耦框架,V* 上 +8.9
  • 09-01:H3-World — 仅 0.199% 可训练参数将视频生成器转为交互式世界模型
  • 09-03:LLaDA-Image — 6B DiT 全开源训练方案,中英双榜 SOTA

📈 方向走势

持续高产(4/4 天出现):智能体系统(每天 28-40 篇,最大方向)、安全与对齐(每天 12-30 篇)、推理与训练效率(每天 18-25 篇)、科学/医疗 AI(每天 12-20 篇)。这四个方向构成 cs.AI 当前的稳态研究骨架。

本周爆发

  • Agent "技能化" — 09-02 一天出现 Repo-To-Skill、SkillGLoW、Defense-as-Skill、MASkills、APEx 至少 5 篇独立提出技能蒸馏/进化方案,此前几天仅零星涉及
  • 后训练蒸馏数据效率 — 09-03 集中爆发 3 篇互补论文(OPD II、Sequential Beats Joint、Headroom-Drift Replay),共同指向"OPD 数据量远没有想象中重要"的颠覆性结论
  • 评估方法论反思 — 09-03 至少 6 篇论文质疑现有评估有效性(LLM-as-judge 不稳定、功能测试不够、PoC 验证膨胀、工具调用率是模型-接口栈联合属性等),形成罕见的集中"评估危机"信号

周内演进:Agent 方向在四天内呈现完整的"能力阶梯"——记忆与工具(08-31)→ 多日自主开发(09-01)→ 可复用技能沉淀(09-02)→ 群体涌现行为与治理(09-03)。KV cache 效率在 08-31 和 09-01 连续两天出现跨模型复用方案,后两天转向更底层的量化与注意力结构优化。

🌟 周度 Top 10

  1. Emergent Cheating and Whistleblowing in Autonomous Research Swarms

    Davide Paglieri, Logan Cross 等 (DeepMind) · 09-03 Top 1 · 首次实证 100 智能体群体中社会规范涌现,将公共资源治理理论引入 AI 安全,对未来大规模智能体部署具有范式意义

  2. Post-Training LMs for Gold-Medal Performance in Coding Competitions

    Aleksander Ficek, Boris Ginsburg 等 (NVIDIA) · 09-02 Top 1 · Nemotron-Ultra-CC 在 IOI 2026 得 535.4/600,首个超越人类最高分的 AI 系统

  3. Token-Efficient Data Reasoning Agents via Adaptive Structuring

    Milad Rezaei Hajidehi, Stratos Idreos 等 (Harvard) · 08-31 Top 1 · 推理即结构化范式,将 RAG 成本问题重构为数据基础设施问题,FanOutQA 成本降 53%

  4. Harness-of-Harness: Multi-Day Autonomous Software Development

    Haoyang Yan 等 (Shanghai AI Lab) · 09-01 Top 1 · 迭代式 planning-coding-testing 循环,多日部署自主开发完整 FPS 游戏

  5. Rethinking On-Policy Distillation II: One Training Example

    Zixuan Fu, Chaojun Xiao 等 (清华/智谱) · 09-03 Top 2 · 单样本 OPD 覆盖 71.5% 状态空间,颠覆后训练数据需求认知

  6. Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

    Jianlyu Chen, Zheng Liu 等 (Microsoft Research) · 09-02 Top 3 · 从 1000 个仓库蒸馏 5000+ 技能,验证"操作知识"是 AI 研究 agent 关键瓶颈

  7. When Safety Routing Breaks: Understanding Alignment Fragility

    Yitong Guo 等 (Indiana Univ) · 09-01 Top 3 · Fisher 几何解释安全对齐脆弱性,指导防御策略设计

  8. Free Pause Tokens

    John Langford, Nathan Godey 等 (CMU/微软) · 09-03 Top 3 · 并行预测流实现零推理开销的 next-token 提升,isoflop 等价改进

  9. SingProbe Technical Report

    Sing Team · 08-31 Top 2 · ~2M 参数复用隐藏状态做三合一运行时护栏,额外开销 <0.5%,颠覆"护栏=额外模型"范式

  10. CANOPY: Outcome-Only RL Can Suffice for Long-Horizon Interactive Agents

    Liming Pu 等 (Alibaba) · 09-01 Top 2 · 极简 RL 协议让 14B 模型无需辅助信号登顶 AppWorld,颠覆"小模型需密集奖励"共识

📊 本周数字

~612
4 天合计 cs.AI 论文
153
日均论文数
cs.CL + cs.LG
最高频交叉子类(每天均为 Top 2-3)
~128
智能体方向论文(4 天累计,最大方向)
196
单日峰值(09-01)

🔮 趋势观察

1. Agent 系统正在经历"基础设施化"拐点。本周四天的智能体论文不再只讨论"agent 能完成什么任务",而是系统性地回答基础设施问题:技能如何沉淀(Repo-To-Skill、SkillGLoW)、记忆如何分层分信用(CHIME、TASPO)、多体如何通信与治理(NLIP 协议、Emergent Whistleblowing)、环境如何自动生成(Terminal-Universe)。这像极了 2010 年代云计算从"能跑"到 Kubernetes 的转型。

2. 安全领域的"攻防不对称"本周显著加剧。攻击侧(BLUEPRINT 多轮越狱 ASR 近满分、ASCII 单轮黑盒攻击、多语种说服式越狱)的成本和门槛持续降低,而防御侧的结构性方案(SingProbe 内建护栏、SEAL MoE 共享专家锚定、SafeEvolve 协同进化)虽然进展显著,但均需修改模型内部。更令人警觉的是,09-03 对 LLM-as-judge 可靠性的系统性崩塌揭示了评估工具本身的脆弱——我们可能还不具备准确衡量安全水平的能力。

3. 后训练研究的"数据迷信"本周被打破。09-03 三篇互补论文共同指向:OPD 单样本即可覆盖 71.5% 状态空间、OPD-then-RL 简单两阶段胜过精巧联合优化、replay 的价值在选择而非数量。结合 09-01 的 CANOPY(纯结果奖励 RL 登顶 AppWorld),本周数据强烈暗示:后训练阶段的瓶颈不是数据获取而是算法步效率——这将重塑未来 post-training 研究的资源分配。

4. "编译而非调用"可能成为 LLM 应用的下一范式。09-03 的 Compile by Training(自然语言→本地神经函数,83.6% 语义精度)和 08-31 的 Agentic Data Cracking(推理过程中知识自动沉淀)从不同角度指向同一方向:将大模型的能力"固化"为可复用、可版本化、低成本运行的资产。这与 Agent 技能化趋势形成共振——未来的 AI 系统可能更像编译器而非解释器。