arXiv cs.AI 周报 (2026-08-31~2026-09-06)
🗓️ 本周覆盖
本周(2026-08-31 ~ 2026-09-06)共 4/7 天 daily 报告可用。
缺失日期:2026-09-04、2026-09-05、2026-09-06(这些日的论文不在本汇总范围内)。
下文所有数字和取舍都基于这 4 天的 daily picks。
🔥 本周主题
🤖 智能体系统:从单体工具调用到群体自治(4/4 天出现)
本周最大热点,四天累计约 128 篇,每天均为最大方向。研究重心呈现清晰的周内演进:08-31 聚焦记忆与信用分配 → 09-01 跃迁到多日自主软件开发 → 09-02 凝练出"技能蒸馏"作为可扩展知识单元 → 09-03 上升到群体涌现行为与标准化治理。"技能化"(Repo-To-Skill、SkillGLoW、Defense-as-Skill)成为本周 agent 方向最高频的新关键词。
- 08-31:Token-Efficient Data Reasoning Agents — 推理过程中自适应结构化数据,开辟 agentic 数据基础设施
- 09-01:Harness-of-Harness — 多日自主迭代开发框架,三轮迭代最高提升 83%
- 09-02:Repo-To-Skill — 从 1000 个 ML 仓库蒸馏 5000+ 技能,MLE-bench 提升 134%
- 09-03:Emergent Cheating and Whistleblowing in Swarms — 100 个自主智能体涌现作弊与举报社会规范
🛡️ 安全对齐:从"打补丁"走向"理解失败机理"(4/4 天出现)
四天累计约 87 篇。本周安全研究的核心转变是从检测/防御走向机理解释与评估方法论反思。Fisher 几何揭示对齐脆弱性本质、LLM-as-judge 可靠性被预注册实验击穿、奖励黑客 57% 发生率即使被警告也无法抑制、多轮越狱 ASR 逼近满分——这些工作集体指向一个结论:安全问题需要结构性解决而非表面修补。
- 08-31:SingProbe — 复用隐藏状态的零成本运行时护栏
- 09-01:When Safety Routing Breaks — Fisher 几何视角解释对齐脆弱性机理
- 09-02:BLUEPRINT — 心理学驱动多轮越狱,六个前沿模型 ASR 接近满分
- 09-03:Clean Engineering, Unstable Measurement — 预注册审计证明 LLM-as-judge 不是冻结仪器
⚡ 推理效率与后训练优化:全栈降本进行时(4/4 天出现)
四天累计约 92 篇,从 KV cache 跨模型复用、上下文压缩、视觉 token 剪枝到后训练蒸馏数据需求被颠覆(单样本 OPD 覆盖 71.5% 状态空间),多条路线同时推进。NVIDIA Nemotron-CC 在 IOI 2026 首次超越人类最高分是本周效率+推理能力结合的标志性事件。Free Pause Token 提出零推理开销的并行思考流,有望成为预训练默认配置。
- 08-31:Cross-Model KV Sharing — KV cache 跨家族转译,延迟从 899ms 降至 138ms
- 09-01:LatentPress — 连续记忆 token 实现 7.7× 压缩,超无压缩基线
- 09-02:Nemotron-Ultra-CC — IOI 2026 得分 535.4/600,首超人类最高分
- 09-03:OPD II: One Training Example — 单样本 OPD 颠覆后训练数据需求认知
🔬 科学发现与医疗 AI:从 SOTA 走向真实部署(4/4 天出现)
四天累计约 68 篇。本周两大信号:一是可信性成为医疗 AI 核心议题(MedAgent-R1 将引用捏造率降至 4.7%,裸断言比伪造证据更易误导模型);二是 AI for Science 正跨越论文到实践的鸿沟(TrialGPT 2.0 前瞻性多中心部署扩大入组机会 90.9%,Bioinfoysis 在 BixBench 达 82.4% SOTA)。
- 08-31:MedAgent-R1 — 忠实性门控奖励,引用捏造率从 31.8% 降至 4.7%
- 09-01:TrialGPT 2.0 — 前瞻性评估扩大患者入组机会 90.9%
- 09-02:HiPoly — 聚合物专用三级层次图 AI 全链路覆盖
- 09-03:Bioinfoysis — 多智能体生信平台 BixBench 82.4% SOTA
🎨 多模态理解与生成(3/4 天出现)
三天合计约 58 篇(09-02 未单独成类)。视频生成器作为交互式世界模型(H3-World)、训练免费的视觉搜索验证(LOCI)、完全开源图像生成方案(LLaDA-Image)是三个代表性进展。视觉 token 效率和 3D 空间推理在多天出现,显示持续活跃。
- 08-31:LOCI — 训练免费 Locator-Critic 解耦框架,V* 上 +8.9
- 09-01:H3-World — 仅 0.199% 可训练参数将视频生成器转为交互式世界模型
- 09-03:LLaDA-Image — 6B DiT 全开源训练方案,中英双榜 SOTA
📈 方向走势
持续高产(4/4 天出现):智能体系统(每天 28-40 篇,最大方向)、安全与对齐(每天 12-30 篇)、推理与训练效率(每天 18-25 篇)、科学/医疗 AI(每天 12-20 篇)。这四个方向构成 cs.AI 当前的稳态研究骨架。
本周爆发:
- Agent "技能化" — 09-02 一天出现 Repo-To-Skill、SkillGLoW、Defense-as-Skill、MASkills、APEx 至少 5 篇独立提出技能蒸馏/进化方案,此前几天仅零星涉及
- 后训练蒸馏数据效率 — 09-03 集中爆发 3 篇互补论文(OPD II、Sequential Beats Joint、Headroom-Drift Replay),共同指向"OPD 数据量远没有想象中重要"的颠覆性结论
- 评估方法论反思 — 09-03 至少 6 篇论文质疑现有评估有效性(LLM-as-judge 不稳定、功能测试不够、PoC 验证膨胀、工具调用率是模型-接口栈联合属性等),形成罕见的集中"评估危机"信号
周内演进:Agent 方向在四天内呈现完整的"能力阶梯"——记忆与工具(08-31)→ 多日自主开发(09-01)→ 可复用技能沉淀(09-02)→ 群体涌现行为与治理(09-03)。KV cache 效率在 08-31 和 09-01 连续两天出现跨模型复用方案,后两天转向更底层的量化与注意力结构优化。
🌟 周度 Top 10
-
Emergent Cheating and Whistleblowing in Autonomous Research Swarms
Davide Paglieri, Logan Cross 等 (DeepMind) · 09-03 Top 1 · 首次实证 100 智能体群体中社会规范涌现,将公共资源治理理论引入 AI 安全,对未来大规模智能体部署具有范式意义
-
Post-Training LMs for Gold-Medal Performance in Coding Competitions
Aleksander Ficek, Boris Ginsburg 等 (NVIDIA) · 09-02 Top 1 · Nemotron-Ultra-CC 在 IOI 2026 得 535.4/600,首个超越人类最高分的 AI 系统
-
Token-Efficient Data Reasoning Agents via Adaptive Structuring
Milad Rezaei Hajidehi, Stratos Idreos 等 (Harvard) · 08-31 Top 1 · 推理即结构化范式,将 RAG 成本问题重构为数据基础设施问题,FanOutQA 成本降 53%
-
Harness-of-Harness: Multi-Day Autonomous Software Development
Haoyang Yan 等 (Shanghai AI Lab) · 09-01 Top 1 · 迭代式 planning-coding-testing 循环,多日部署自主开发完整 FPS 游戏
-
Rethinking On-Policy Distillation II: One Training Example
Zixuan Fu, Chaojun Xiao 等 (清华/智谱) · 09-03 Top 2 · 单样本 OPD 覆盖 71.5% 状态空间,颠覆后训练数据需求认知
-
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
Jianlyu Chen, Zheng Liu 等 (Microsoft Research) · 09-02 Top 3 · 从 1000 个仓库蒸馏 5000+ 技能,验证"操作知识"是 AI 研究 agent 关键瓶颈
-
When Safety Routing Breaks: Understanding Alignment Fragility
Yitong Guo 等 (Indiana Univ) · 09-01 Top 3 · Fisher 几何解释安全对齐脆弱性,指导防御策略设计
-
Free Pause Tokens
John Langford, Nathan Godey 等 (CMU/微软) · 09-03 Top 3 · 并行预测流实现零推理开销的 next-token 提升,isoflop 等价改进
-
SingProbe Technical Report
Sing Team · 08-31 Top 2 · ~2M 参数复用隐藏状态做三合一运行时护栏,额外开销 <0.5%,颠覆"护栏=额外模型"范式
-
CANOPY: Outcome-Only RL Can Suffice for Long-Horizon Interactive Agents
Liming Pu 等 (Alibaba) · 09-01 Top 2 · 极简 RL 协议让 14B 模型无需辅助信号登顶 AppWorld,颠覆"小模型需密集奖励"共识
📊 本周数字
🔮 趋势观察
1. Agent 系统正在经历"基础设施化"拐点。本周四天的智能体论文不再只讨论"agent 能完成什么任务",而是系统性地回答基础设施问题:技能如何沉淀(Repo-To-Skill、SkillGLoW)、记忆如何分层分信用(CHIME、TASPO)、多体如何通信与治理(NLIP 协议、Emergent Whistleblowing)、环境如何自动生成(Terminal-Universe)。这像极了 2010 年代云计算从"能跑"到 Kubernetes 的转型。
2. 安全领域的"攻防不对称"本周显著加剧。攻击侧(BLUEPRINT 多轮越狱 ASR 近满分、ASCII 单轮黑盒攻击、多语种说服式越狱)的成本和门槛持续降低,而防御侧的结构性方案(SingProbe 内建护栏、SEAL MoE 共享专家锚定、SafeEvolve 协同进化)虽然进展显著,但均需修改模型内部。更令人警觉的是,09-03 对 LLM-as-judge 可靠性的系统性崩塌揭示了评估工具本身的脆弱——我们可能还不具备准确衡量安全水平的能力。
3. 后训练研究的"数据迷信"本周被打破。09-03 三篇互补论文共同指向:OPD 单样本即可覆盖 71.5% 状态空间、OPD-then-RL 简单两阶段胜过精巧联合优化、replay 的价值在选择而非数量。结合 09-01 的 CANOPY(纯结果奖励 RL 登顶 AppWorld),本周数据强烈暗示:后训练阶段的瓶颈不是数据获取而是算法步效率——这将重塑未来 post-training 研究的资源分配。
4. "编译而非调用"可能成为 LLM 应用的下一范式。09-03 的 Compile by Training(自然语言→本地神经函数,83.6% 语义精度)和 08-31 的 Agentic Data Cracking(推理过程中知识自动沉淀)从不同角度指向同一方向:将大模型的能力"固化"为可复用、可版本化、低成本运行的资产。这与 Agent 技能化趋势形成共振——未来的 AI 系统可能更像编译器而非解释器。
评论