arXiv cs.AI 周报 (2026-09-14~2026-09-20)

arXiv cs.AI 周报 (2026-09-14~2026-09-20)

Meta-summary · 基于 6/7 daily HTML · 2026-09-14~2026-09-20 · 缺 20260914
Generated by tanar · 2026-09-22 10:02

🗓️ 本周覆盖

本周(2026-09-14 ~ 2026-09-20)共 6/7 天 daily 报告可用。 缺失日期:2026-09-14(该日的论文不在本汇总范围内)。 下文所有数字和取舍都基于这 6 天的 daily picks。

🔥 本周主题(Cross-Day Themes)

🛡️ Agent 安全与治理(6/6 天出现)

本周最强主线,从周一到周六每天都有重磅论文。研究从单模型安全(prompt 注入防御)升级到系统级治理(多 agent 攻击面、跨组织信任、审计协议、组合策略违规、紧急停止机制)。周二(16日)更是爆发了工具幻觉分类学(H1-H5)、CPV 四分类、MAGS 形式化安全保证等标志性成果。周五(19日)则出现了"停止机制法律框架"和"量化道德审计"等制度层面研究。安全已从"能否拒绝"走到了"能否审计"和"能否停止"的阶段。

🤖 Agent 自进化与协作学习(5/6 天出现)

周一 XConf 开创"经验化置信度"范式,周二 Infinite-Parameter LLMs 提出权重从交互中在线生成,周三 team@k 证明通信让 k 个 agent 达到 4k 个独立 agent 的效果,周四 DENSE 和 Designer-RSI 展示从轨迹中自我蒸馏和过程记忆进化,周五 Self-Organizing Agent Teams(SAT)让 agent 从少量协作经验中自主学习角色分工。这条主线清晰地指向:agent 正从"人类调 prompt"走向"从自身经验持续学习和改进"。

📊 LLM 评估体系的自我革命(6/6 天出现)

评估危机在本周集中爆发:从 LLM-as-Judge 的同家族偏见、SWE-bench 排行榜饱和、多 hop QA 评估盲区,到周四 CogGym 的 258 项认知科学实验 × 50 LLM 大规模对比、Agreement Overstates Evidence 揭示 judge 共识虚高(误差相关性 0.21 → 等效仅 3.5 个独立 judge),再到周五"不要信任通用排行榜"的系统论证和 CoT 忠实性的因果干预检测。社区正从"跑分排名"转向"过程诊断"。

⚡ 模型架构与推理效率(5/6 天出现)

推理优化呈现从"经验工程"到"理论驱动"的转变。周一 OBC-Prune 用因果重要性替代统计显著性做推理模型剪枝,周二 HOPE 可证明地保留 MoE 专家协作结构的二阶剪枝,周三 Attention-Aware Routing 发现路由-注意力耦合回路,周五 Neural Spectral Capacity 从奇异值谱闭式解出最优架构配置,周六 ValueDiff 在 attention sink 消退后转向 value 几何做 KV cache 淘汰。架构优化正从黑盒调参走向可解释、可证明的解析方法。

🔬 AI for Science:从"辅助发现"到"自主发现"(4/6 天出现)

本周 AI + 科学方向完成了一次范式升级。周一核物理和材料科学的知识图谱抽取仍属"辅助",周二 SynAgent 在 18 次实验中自主发现 LiCoO₂ 结晶温度阈值则展示了自主科学 agent。周六达到高潮——两篇同源论文提出"物理本体发现"框架:AI 不再在人类预设的变量空间中学习,而是首先从匿名实验中自动发现物理表示语言本身(哪些量是广延/强度的、哪些是对偶的),并给出严格的可识别性理论。

📈 方向走势

持续高产:Agent 安全与治理连续 6 天出现(周二 28 篇达峰值),安全正从单模型防御升级为系统级治理基础设施;LLM 评估方法论改革同样贯穿全周,周四(18 日)集中爆发 5+ 篇诊断性评估论文;模型架构优化每日都有分布,从剪枝(MoE + 推理模型)到路由(Attention-Aware)到神经架构搜索(Neural Spectral Capacity)形成了连贯的技术演进。

本周爆发:Agent 自进化与协作学习方向在周二-周五高度集中,周四尤为突出——DENSE(轨迹自蒸馏)、Designer-RSI(过程记忆)、CodeMidas(自动 RL 环境构建)三篇几乎同时出现,形成 agent 自主学习的完整闭环。周五 Self-Organizing Agent Teams 将"协作"本身变成了 agent 的可学习能力。世界模型/具身智能也在周二-周四高度集中(周二 CSWAM/ActionPiece/GAVEL,周三 Astronex-World,周四 SynthDemo-RL/HIGenNTO/FOCAL-VLA/Coda)。

消退迹象:RAG/知识增强从周一(12 篇独立卡片)之后迅速降温——周二至周五仅在 agent 图记忆(09-20)等边缘位置出现,未再形成独立方向卡片。传统的纯 prompt 工程论文在全周也显著减少,研究焦点明显向训练优化、架构创新和系统治理层面转移。

🌟 周度 Top 10

本周各天 daily 覆盖不同 arxiv 提交日,未发现同一篇论文跨天重复。以下精选代表了本周跨日主题中最具突破性的 10 篇。

  1. Scaling Discovery through Test-Time Communication

    Jongho Park, Vasilis Kontonis, Shivam Garg · 多 agent 通信让 k 个 agent 匹配 4k 独立 agent 效果,ARC-AGI-3 和 MNIST 压缩上超越人类已知最佳解。本周 agent 协作方向的最高成就。

  2. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sai Sri Pushpa Jampani, Kshitij Mishra, Asif Ekbal · plan-then-answer + FAITHGATE 门控,ASR 降 52%,过度拒绝仅 2.0%,安全对齐从黑盒走向白盒审计。

  3. Beyond Single-Model Injection: Prompt Injection in Multi-Agent Systems

    Rudrendu Kumar Paul, Sourav Nandy · 首次系统化多 agent prompt 注入威胁模型,14 条攻击向量 + 四层防御将攻击成功率从 31.2% 降至 4.2%。多 agent 安全评估的奠基性工作。

  4. Self-Organizing Agent Teams Learn to Reason Together

    Aneesh Pappu, Mirac Suzgun, James Zou 等 · agent 从仅 40 个样例中学出可跨任务迁移的角色分工和协作策略,AIME 2026 超最强成员 13.4 分。

  5. CogGym: Large-Scale Comparative Evaluation of Human and Machine Cognition

    Lance Ying, Joshua B. Tenenbaum, Thomas L. Griffiths 等 30+ 机构 · 258 个认知实验 × 50 个 LLM,首次以认知科学范式系统对比人与机器智能,评估方法论的新里程碑。

  6. Discovering Physical Representation Languages

    Linzhe Zhang, Changming Xu · AI 不应在人类预设变量中学习,而应先发现物理表示语言本身——多项式时间算法 + minimax 速率 + 可识别性理论,范式级贡献。

  7. Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

    Jinli Hu, Ross M. Clarke, Yichuan Zhang, José Miguel Hernández-Lobato · 超网络从实时交互生成低秩权重调制,贝叶斯在线更新。可能颠覆"冻结权重 + 上下文窗口"的部署范式。

  8. GAVEL: Graph World Models for Verified Long-Horizon LLM Task Planning

    Ruiyang Wang, Hao-Lun Hsu, Swarajh Mehta 等 · 图世界模型使 Qwen3-8B 在 BEHAVIOR-1K 上单任务 41%→92%、多任务 20%→93%,具身规划领域的罕见突破。

  9. Higher-Order Pruning of Experts in MoE (HOPE)

    Alex M. Tseng, Prannay Kaul, Luca Zancato, Wei Xia, Stefano Soatto · 二阶剪枝可证明保留专家协作结构,现有 SOTA 方法 REAP 仅是其忽略交互项的特例。

  10. A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

    Hiskias Dingeto · 从模型内部状态读出隐藏知识,首次区分"不说"与"不知",欺骗/sandbagging/密码锁定场景识别率 0.85-0.93,实用价值极高。

📊 本周数字

~748
6 天合计 cs.AI 论文数(从各日 daily subtitle 加总)
6/6
Agent 安全与治理连续出现天数,本周最强主线
52.4%↓
AUDITPLAN 将攻击成功率从 24% 降至 11.6%,本周最大安全改善
GAVEL 将 8B 模型机器人规划成功率从 41%→92%,提升超 2 倍
NVIDIA
全周最高频出现的机构,跨越 MoE、VLA、语音模型、评估等多个方向

🔮 趋势观察

Agent 正越过"能力"门槛,进入"治理"深水区

本周最清晰的趋势信号:Agent 安全研究已不再是 "prompt 注入防御" 的变种集合,而是系统性地成为一门工程学科。从周二工具幻觉分类学(H1-H5)和组合策略违规(CPV 四分类)建立概念框架,到周三 agent 过度声称(67.9% 任务未读完文件)和 harm laundering 的实证量化,再到周四 MCP 零信任、周五多 agent 攻击面枚举和跨组织信任模型、甚至"停止机制"的法律理论——安全已经从技术问题升维为包含制度设计的系统工程。周五的"道德检查指数"(MCI)和"不可绕过 tripping 机制"则预示着治理正走向可计算化。这一趋势的直接后果是:agent 部署的门槛将从"能不能跑通 work"变为"能不能通过安全治理审计"。

"经验闭环"正在成为下一代 Agent 系统的核心架构模式

周一 XConf(经验化置信度)、周二 Infinite-Parameter LLMs(权重从交互数据生成)、周三 team@k(通信驱动协作)、周四 DENSE(轨迹自蒸馏)+ Designer-RSI(过程记忆进化)、周五 SAT(agent 自主学会角色分工)——这些来自不同团队的工作共享同一架构蓝图:让 agent 在部署后通过积累和反思自身经验持续改进,而非仅依赖预训练或人工微调。如果说 2025 年是 agent "能做什么"的探索年,2026 年正在成为 agent "如何自己变强"的工程年。这种从"write once"到"learn forever"的转变,将深度影响 agent 产品的设计和部署策略。