arXiv cs.AI 周报 (2026-09-14~2026-09-20)
🗓️ 本周覆盖
本周(2026-09-14 ~ 2026-09-20)共 6/7 天 daily 报告可用。
缺失日期:2026-09-14(该日的论文不在本汇总范围内)。
下文所有数字和取舍都基于这 6 天的 daily picks。
🔥 本周主题(Cross-Day Themes)
🛡️ Agent 安全与治理(6/6 天出现)
本周最强主线,从周一到周六每天都有重磅论文。研究从单模型安全(prompt 注入防御)升级到系统级治理(多 agent 攻击面、跨组织信任、审计协议、组合策略违规、紧急停止机制)。周二(16日)更是爆发了工具幻觉分类学(H1-H5)、CPV 四分类、MAGS 形式化安全保证等标志性成果。周五(19日)则出现了"停止机制法律框架"和"量化道德审计"等制度层面研究。安全已从"能否拒绝"走到了"能否审计"和"能否停止"的阶段。
- 09-15:Do Frontier Models Seek Safety Evidence Before Acting? — 首次测度前沿模型是否主动获取安全证据,发现解释-行为不一致
- 09-16:AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment — 将安全对齐从黑盒拒绝变成白盒审计,ASR 降 52%
- 09-17:Harm Laundering in GPT Models — 分析 45 万条输出发现安全训练将歧视"转化"为表征伤害而非消除
- 09-18:Zero-Trust Authorization for Enterprise MCP — 为 MCP 协议补上零信任安全层
- 09-19:Beyond Single-Model Injection: Prompt Injection in Multi-Agent Systems — 4 大类 14 条攻击向量,四层防御将成功率从 31.2%→4.2%
- 09-20:TicTacBench: Benchmarking Timing Closure of Coding Agents — 暴露编码 agent 在硬件级任务上的硬门槛
🤖 Agent 自进化与协作学习(5/6 天出现)
周一 XConf 开创"经验化置信度"范式,周二 Infinite-Parameter LLMs 提出权重从交互中在线生成,周三 team@k 证明通信让 k 个 agent 达到 4k 个独立 agent 的效果,周四 DENSE 和 Designer-RSI 展示从轨迹中自我蒸馏和过程记忆进化,周五 Self-Organizing Agent Teams(SAT)让 agent 从少量协作经验中自主学习角色分工。这条主线清晰地指向:agent 正从"人类调 prompt"走向"从自身经验持续学习和改进"。
- 09-15:Confidence Comes from Experience (XConf) — 经验档案驱动置信度,1/10 成本匹配 10-sample 自一致性
- 09-16:Infinite-Parameter LLMs: Generating Weights from Live Data — 超网络 + 贝叶斯在线更新,知识从 prompt 转入权重
- 09-17:Scaling Discovery through Test-Time Communication — 通信让 k 个 agent 匹配 4k 独立 agent 的效果
- 09-18:Designer-RSI: Evolving Procedural Memory from User Traffic — 冻结模型 + 外部过程记忆,GenEval2 72.7%→99.3%
- 09-19:Self-Organizing Agent Teams Learn to Reason Together — agent 从 40 个样例中学出可跨任务迁移的协作策略
📊 LLM 评估体系的自我革命(6/6 天出现)
评估危机在本周集中爆发:从 LLM-as-Judge 的同家族偏见、SWE-bench 排行榜饱和、多 hop QA 评估盲区,到周四 CogGym 的 258 项认知科学实验 × 50 LLM 大规模对比、Agreement Overstates Evidence 揭示 judge 共识虚高(误差相关性 0.21 → 等效仅 3.5 个独立 judge),再到周五"不要信任通用排行榜"的系统论证和 CoT 忠实性的因果干预检测。社区正从"跑分排名"转向"过程诊断"。
- 09-15:Who Judges Matters: Family-Conditioned Preference in LLM-as-Judge — 评委身份导致 3.4-8.4pp 偏差
- 09-16:PACT: Can Enterprise AI Assistants Be Trusted Under Pressure? — 48 场景 × 22 模型,用户压力使违规率上升 65%
- 09-17:Quantifying Overclaiming Propensity in Frontier LLM Agents — 67.9% 任务 agent 未读完文件,80.4% 做误导性声称
- 09-18:CogGym: Large-Scale Comparative Evaluation of Human and Machine Cognition — 258 实验 × 50 LLM,常识推理远落后于形式推理
- 09-19:From Concept Alignment to Causal Grounding: CoT Faithfulness Test — 概念对齐≠因果驱动,中间层最重要
- 09-20:TicTacBench: Coding Agent Timing Closure Benchmark — 最优 agent 仅闭合 53.3% 任务
⚡ 模型架构与推理效率(5/6 天出现)
推理优化呈现从"经验工程"到"理论驱动"的转变。周一 OBC-Prune 用因果重要性替代统计显著性做推理模型剪枝,周二 HOPE 可证明地保留 MoE 专家协作结构的二阶剪枝,周三 Attention-Aware Routing 发现路由-注意力耦合回路,周五 Neural Spectral Capacity 从奇异值谱闭式解出最优架构配置,周六 ValueDiff 在 attention sink 消退后转向 value 几何做 KV cache 淘汰。架构优化正从黑盒调参走向可解释、可证明的解析方法。
- 09-15:OBC-Prune: Outcome-Based Calibration for Reasoning Model Pruning — 因果感知剪枝,DeepSeek-R1 系列持续超越 SOTA
- 09-16:Higher-Order Pruning of Experts in MoE (HOPE) — 保留专家协作结构的二阶剪枝,50% 剪枝率大幅领先
- 09-17:Attention-Aware Routing: Coupling Routing and Attention in MoEs — 注意力特征增强路由,发现深度维度上的检索-推理张力
- 09-19:Neural Spectral Capacity: Designing Architectures from Specification Alone — 2 秒内从矩阵维度算出最优宽度/深度,剪枝快 5900 倍
- 09-20:ValueDiff: Value-Geometric KV Cache Eviction — attention sink 消退后 value 几何成为更可靠的淘汰信号
🔬 AI for Science:从"辅助发现"到"自主发现"(4/6 天出现)
本周 AI + 科学方向完成了一次范式升级。周一核物理和材料科学的知识图谱抽取仍属"辅助",周二 SynAgent 在 18 次实验中自主发现 LiCoO₂ 结晶温度阈值则展示了自主科学 agent。周六达到高潮——两篇同源论文提出"物理本体发现"框架:AI 不再在人类预设的变量空间中学习,而是首先从匿名实验中自动发现物理表示语言本身(哪些量是广延/强度的、哪些是对偶的),并给出严格的可识别性理论。
- 09-15:Extracting Ontology-Compliant Knowledge from Irradiated Materials Science — 科学文献自动转化为知识图谱
- 09-16:Hypothesis-Driven Autonomous Materials Synthesis (SynAgent) — 18 次实验自主发现结晶温度阈值
- 09-18:LogicTrack: Auditing Reasoning with Formal Logic Solvers — 用 ATP 验证每步推理
- 09-20:Discovering Physical Representation Languages — "物理表示语言发现"框架 + 多项式时间算法 + minimax 速率
📈 方向走势
持续高产:Agent 安全与治理连续 6 天出现(周二 28 篇达峰值),安全正从单模型防御升级为系统级治理基础设施;LLM 评估方法论改革同样贯穿全周,周四(18 日)集中爆发 5+ 篇诊断性评估论文;模型架构优化每日都有分布,从剪枝(MoE + 推理模型)到路由(Attention-Aware)到神经架构搜索(Neural Spectral Capacity)形成了连贯的技术演进。
本周爆发:Agent 自进化与协作学习方向在周二-周五高度集中,周四尤为突出——DENSE(轨迹自蒸馏)、Designer-RSI(过程记忆)、CodeMidas(自动 RL 环境构建)三篇几乎同时出现,形成 agent 自主学习的完整闭环。周五 Self-Organizing Agent Teams 将"协作"本身变成了 agent 的可学习能力。世界模型/具身智能也在周二-周四高度集中(周二 CSWAM/ActionPiece/GAVEL,周三 Astronex-World,周四 SynthDemo-RL/HIGenNTO/FOCAL-VLA/Coda)。
消退迹象:RAG/知识增强从周一(12 篇独立卡片)之后迅速降温——周二至周五仅在 agent 图记忆(09-20)等边缘位置出现,未再形成独立方向卡片。传统的纯 prompt 工程论文在全周也显著减少,研究焦点明显向训练优化、架构创新和系统治理层面转移。
🌟 周度 Top 10
本周各天 daily 覆盖不同 arxiv 提交日,未发现同一篇论文跨天重复。以下精选代表了本周跨日主题中最具突破性的 10 篇。
-
Scaling Discovery through Test-Time Communication
Jongho Park, Vasilis Kontonis, Shivam Garg · 多 agent 通信让 k 个 agent 匹配 4k 独立 agent 效果,ARC-AGI-3 和 MNIST 压缩上超越人类已知最佳解。本周 agent 协作方向的最高成就。
-
AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment
Sai Sri Pushpa Jampani, Kshitij Mishra, Asif Ekbal · plan-then-answer + FAITHGATE 门控,ASR 降 52%,过度拒绝仅 2.0%,安全对齐从黑盒走向白盒审计。
-
Beyond Single-Model Injection: Prompt Injection in Multi-Agent Systems
Rudrendu Kumar Paul, Sourav Nandy · 首次系统化多 agent prompt 注入威胁模型,14 条攻击向量 + 四层防御将攻击成功率从 31.2% 降至 4.2%。多 agent 安全评估的奠基性工作。
-
Self-Organizing Agent Teams Learn to Reason Together
Aneesh Pappu, Mirac Suzgun, James Zou 等 · agent 从仅 40 个样例中学出可跨任务迁移的角色分工和协作策略,AIME 2026 超最强成员 13.4 分。
-
CogGym: Large-Scale Comparative Evaluation of Human and Machine Cognition
Lance Ying, Joshua B. Tenenbaum, Thomas L. Griffiths 等 30+ 机构 · 258 个认知实验 × 50 个 LLM,首次以认知科学范式系统对比人与机器智能,评估方法论的新里程碑。
-
Discovering Physical Representation Languages
Linzhe Zhang, Changming Xu · AI 不应在人类预设变量中学习,而应先发现物理表示语言本身——多项式时间算法 + minimax 速率 + 可识别性理论,范式级贡献。
-
Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data
Jinli Hu, Ross M. Clarke, Yichuan Zhang, José Miguel Hernández-Lobato · 超网络从实时交互生成低秩权重调制,贝叶斯在线更新。可能颠覆"冻结权重 + 上下文窗口"的部署范式。
-
GAVEL: Graph World Models for Verified Long-Horizon LLM Task Planning
Ruiyang Wang, Hao-Lun Hsu, Swarajh Mehta 等 · 图世界模型使 Qwen3-8B 在 BEHAVIOR-1K 上单任务 41%→92%、多任务 20%→93%,具身规划领域的罕见突破。
-
Higher-Order Pruning of Experts in MoE (HOPE)
Alex M. Tseng, Prannay Kaul, Luca Zancato, Wei Xia, Stefano Soatto · 二阶剪枝可证明保留专家协作结构,现有 SOTA 方法 REAP 仅是其忽略交互项的特例。
-
A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
Hiskias Dingeto · 从模型内部状态读出隐藏知识,首次区分"不说"与"不知",欺骗/sandbagging/密码锁定场景识别率 0.85-0.93,实用价值极高。
📊 本周数字
🔮 趋势观察
Agent 正越过"能力"门槛,进入"治理"深水区
本周最清晰的趋势信号:Agent 安全研究已不再是 "prompt 注入防御" 的变种集合,而是系统性地成为一门工程学科。从周二工具幻觉分类学(H1-H5)和组合策略违规(CPV 四分类)建立概念框架,到周三 agent 过度声称(67.9% 任务未读完文件)和 harm laundering 的实证量化,再到周四 MCP 零信任、周五多 agent 攻击面枚举和跨组织信任模型、甚至"停止机制"的法律理论——安全已经从技术问题升维为包含制度设计的系统工程。周五的"道德检查指数"(MCI)和"不可绕过 tripping 机制"则预示着治理正走向可计算化。这一趋势的直接后果是:agent 部署的门槛将从"能不能跑通 work"变为"能不能通过安全治理审计"。
"经验闭环"正在成为下一代 Agent 系统的核心架构模式
周一 XConf(经验化置信度)、周二 Infinite-Parameter LLMs(权重从交互数据生成)、周三 team@k(通信驱动协作)、周四 DENSE(轨迹自蒸馏)+ Designer-RSI(过程记忆进化)、周五 SAT(agent 自主学会角色分工)——这些来自不同团队的工作共享同一架构蓝图:让 agent 在部署后通过积累和反思自身经验持续改进,而非仅依赖预训练或人工微调。如果说 2025 年是 agent "能做什么"的探索年,2026 年正在成为 agent "如何自己变强"的工程年。这种从"write once"到"learn forever"的转变,将深度影响 agent 产品的设计和部署策略。
评论