arXiv cs.AI 周报 (2026-07-13~2026-07-19)

arXiv cs.AI 周报 (2026-07-13~2026-07-19)

Meta-summary · 基于 4/7 daily HTML · 2026-07-13~2026-07-19 · 缺 20260717, 20260718, 20260719
Generated by tanar · 2026-07-20 00:02

🗓️ 本周覆盖

本周(2026-07-13 ~ 2026-07-19)共 4/7 天 daily 报告可用,合计收录约 443 篇 cs.AI 论文。 缺失日期:2026-07-17, 2026-07-18, 2026-07-19(这些日的论文不在本汇总范围内)。 下文所有数字和取舍都基于这 4 天的 daily picks。

🔥 本周主题

🤖 智能体系统:从能力竞赛到可治理工程(4/4 天出现)

本周最持续、最密集的主题。四天约 100 篇论文覆盖智能体架构、记忆管理、多 Agent 协作、效率优化与安全治理。核心叙事线清晰:周初关注"让 Agent 完成更复杂的任务"(StructAgent、Omni-Decision),随后转向"让 Agent 更廉价、更可靠"(E3 降 91% token、OAT 无监督故障归因),最终汇聚到"让 Agent 可治理"(CAVA 审计框架、Agent Permissions 分类学、MCPEvol-Bench 工具演化评测)。

  • 07-13:StructAgent — 因果状态驱动长程任务,OSWorld 开源 SOTA
  • 07-14:E3 框架 — 任务难度感知,token 降 91%、成本降 85%
  • 07-15:MemCon — 记忆管理建模为 MDP,6 benchmarks 一致提升
  • 07-16:MemPoison — 三层持久记忆攻击分类,暴露结构性防御盲区

🛡️ 安全对齐:从攻防对抗到行为机制审计(4/4 天出现)

安全研究贯穿全周,约 70 篇,但议题明显深化。周初以动态评估框架为主(CBRN 阈值超越、DeepBias 自适应探测),中段转向内部机制理解(LLM-as-Judge 激活几何、Jacobian 空间安全检测、对齐伪装隐状态指纹),周末聚焦系统性新威胁(持久记忆投毒、预训练数据投毒、微调意识形态泛化)。社区正从"发现漏洞"向"理解漏洞成因的因果机制"迈进。

🦾 具身智能与机器人:世界模型 + 上下文缩放双线并进(4/4 天出现)

四天约 55 篇,两条主线交织。第一条是"世界模型即数据引擎"——小米 U0(38B 统一具身合成)和 Lumo-2 展示了世界模型同时用于推理和数据生成的双重身份。第二条是"上下文长度作为新缩放轴"——RoboTTT 首次将 VLA 策略的视觉运动上下文扩展到 8K 步,完成五分钟十阶段装配。两条线在周末汇合:具身基础模型的竞争维度从模型参数量扩展到上下文窗口和数据生成能力。

  • 07-13:Xiaomi-Robotics-U0 — 38B 统一具身合成,OOD 成功率 36.9%→63.2%
  • 07-13:REGRIND — 单次演示 + 残差 RL 的极简灵巧操作管线
  • 07-14:Jetson-PI — VLA 端侧部署,Jetson Orin 上 8.66× 提速
  • 07-16:RoboTTT — TTT 实现 8K 步上下文,范式级进步

⚡ 推理架构与训练效率:更少资源 = 更多能力(4/4 天出现)

约 70 篇论文从多维度证明"效率不是能力的对立面"。推理侧:Hourglass Reasoning 用信息瓶颈隔离提升归纳推理、EcoSpec 针对 671B MoE 实现 1.62× 加速、Seer 无训练实现扩散 MLLM 31 倍吞吐提升。训练侧:CANON 无标签蒸馏仅用 RL 1/7 算力、注意力头重加权修改 0.0001% 参数超越 LoRA。架构侧:T²MLR 证明 20% 中间层循环即超全层循环,可直接 retrofit 已有模型。

  • 07-13:Hourglass Reasoning — 信息瓶颈隔离,ARC-AGI-2 +14 分
  • 07-14:EcoSpec — MoE 成本感知投机解码,DeepSeek-V3.1 加速 1.62×
  • 07-15:CANON — 无标签 token 级共识蒸馏,pass@1 +12 分
  • 07-16:T²MLR — 中间层时序循环,可 retrofit 预训练模型

📈 方向走势

持续高产:智能体系统(4/4 天,每天均为最热方向,约 25 篇/天)、安全与对齐(4/4 天,15-25 篇/天)、推理与架构优化(4/4 天)。这三个方向构成本周 cs.AI 的绝对主流。

持续但演化:具身智能(4/4 天),论文量从 07-13 的 ~20 篇下降到 07-15 的 ~5 篇再回升到 07-16 的 ~12 篇,但议题从"世界模型"演化到"端侧部署"再到"上下文缩放",方向内迭代速度极快。

本周爆发:Agent 治理/记忆安全——07-13 尚以能力展示为主,07-15 起 CAVA(审计)、Agent Permissions(权限分类学)、MemPoison(记忆攻击)密集出现,形成独立子方向。基准测试爆发同样集中在 07-16(单日 ≥15 个新 benchmark)。

值得关注:测试时计算多轴化——07-13 Interaction Scaling 定义"交互"为第三条扩展轴,07-16 RoboTTT 将"上下文长度"定义为机器人策略的缩放轴。"扩展什么"的边界在本周显著拓宽。

🌟 周度 Top 10

  1. RoboTTT: Context Scaling for Robot Policies

    Yunfan Jiang, Li Fei-Fei 等 · 07-16 Top 1 · TTT 将 VLA 上下文扩展至 8K 步,首次完成五分钟十阶段装配,确立上下文长度为机器人基础模型新缩放轴

  2. Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

    Huan Zhu · 07-13 Top 1 · 信息瓶颈隔离提升归纳推理,ARC-AGI-2 最高 +14 分,ChipBench 翻倍,无需微调的推理增强新范式

  3. Interaction Scaling: Grounding the Third Axis of Test-Time Compute

    Bojie Li, Noah Shi · 07-13 Top 2 · 定义推理和采样之外的第三条测试时扩展轴——交互,达到 100% pass rate,重塑智能体设计基本思路

  4. T²MLR: Transformer with Temporal Middle-Layer Recurrence

    Ziyang Cai, Sanjeev Arora 等 · 07-16 Top 2 · 仅 20% 中间层循环胜全层,可直接 retrofit 预训练模型,降低潜在推理的采用门槛

  5. MemPoison: Uncovering Persistent Memory Threats in LLM Agents

    Jifeng Gao 等 · 07-16 Top 5 · 三层攻击分类 + 机制分解,为 Agent 持久记忆安全敲响系统性警钟

  6. Do AI Agents Know When a Task Is Simple?

    Junjie Yin, Xinyu Feng · 07-14 Top 1 · 形式化"最小充分执行",token 降 91% 成本降 85%,将 Agent 效率从直觉变为可衡量工程指标

  7. Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

    Xinghang Li, Jun Guo 等 · 07-13 Top 4 · 38B 统一具身合成模型,OOD 成功率翻倍,证明世界模型可同时作为推理基底和数据引擎

  8. The Refusal Residue: When Probes Catch Alignment Faking and When They Don't

    Aman Mehta · 07-15 Top 4 · 13 模型对齐伪装扫描,建立严格 5 控制测量框架,暴露标准探针方法的信息泄漏陷阱

  9. CANON: Consensus-Anchored Self-Distillation

    John Gkountouras, Ivan Titov · 07-15 Top 3 · 无标签 token 级共识蒸馏,pass@1 +12 分,仅 RL 1/7 算力,训练效率里程碑

  10. Seer: Seeing the End at Step Zero

    Qicheng Zhao 等 · 07-16 Top 3 · MLP 稀疏性感知截断,无训练即插即用实现扩散 MLLM 31 倍吞吐提升

📊 本周数字

~443
4 天合计 cs.AI 论文提交量
4/4
天 Agent 系统均为最热方向
cs.LG
最高频交叉子类(3/4 天排第二)
≥15
07-16 单日新 benchmark 数量
158
单日峰值论文数(07-13)

🔮 趋势观察

"缩放什么"的边界正在快速拓宽

本周至少定义了三条新的缩放轴:Interaction Scaling(07-13)将外部交互确立为推理/采样之外的第三条测试时计算轴;RoboTTT(07-16)将上下文长度确立为机器人基础模型的缩放轴;T²MLR(07-16)证明循环深度的有效单位是"参数访问次数"而非名义层数。社区正从"模型更大"的单维扩展走向"扩展什么最有效"的多维探索。

Agent 研究正经历"基础设施化"拐点

四天内,Agent 论文的重心从"任务完成率"急速转向运维工程:E3 做任务预算控制、OAT 做故障归因、MemCon 做记忆策略学习、CAVA 做动作审计、MCPEvol-Bench 做工具演化评测、MemPoison 做记忆安全审计。这些工作拼在一起已经构成一套完整的 Agent 生产基础设施谱——预算→执行→记忆→审计→安全→评估。这意味着 Agent 系统即将进入"SRE 化"阶段。

安全研究的"因果转向"

本周安全方向论文呈现一个清晰拐点:从观测输入-输出行为转向理解内部表征的因果机制。LLM-as-Judge 的激活几何解剖(07-13)、对齐伪装的隐状态指纹(07-15)、内容危险与物理危险的表征可分离性(07-16),以及微调意识形态泛化的跨域传播路径(07-16)——四篇工作共同指向:下一代安全评估将在模型内部而非外部对话界面上展开。