arXiv cs.AI 周报 (2026-09-28~2026-10-04)

arXiv cs.AI 周报 (2026-09-28~2026-10-04)

Meta-summary · 基于 4/7 daily HTML · 2026-09-28~2026-10-04 · 缺 20261002, 20261003, 20261004
Generated by tanar · 2026-10-05 00:01

🗓️ 本周覆盖

本周(2026-09-28 ~ 2026-10-04)共 4/7 天 daily 报告可用。 缺失日期:2026-10-02, 2026-10-03, 2026-10-04(这些日的论文不在本汇总范围内)。 下文所有数字和取舍都基于这 4 天的 daily picks。

🔥 本周主题

Agent Harness 与自我改进范式多元化(在 4/4 天出现)

本周最密集的研究主线。从"反思文本微调替代 RL"到"harness 实例级自适应"再到"视觉 harness 达满分",社区正从单一 RL 路线转向多元自我改进范式的探索期——核心问题是信用分配和探索效率,而 RL 只是其中一种答案。

RLVR 副作用与训练理论深化(在 4/4 天出现)

RLVR 研究从"能用就行"进入副作用可度量、可理论刻画的成熟期。token 级信用分配、on-policy 蒸馏多场景泛化、以及 RLVR 后训练的 语言漂移/覆盖率损失 被系统揭示。

安全威胁模型从静态走向动态(在 4/4 天出现)

蒸馏防御在 RL 后失效、自演化 Agent 产生内生不对齐、代码域安全泛化缺口、安全路由评测在分布偏移下失效——安全评估不能再只看"训练后那一刻",静态威胁模型正在被淘汰。

多模态视觉推理与高效生成(在 4/4 天出现)

从统一模型自反思改进图像生成、视觉 token 效率优化、到视觉 harness 在 ARC-AGI 达满分——多模态研究从感知到生成的闭环日趋成熟。

线性注意力与高效推理量化(在 3/4 天出现)

线性注意力模型的 recurrent state 量化成为独立子方向;KV cache 压缩从 eviction 转向自适应配置。反映出 Qwen3、Kimi-Linear、GLM 等模型已进入工业部署阶段。

📈 方向走势

持续高产:Agent Harness/自我改进(4/4 天出现,每日 5-12 篇)、RLVR 训练与蒸馏(4/4 天,每日 5-10 篇)、安全/对齐(4/4 天,每日 4-8 篇)、多模态视觉(4/4 天,每日 4-10 篇)——这四条主线贯穿整周,构成 cs.AI 的核心叙事。

本周爆发:Agent Harness 一词在 09-30 集中爆发(6+ 篇以 harness 为核心概念),并在 10-01 由 VISTA 将"harness 设计"推至高潮(ARC-AGI-3 满分)。线性注意力量化在 09-29 同日出现两篇独立工作(LeapQuant + STEPQuant),标志其成为独立子方向。

新兴方向:机器人/具身智能在 09-30 和 10-01 连续两天密集出现(每日 12-25 篇),包括 GroundingPI、RoboCoach、RPG 等,暗示具身智能正成为 cs.AI 的新增长极。

🌟 周度 Top 10

  1. VISTA: A Visual Harness for Reasoning in an Interactive World

    Qiushi Han, Kaiming He 等 · 被 1/4 天 daily Top 10 选中 · 视觉 harness 在 ARC-AGI-3 达满分 100.00,证明 harness 设计而非模型规模是解锁复杂推理的关键路径

  2. Shockingly Simple Self-retrospection Improves Agentic Models Without RL

    Jonathan Light, Christopher Zhang Cui 等 · 被 1/4 天 daily Top 10 选中 · 仅靠反思文本微调媲美 GRPO,颠覆"Agent 改进必须 RL"的共识

  3. Context Language Models

    Rulin Shao, Pang Wei Koh 等 · 被 1/4 天 daily Top 10 选中 · 将上下文管理从外挂变为模型内禀能力,零样本超越 SOTA,RL 后 BrowseComp-Plus +47.6%

  4. SCAPO: Semifactual Credit-Augmented Policy Optimization

    Junshu Pan, Zhizhang Fu 等 · 被 1/4 天 daily Top 10 选中 · 因果启发的 token 级信用分配,AIME +5.63pp 且 OOD 泛化全面领先

  5. Cogentic: Multi-Agent Orchestration for Automated Proof Discovery

    Yang Cai, Vineet Gupta 等 · 被 1/4 天 daily Top 10 选中 · 首次用 multi-agent 在开放数学问题上产出专家验证的新定理

  6. Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

    Yen-Ju Wang, Pieter Abbeel, Haozhi Qi 等 · 被 1/4 天 daily Top 10 选中 · 无需权重更新的机器人自主改进,22 任务成功率 95%,30 次物理试验全通过

  7. Telescopic Language Models

    Zhilin Guo, Boqiao Zhang 等 · 被 1/4 天 daily Top 10 选中 · 单次训练产出全深度可用模型,质量-预算曲线下降 43%

  8. On Language Drift during RLVR Post-Training

    Michael Sullivan, Alexander Koller · 被 1/4 天 daily Top 10 选中 · 理论证明 RLVR 允许无界语言漂移,揭示 CoT 可监控性根本张力

  9. CodeMimicry: Exploiting Safety Generalization Lag in LLMs

    Zhen Liang, Hai Huang 等 · 被 1/4 天 daily Top 10 选中 · 96.25% 越狱成功率暴露代码域安全对齐的结构性缺口

  10. LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization

    Yi Pan, Song Han, Ion Stoica 等 · 被 1/4 天 daily Top 10 选中 · 训练无关 8-bit 量化,跨三大模型家族验证,B200 端到端 1.47× 加速

📊 本周数字

~1257
4 天合计 cs.AI 提交论文(从 daily subtitle 加总:390+347+287+233)
4/4
Agent Harness/自我改进在全部 4 天 daily 中出现,本周最强信号方向
cs.LG
最活跃交叉子类(每日 71-117 篇与 cs.AI 交叉),其次为 cs.CL(48-66 篇)
40
4 天 daily Top 10 合计 40 篇精选论文(无跨日重复,信号分散)
96.25%
本周最高越狱成功率(CodeMimicry,8 个商用 LLM 代码补全攻击)

🔮 趋势观察

"Harness 设计"成为解锁性能的下一层杠杆

本周 4 天的 daily 报告中,"harness"(执行框架)一词从 09-28 的零星出现到 09-30 的 6+ 篇集中爆发,再到 10-01 由 VISTA 在 ARC-AGI-3 达满分推向高潮。这些工作共同表明:在 frozen 模型能力趋于饱和时,外部架构设计——而非增大模型——是解锁性能的下一层杠杆。这一趋势与"Agent 自我改进从有奖励走向无奖励"并行:SelfSearch 不用奖励信号、RLTL;DR 用 verifier 输出替代任务奖励、ROFT 仅用反思文本微调。社区正在从"RL 挤出最后一点性能"转向"如何让 agent 在没有明确成功信号时也能进步"。

安全研究从"提出防御"走向"证明不可能性"

本周安全方向的一个重要转向:从"提出防御"转向证明防御不可能性。蒸馏防御在 RL 后失效、安全路由评测在分布偏移下失效、零知识监督被证明不可能、CoT trace 可靠性被根本质疑——这些工作不再是"提出更好的防御",而是揭示现有安全范式的结构性天花板。这是研究深化的信号,但也意味着工业部署面临的真实安全鸿沟比预期更大。