arXiv cs.AI 周报 (2026-09-28~2026-10-04)
🗓️ 本周覆盖
本周(2026-09-28 ~ 2026-10-04)共 4/7 天 daily 报告可用。
缺失日期:2026-10-02, 2026-10-03, 2026-10-04(这些日的论文不在本汇总范围内)。
下文所有数字和取舍都基于这 4 天的 daily picks。
🔥 本周主题
Agent Harness 与自我改进范式多元化(在 4/4 天出现)
本周最密集的研究主线。从"反思文本微调替代 RL"到"harness 实例级自适应"再到"视觉 harness 达满分",社区正从单一 RL 路线转向多元自我改进范式的探索期——核心问题是信用分配和探索效率,而 RL 只是其中一种答案。
- 2026-09-28:Shockingly Simple Self-retrospection Improves Agentic Models Without RL — 仅用反思文本微调媲美 GRPO,颠覆"Agent 改进必须 RL"共识
- 2026-09-29:RLTL;DR: Self-improvement by Internalizing Self-generated Feedback — 失败后写 TL;DR 洞见,Pass@1 从 0% 突破至 14-31%
- 2026-09-30:Turbo Harness: Instance-Adaptive Harness Optimization — 全局 harness 回收为实例级定制补丁,7 个 benchmark 全面优于基线
- 2026-10-01:VISTA: A Visual Harness for Reasoning in an Interactive World — 视觉 harness 在 ARC-AGI-3 达满分 100.00,用比人类少 57.4% 的动作完成全部游戏
RLVR 副作用与训练理论深化(在 4/4 天出现)
RLVR 研究从"能用就行"进入副作用可度量、可理论刻画的成熟期。token 级信用分配、on-policy 蒸馏多场景泛化、以及 RLVR 后训练的 语言漂移/覆盖率损失 被系统揭示。
- 2026-09-28:KV-streams for Efficient Compaction in Agentic RL — 流式 KV cache 实现 2.6–5x 训练加速
- 2026-09-29:Correct Answers, Invalid Traces — 31.6% 正确答案伴随无效 CoT trace,质疑推理监控有效性
- 2026-09-30:SCAPO: Semifactual Credit-Augmented Policy Optimization — 半事实干预度量 token 稳定性,AIME +5.63pp
- 2026-10-01:On Language Drift during RLVR Post-Training — 理论证明 RLVR 允许无界语言漂移,约束漂移必损奖励
安全威胁模型从静态走向动态(在 4/4 天出现)
蒸馏防御在 RL 后失效、自演化 Agent 产生内生不对齐、代码域安全泛化缺口、安全路由评测在分布偏移下失效——安全评估不能再只看"训练后那一刻",静态威胁模型正在被淘汰。
- 2026-09-28:Distillation Defenses Easily Break After Reinforcement Learning — 蒸馏防御在后续 RL 后失效
- 2026-09-29:Correct, Don't Delete: Mitigating Emergent Misalignment — 纠正有害训练数据比删除更有效
- 2026-09-30:CodeMimicry: Exploiting Safety Generalization Lag — 结构化代码补全越狱,8 个商用 LLM 上 96.25% 成功率
- 2026-10-01:False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift — 安全路由评测在分布偏移下失效
多模态视觉推理与高效生成(在 4/4 天出现)
从统一模型自反思改进图像生成、视觉 token 效率优化、到视觉 harness 在 ARC-AGI 达满分——多模态研究从感知到生成的闭环日趋成熟。
- 2026-09-28:Learning Native Reflection in Unified Models with Interleaved RL — 统一模型内 RL 训练反思,GenEval +12 分
- 2026-09-29:NeuronEye: Query-Guided Visual Concept Activation — 稀疏神经元词汇表实现概念级视觉推理
- 2026-09-30:EviRover: Reinforcing Agentic Perception Beyond a Glance — 4B 感知 agent 较骨干提升 30 分
- 2026-10-01:DMAD: Distribution Matching as Adversarial Distillation — 对抗蒸馏实现一步 ImageNet FID 1.04
线性注意力与高效推理量化(在 3/4 天出现)
线性注意力模型的 recurrent state 量化成为独立子方向;KV cache 压缩从 eviction 转向自适应配置。反映出 Qwen3、Kimi-Linear、GLM 等模型已进入工业部署阶段。
- 2026-09-29:LeapQuant — 训练无关 8-bit 量化,B200 端到端 1.47× 加速
- 2026-09-29:KV-Kaizen — 学习逐层 cache 配置,14B 模型 32× 压缩保精度
- 2026-09-30:Scaling Laws for Looped Mixture of Experts — 首个联合建模递归与稀疏性的 scaling law
📈 方向走势
持续高产:Agent Harness/自我改进(4/4 天出现,每日 5-12 篇)、RLVR 训练与蒸馏(4/4 天,每日 5-10 篇)、安全/对齐(4/4 天,每日 4-8 篇)、多模态视觉(4/4 天,每日 4-10 篇)——这四条主线贯穿整周,构成 cs.AI 的核心叙事。
本周爆发:Agent Harness 一词在 09-30 集中爆发(6+ 篇以 harness 为核心概念),并在 10-01 由 VISTA 将"harness 设计"推至高潮(ARC-AGI-3 满分)。线性注意力量化在 09-29 同日出现两篇独立工作(LeapQuant + STEPQuant),标志其成为独立子方向。
新兴方向:机器人/具身智能在 09-30 和 10-01 连续两天密集出现(每日 12-25 篇),包括 GroundingPI、RoboCoach、RPG 等,暗示具身智能正成为 cs.AI 的新增长极。
🌟 周度 Top 10
-
VISTA: A Visual Harness for Reasoning in an Interactive World
Qiushi Han, Kaiming He 等 · 被 1/4 天 daily Top 10 选中 · 视觉 harness 在 ARC-AGI-3 达满分 100.00,证明 harness 设计而非模型规模是解锁复杂推理的关键路径
-
Shockingly Simple Self-retrospection Improves Agentic Models Without RL
Jonathan Light, Christopher Zhang Cui 等 · 被 1/4 天 daily Top 10 选中 · 仅靠反思文本微调媲美 GRPO,颠覆"Agent 改进必须 RL"的共识
-
Context Language Models
Rulin Shao, Pang Wei Koh 等 · 被 1/4 天 daily Top 10 选中 · 将上下文管理从外挂变为模型内禀能力,零样本超越 SOTA,RL 后 BrowseComp-Plus +47.6%
-
SCAPO: Semifactual Credit-Augmented Policy Optimization
Junshu Pan, Zhizhang Fu 等 · 被 1/4 天 daily Top 10 选中 · 因果启发的 token 级信用分配,AIME +5.63pp 且 OOD 泛化全面领先
-
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
Yang Cai, Vineet Gupta 等 · 被 1/4 天 daily Top 10 选中 · 首次用 multi-agent 在开放数学问题上产出专家验证的新定理
-
Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
Yen-Ju Wang, Pieter Abbeel, Haozhi Qi 等 · 被 1/4 天 daily Top 10 选中 · 无需权重更新的机器人自主改进,22 任务成功率 95%,30 次物理试验全通过
-
Telescopic Language Models
Zhilin Guo, Boqiao Zhang 等 · 被 1/4 天 daily Top 10 选中 · 单次训练产出全深度可用模型,质量-预算曲线下降 43%
-
On Language Drift during RLVR Post-Training
Michael Sullivan, Alexander Koller · 被 1/4 天 daily Top 10 选中 · 理论证明 RLVR 允许无界语言漂移,揭示 CoT 可监控性根本张力
-
CodeMimicry: Exploiting Safety Generalization Lag in LLMs
Zhen Liang, Hai Huang 等 · 被 1/4 天 daily Top 10 选中 · 96.25% 越狱成功率暴露代码域安全对齐的结构性缺口
-
LeapQuant: Efficient Linear Attention with Accurate Recurrent State Quantization
Yi Pan, Song Han, Ion Stoica 等 · 被 1/4 天 daily Top 10 选中 · 训练无关 8-bit 量化,跨三大模型家族验证,B200 端到端 1.47× 加速
📊 本周数字
🔮 趋势观察
"Harness 设计"成为解锁性能的下一层杠杆
本周 4 天的 daily 报告中,"harness"(执行框架)一词从 09-28 的零星出现到 09-30 的 6+ 篇集中爆发,再到 10-01 由 VISTA 在 ARC-AGI-3 达满分推向高潮。这些工作共同表明:在 frozen 模型能力趋于饱和时,外部架构设计——而非增大模型——是解锁性能的下一层杠杆。这一趋势与"Agent 自我改进从有奖励走向无奖励"并行:SelfSearch 不用奖励信号、RLTL;DR 用 verifier 输出替代任务奖励、ROFT 仅用反思文本微调。社区正在从"RL 挤出最后一点性能"转向"如何让 agent 在没有明确成功信号时也能进步"。
安全研究从"提出防御"走向"证明不可能性"
本周安全方向的一个重要转向:从"提出防御"转向证明防御不可能性。蒸馏防御在 RL 后失效、安全路由评测在分布偏移下失效、零知识监督被证明不可能、CoT trace 可靠性被根本质疑——这些工作不再是"提出更好的防御",而是揭示现有安全范式的结构性天花板。这是研究深化的信号,但也意味着工业部署面临的真实安全鸿沟比预期更大。
评论