LLM研究论文:2026年列表(1月至5月)
LLM Research Papers: The 2026 List (January to May)
2026年1月至5月,作者整理了一份LLM研究论文精选列表,涵盖架构与模型设计、高效训练与扩展、推理效率与KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与RLVR、Agent系统与工具使用、编码Agent与软件工程、扩散语言模型、模型评估与基准测试等类别。列表侧重于推理模型、强化学习、高效推理、Agent框架、工具使用、长上下文、扩散语言模型和服务基础设施。关键论文包括Nemotron 3 Super(Nvidia,混合Mamba-2与attention架构)、Mamba-3、Gated DeltaNet-2、Qwen3.6(使用Gated DeltaNet层)等。
LLM 研究论文:2026 年列表(1 月至 5 月)
如各位所知,我长期保持一个习惯,即持续记录我想在未来文章和项目中阅读、回顾或引用的研究论文。去年,我分享了两份整理好的论文列表,一份覆盖 1 月至 6 月,另一份覆盖 7 月至 12 月。几位读者告诉我这些列表非常有用,因此,本着类似的精神,我为 2026 年上半年准备了一份新列表。这份列表涵盖我从 2026 年 1 月至 5 月收藏的论文。请不要将其视为今年所有发表论文的完整列表。每天发表的论文数量太多,要做到完整覆盖完全不现实。相反,这是一份基于我觉得有趣或与我自身工作相关的论文整理而成的精选参考列表。在整理列表时,我仔细阅读了标题、摘要和主题框架,但必须承认,我也只详细阅读了其中一部分论文。
为什么要制作这些列表?当我在撰写文章、书籍章节、代码示例或讲稿时,我常常记得在某处见过一篇相关论文,但再次找到它却出奇地令人烦恼。一份分类的 Markdown 列表为我解决了这个问题,我希望它对你也有用。(即使在基于 LLM 的网页搜索时代,拥有一份具体的上下文列表仍然非常有用。)
今年,列表再次侧重于推理模型、强化学习和高效推理,因为我倾向于收藏与我当前工作相关的论文。然而,与 2025 年的列表相比,我也收藏了更多关于 agent 框架、工具使用、长上下文、扩散语言模型和实际服务基础设施的论文,因为这是我目前深度参与的领域,也是该领域的发展方向。
本研究论文列表的分类如下。(专业提示:在本文的网页版本中,你可以使用左侧的目录直接跳转到与你最相关的部分。)
- 架构与模型设计
- 高效训练与扩展
- 推理效率与 KV Cache
- 稀疏注意力与长上下文
- 推理与测试时计算
- 强化学习与 RLVR
- Agent 系统与工具使用
- 编码 Agent 与软件工程
- 扩散语言模型
- 模型评估与基准测试
1. 架构与模型设计
第一部分收集了关于模型架构、模型发布技术报告以及有助于解释当前 LLM 为何呈现现有形态的论文。关于 2026 年,我发现有趣的一点是,架构工作已不仅仅是让 transformer 变得更大。围绕混合架构(例如,Nemotron 3 和 Arcee Trinity)、状态空间层(Nemotron 3 和 Mamba-3)、MoE 容量分配(Scaling Embeddings Outperforms Scaling Experts 和 Step 3.5 Flash)、激活行为(The Spike, the Sparse and the Sink)以及表示几何(Symmetry in Language Statistics Shapes the Geometry of Model Representations)有大量工作。所有这些论文都相当有趣,这也是我最初收藏它们的原因。但如果必须选一篇必读文章,我可能会选 Nemotron 3 Super,因为这篇文章非常详细(无意双关),并且描述了已在生产环境中使用的模型所采用的技术。毕竟,它是其尺寸类别中最好的模型之一。
Nemotron 3 的一个有趣方面是其混合架构设计,这意味着它在常规 attention 层和 Mamba-2(状态空间模型)层之间交替,以在长上下文中更高效。在 2026 年,长上下文效率至关重要,因为越来越多的 LLM 被接入 agent 框架(OpenClaw 等),这需要处理越来越长的上下文。话虽如此,120B-A12B 对于在普通消费级硬件上进行本地推理来说可能有点过大,但也有 Nemotron 3 Nano(4B)版本。
图 1:Nemotron-3 Super 的架构,这是一种使用 Mamba-2 层的混合架构。请注意,2 天前,Nvidia 还发布了其扩展版本 Nemotron 3 Ultra(550B-A55B),该版本扩展了 embedding 和 projection 维度,但使用了相同的构建模块。如果你对可视化感兴趣,我在 Substack Notes 上发布了相关内容,链接在此。
这种交替使用 attention 和替代层的混合架构趋势是今年相对流行的发展方向。使用类似混合设计的最流行的开放权重 LLM 系列可能是 Qwen3.6,它在非 attention 部分使用 Gated DeltaNet 层而非 Mamba-2 层。更多信息,请参阅我的 Hybrid Attention(https://sebastianraschka.com/llm-architecture-gallery/hybrid-attention/)文章,该文章汇集了我之前几篇关于此主题的 Substack 文章中的信息。此外,在下面的论文列表中,你可能会注意到现在有 Mamba-3 和 Gated DeltaNet-2(即 Mamba-2 和 GatedDeltaNet 的新版本),看到它们出现在即将推出的开放权重 LLM(例如,Nemotron-4 和 Qwen4?)中将会很有趣。除了描述混合架构设计,Nemotron-3 论文还包含大量其他有趣的消融实验,例如,围绕用于推测解码的多 token 预测、NVFP4 预训练与 BF16、合成 MMLU 风格数据以及训练后量化方案,但详细涵盖这些内容超出了本概述的范围。
- 1 Jan, Deep Delta Learning, https://arxiv.org/abs/2601.00417
- 6 Jan, MiMo-V2-Flash Technical Report, https://arxiv.org/abs/2601.02780
- 13 Jan, Ministral 3, https://arxiv.org/abs/2601.08584
- 29 Jan, Scaling Embeddings Outperforms Scaling Experts in Language Models, https://arxiv.org/abs/2601.21204
- 30 Jan, LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs, https://arxiv.org/abs/2602.00462
- 4 Feb, ERNIE 5.0 Technical Report, https://arxiv.org/abs/2602.04705
- 8 Feb, ViT-5: Vision Transformers for the Mid-2020s, https://arxiv.org/abs/2602.08071 (本文大部分内容聚焦于 LLM,但我忍不住收录了一个重要的新视觉 transformer 设计。)
- 11 Feb, Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters, https://arxiv.org/abs/2602.10604
- 12 Feb, Nanbeige4.1-3B: A Small General Model That Reasons, Aligns, and Acts, https://arxiv.org/abs/2602.13367
- 16 Feb, Symmetry in Language Statistics Shapes the Geometry of Model Representations, https://arxiv.org/abs/2602.15029
- 17 Feb, GLM-5: From Vibe Coding to Agentic Engineering, https://arxiv.org/abs/2602.15763
- 18 Feb, Arcee Trinity Large Technical Report, https://www.arxiv.org/abs/2602.17004
- 4 Mar, The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks, https://arxiv.org/abs/2603.05498
- 12 Mar, Tiny Aya: Bridging Scale and Multilingual Depth, https://arxiv.org/abs/2603.11510
- 15 Mar, Attention Residuals, https://arxiv.org/abs/2603.15031
- 16 Mar, Mamba-3: Improved Sequence Modeling Using State Space Principles, https://arxiv.org/abs/2603.15569
- 31 Mar, Attention to Mamba: A Recipe for Cross-Architecture Distillation, https://arxiv.org/abs/2604.14191
- 13 Apr, Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning, https://arxiv.org/abs/2604.12374
- 6 May, ZAYA1-8B Technical Report, https://arxiv.org/abs/2605.05365
- 13 May, Delta Attention Residuals, https://arxiv.org/abs/2605.18855
- 21 May, Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention, https://arxiv.org/abs/2605.22791
- 25 May, The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence, https://arxiv.org/abs/2605.26494
2. 高效训练与扩展
本节涉及训练系统、适应方法和扩展方案。这些论文并非(全部)关于从头开始预训练。有些侧重于微调、蒸馏、测试时训练,或在受限硬件上更好地进行训练。