Together AI 在 ICML 2026:全栈前沿研究
Together AI at ICML 2026: frontier research across the full stack
Together AI 在 ICML 2026 上发表了八篇覆盖从 agent 到 GPU kernel 技术栈的论文。DSGym 统一了 10+ 领域 1000+ 数据科学任务的评估与训练框架;ThunderAgent 实现最高 3.6 倍 agent 推理吞吐量;TTT-Discover 使用开源 120B 模型在数学、GPU kernel 等领域取得超越人类的发现。RARO 无需验证器即达到 25% 胜率;V1 将 Pass@1 提升 10%。Aurora 在流量变化时实现 1.25 倍推测解码加速。Untied Ulysses 在单节点上支持 5M token 上下文,OEA 将 MoE 解码延迟降低 39%。
八篇论文列在一起信息量很大。更好的阅读方式是看它们在技术栈中的位置。前沿AI并非在单一层构建,而是从agent到GPU kernel的研究产物——如果某一层的提升无法被相邻层跟上,那么这一层的增益就会被浪费。
这是我们工作的核心。从顶层的frontier agent到底层的kernel,我们的研究触及每一层,且每一层都滋养着下一层。研究成果成为Together平台的一部分,而平台上运行的生产负载又指引我们寻找下一个研究问题。Aurora——我们在ICML上关于自适应推测解码(adaptive speculative decoding)的论文——就是一个清晰的例子:同一研究路线如今已作为我们的ATLAS推测器(speculator)在生产环境中上线。
以下是今年按层自上而下的工作。
01 Frontier agent
能完成实际工作的agent——用无法蒙混过关的任务来衡量。
DSGym 10+领域,1,000+任务
ThunderAgent 最高3.6倍agent推理速度
TTT-Discover 超越最佳人类与开源模型
02 模型塑造
将基础模型塑造成推理者——即便没有标准答案可核对。
RARO 25%胜率,无需验证器
V1 正确回答最多提升10%
03 算法优化
降低每个token的成本——适应实时流量的推测解码。
Aurora 流量变化时1.25倍加速
04 系统优化
在相同GPU上容纳更多——更长上下文、更大批次、更快MoE解码。
Untied Ulysses 单节点5M token上下文
OEA MoE解码最高提速39%
05 Kernel
一切运行其上的GPU kernel——微秒级优化在整个栈中累积。
今年该层没有新的ICML论文,但它同样是飞轮的核心。你可以在Together博客上阅读我们的kernel研究工作。
Frontier agent
技术栈顶层:构建能完成实际工作的agent,并诚实衡量它们。
论文1
DSGym: 评估与训练数据科学Agent的整体框架
1,000+任务
10+领域,统一API
涵盖10+领域超过100个数据科学任务,统一在单一评估与训练API之下。 数据科学agent一直难以被公平衡量——每个benchmark都有自己的接口,且许多任务无需打开数据就能解决。DSGym标准化了衡量方式,并堵住了这个漏洞。
它将多种评估套件统一到一个API下,共享数据集、agent和指标的抽象,并在一个自包含的执行环境中运行每个任务,agent必须处理数据而非回忆答案。在精炼的现有套件之上,它新增了90个基于学术文献的专家级生物信息学任务和92个端到端的Kaggle式建模竞赛。同一环境随后反向用作训练引擎:轨迹生成和合成查询流水线产生经执行验证的数据,我们用它训练了一个4B模型,使其成为最先进的开源数据科学agent,无需任何人工标注。诚实评估、从同一框架合成数据、微调、再评估——全部在一个框架内完成。
作者:Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou。合作者来自斯坦福大学、杜克大学和哈佛大学。
论文2
ThunderAgent: 一个简单、快速且感知程序结构的Agent推理系统
最高3.6倍
agent吞吐量
实现agent工作负载1.5至3.6倍的推理吞吐量提升,仅需三行代码即可采用。 并行agent工作负载不再因负载而崩溃,而解决方案并非更快的模型。
问题在于推理引擎不知道自己在运行agent。它将多轮工作流的每一步视为独立请求,在负载下延迟最高膨胀7.14倍。ThunderAgent将工作流本身作为调度器可以端到端推理的一等对象。除了吞吐量提升,它还实现了比最先进系统快1.8至3.9倍的RL rollout,以及最高4.2倍的磁盘节省。
作者:Hao Kang, Ziyang Li, Xinyu Yang, Weili Xu, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora。合作者来自佐治亚理工学院、卡内基梅隆大学和伊利诺伊大学厄巴纳-香槟分校。
论文3
在测试时学习发现(TTT-Discover)
超越最佳人类
开源模型,约$500
在数学、GPU kernel、竞争性算法和生物学四个领域取得最先进发现,全部使用开源模型。 此前该级别的所有成果都依赖于无法检查或运行的闭源前沿模型API。TTT-Discover使用开源的120B模型和一种不变的方法达到这一水平,每个问题仅花费几百美元。
AI发现的常规方法是搜索:将冻结的模型提示数千次并保留最佳样本。TTT-Discover则在测试时对面前的单个问题运行强化学习,因此每次尝试都成为下一次的训练数据,模型在工作中不断改进,在相同采样预算下,简单的best-of-N永远无法追上。相同的设置,未经修改,为数学中一个已有60年历史的Erdős问题设定了更紧的界(超越了此前使用闭源模型的AI记录),发现了比GPUMode排行榜上最佳先前提交更快的GPU kernel,在竞争性编程竞赛中取得了一流成绩,并在生物学单细胞去噪benchmark上创下新高——全部基于开源的gpt-oss-120b。代码和创纪录的kernel均已公开。
作者:Mert Yuksekgonul, Daniel Koceja, Xinhao Li, Federico Bianchi, Jed McCaleb, Xiaolong Wang, Jan Kautz, Yejin Choi, James Zou, Carlos Guestrin, Yu Sun。合作者来自斯坦福大学、NVIDIA、加州大学圣地亚哥分校和Astera Institute。
模型塑造
如何训练和塑造模型:推理、微调和强化学习。
论文4
逃离验证器:通过演示学习推理(RARO)
25% vs 5.9%
对比专家 · 无需验证器
对专家回答的胜率为25%,而监督微调仅为5.9%,且完全不使用验证器。 你可以在没有检查器的任务上获得RL级别的推理能力,例如诗歌写作或财务分析,而不仅仅是数学和代码。
基于RL的推理通常假设存在一个可以评分正确性的验证器。RARO(相对对抗推理优化)用对抗博弈替代了它:一个模型同时充当产生专家级答案的策略(policy)和相对主义评判者(relativistic critic),后者学习从两个回答中选出更好的那个。带平局选项的成对比较对训练稳定性至关重要。在Countdown任务上,RARO达到54.4%的准确率,而使用真实验证器的RL为57.7%——尽管RARO并未使用验证器;相比之下,SFT或迭代DPO无法超过40.7%。学习到的评判者还可以在测试时充当重排序器,将DeepMath在7B规模下从57.5%提升至68.4%。
作者:Locke Cai, Max Ryabinin, Ivan Provilkov
论文5
V1: 统一并行推理器的生成与自我验证
+10%
Pass@1 · 相同计算量
正确回答最多提升10%,来自你已经支付过的生成结果。 优势在于更好的答案选择,而非更多计算。
当你采样多个答案却没有预言机(oracle)时,独立评分每个答案会失效——评判者几乎给所有答案打10分,从而失去区分能力。V1通过一个近线性的瑞士锦标赛验证器(Swiss-tournament verifier)将选择重新定义为比较。训练方法V1-PairRL教会单个模型同时生成并成对验证自己的输出,即使完全不进行测试时验证,也能提升基础准确率。
作者:Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingyang Wu, Samir Khaki, Rishabh Tiwari, Long Lian, Yucheng Lu, Boyi Li, Alane Suhr, Ben Athiwaratkun, Kurt Keutzer。合作者来自加州大学伯克利分校、NVIDIA和Mila。
算法优化
降低推理的数学成本:推测解码、量化、RL推理。
论文6
当RL遇上自适应推测训练:统一的训练-服务系统(Aurora)
1.25倍
流量变化时
在全新的前沿模型(如MiniMax M2.1 229B和Qwen3-Coder-Next 80B)上实现1.5倍的初始加速,并且在流量变化时,相比强静态推测器额外获得1.25倍加速。 推测解码在第一天就很快,并且运行时间越长越快。
大多数部署离线训练推测器并冻结它,因此部署缓慢,且随着流量和目标模型变化而过时。Aurora将在线推测器学习重新定义为在生产环境中运行的异步强化学习问题:接受和拒绝的token作为奖励信号,训练服务器持续更新推测器,新权重以零停机时间热替换到服务器中。
作者:Junxiong Wang, Fengxiang Bie, Jisen Li, Zhongzhu Zhou, Zelei Shao, Yubo Wang, Yinghui Liu, Qingyang Wu, Avner May, Sri Yanamandra, Yineng Zhang, Ce Zhang, Tri Dao, Percy Liang, Ben Athiwaratkun, Shuaiwen Leon Song, Chenfeng Xu, Xiaoxia Wu。
系统优化
训练和服务模型的系统:解耦、批处理、调度、上下文并行。
论文7
Untied Ulysses: 通过逐头分块实现内存高效的上下文并行
5M token
单节点 · 约87.5%内存
在单个8xH100节点上训练5M token上下文,注意力内存最高减少87.5%。 你可以在没有更大集群的情况下训练极长上下文。
注意力层内部的激活内存限制了长上下文训练,增加GPU数量也无法突破这一上限。UPipe每次处理少量注意力头,并在不同阶段复用相同缓冲区,在32B Transformer上将峰值注意力内存最高削减87.5%。结果是单节点5M token(比先前方法多约25%),双节点8M token,同时保持相同吞吐量。它是DeepSpeed-Ulysses在相同FlashAttention-3 kernel上的即插即用替代品,代码已开源。
作者:Ravi Ghadia, Maksim Abraham, Sergei Vorobyov, Max Ryabinin。
论文8
机会性专家激活:无需重新训练的批量感知专家路由以实现更快解码(OEA)
最高39%
更快的MoE解码
MoE解码延迟最高降低39%,无需重新训练,无需架构更改。 你免费回收了批处理悄悄破坏的稀疏性。
混合专家模型本应廉价,因为每个token只触及少数专家,但一旦批处理,稀疏性就会崩溃:在batch size为16时,每个token需要8个专家的模型最终会加载约82个专家。OEA的批量感知路由在推理时通过两个阶段恢复稀疏性,第二阶段允许token共享批次已加载的专家,以零延迟成本买回质量。在AIME24、GPQA、LiveCodeBench和MATH 500上准确率保持持平,且只有一个超参数需要调整。
作者:Costin-Andrei Oncescu, Qingyang Wu, Wai Tong Chung, Robert Wu, Bryan Gopal, Junxiong Wang, Tri Dao, Ben Athiwaratkun。合作者来自哈佛大学和普林斯顿大学。
数据一览
1,000+任务
10+领域,统一API
DSGym
最高3.6倍
agent吞吐量
ThunderAgent
超越最佳人类
开源模型,约$500
TTT-Discover
25% vs 5.9%
对比专家 · 无需验证器
RARO
+10%
Pass@1 · 相同计算量
V1
1.25倍
流量变化时
Aurora
5M token
单节点 · 约87.5%内存
Untied Ulysses
最高39%
更快的MoE解码
OEA
在首尔找到我们
全部八篇论文将于2026年7月6日至11日在首尔举行的ICML 2026上展示。欢迎莅临B714展位深入了解。
首尔COEX · 7月6日至11日 B714展位 · 整周
论文 日期与时间 · 首尔KST 海报
Frontier agent
DSGym
周四 7/9 · 下午2:30 – 下午4:15
#66567
ThunderAgent
周二 7/7 · 上午10:30 – 下午12:15
#62040
TTT-Discover
周二 7/7 · 下午5:00 – 下午6:45
#62199
模型塑造
RARO
周四 7/9 · 上午10:30 – 下午12:15
#61507
V1
周四 7/9 · 下午5:00 – 下午6:45
#64825
算法优化
Aurora
周四 7/9 · 上午10:30 – 下午12:15
#66675
系统优化
Untied Ulysses
周四 7/9 · 下午5:00 – 下午6:45
#66102
OEA
周三 7/8 · 上午10:30 – 下午12:15
#62958
我们整周也会在展位。欢迎前来:
- 与论文作者讨论任何一篇论文
- 了解这些研究如何体现在Together平台中——从微调到生产推理
- 与团队见面,了解我们下一步的工作
加入我们一起构建
我们正在招聘希望跨整个技术栈(而非单一层)工作的研究员和研究工程师。请访问together.ai/careers查看空缺职位,或来展位找我们。
对于其他人:请预约首尔会面,浏览完整的研究博客,并在X上关注[@togethercompute],随着深度解读在会议期间陆续发布。