Qwen3.8-2.4T-A95B
Qwen3.8-2.4T-A95B
阿里巴巴 Qwen 团队发布 Qwen3.8-2.4T-A95B 开源模型,总参数量 2.4T,激活 95B,原生上下文 262,144 tokens,可扩展至 1,010,000。该模型基于 Qwen3.5 架构,在编程、专业工作、研究及长周期 agentic 任务上提升,支持通过 `reasoning_effort` 调节推理深度。权重以 Hugging Face Transformers 格式提供,兼容 vLLM、SGLang、TokenSpeed 等框架。官方版本 Qwen3.8-Max 由 Qwen Cloud 提供 API 服务,支持视觉输入及 1M 上下文。
Qwen3.8-2.4T-A95B
[!Note] 本仓库包含以 Hugging Face Transformers 格式存储的后训练模型权重和配置文件。
这些产物兼容 vLLM、SGLang、TokenSpeed 等框架。
[!Tip] 对于需要托管式、可扩展推理且无需维护基础设施的用户,官方 Qwen API 服务由 Qwen Cloud 提供。
特别地,Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多功能,例如视觉输入与非思考模式支持、默认 1M 上下文长度、官方内置工具等。 更多信息请参阅 Qwen3.8-Max 概览。
继 Qwen3.5 和 Qwen3.6 系列获得社区广泛采用之后,我们很高兴推出 Qwen3.8,这是迄今为止 Qwen 开源模型家族中能力最强的一代。
Qwen3.8 首次将 Qwen-Max 级别的模型开源发布。 Qwen3.8 基于 Qwen3.5 的架构基础构建,在编程、专业工作、研究以及长周期 agentic 任务方面均实现了显著提升。除了能回答更难的问题,Qwen3.8 还被设计为能够以更高的可靠性完成复杂、多步骤的任务。
Qwen3.8 亮点
Qwen3.8 具备以下增强特性:
- 核心能力:在编程、专业工作、研究以及长周期 agentic 任务方面实现全面改进。
- Agent 执行:更强的自主规划能力和对环境反馈的处理能力,从而实现更可靠的端到端任务完成。
- 下游兼容性:对主流 harness 和开发工具提供更广泛的支持,使其更易于集成到现有技术栈中。
- 灵活的思考控制:可通过
reasoning_effort调节推理深度,并通过preserve_thinking保留历史消息中的推理上下文。
更多详情,请参阅我们的博客文章 Qwen3.8-Max。
模型概览
- 类型:因果语言模型
- 训练阶段:预训练与后训练
- 语言模型
- 参数量:总计 2.4T,激活 95B
- 隐藏维度:8192
- Token 嵌入:248,320(已填充)
- 层数:92
- 隐藏层布局:23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
- Gated DeltaNet:
- 线性注意力头数:V 为 128,QK 为 16
- 头维度:128
- Gated Attention:
- 注意力头数:Q 为 64,KV 为 4
- 头维度:256
- 旋转位置嵌入维度:64
- 混合专家(Mixture of Experts):
- 专家数量:512
- 激活专家数量:10 个路由 + 1 个共享
- 专家中间维度:2048
- LM 输出:248,320(已填充)
- MTP(多 Token 预测):经过多步训练
- 上下文长度:原生 262,144,可扩展至 1,010,000 tokens。
基准测试结果
快速开始
为简化集成,我们建议通过 API 使用 Qwen3.8。
部署 Qwen3.8
[!Important] 不同框架的推理效率和吞吐量差异显著。 我们建议使用最新版本的框架,以确保获得最佳性能和兼容性。 对于生产工作负载或高吞吐量场景,建议使用专门的 serving 引擎,如 SGLang、vLLM 或 TokenSpeed。
Qwen3.8 可以使用主流推理框架进行部署,例如:
API 使用
[!Important] Qwen3.8-2.4T-A95B 是一个纯文本模型,所有交互均需使用思考模式。不支持多模态输入,且无法关闭思考。每个响应都会自动以
<think>\n...</think>\n\n中的推理内容开头,然后才是最终输出。
[!Tip] 我们建议在生成时使用以下采样参数:
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0请注意,不同推理框架对采样参数的支持程度有所不同。
Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度并控制成本:
xhigh(默认):适用于需要深入分析的复杂任务medium:在准确性和速度之间取得平衡low:高效推理,优化速度和成本
此外,preserve_thinking 默认对所有工作负载启用,以提供最佳的开箱即用体验。
Chat Completions API
Chat Completions API 可用于大多数推理框架,以及 Qwen Cloud。 开始之前,请确保已安装 OpenAI Python SDK,并已配置 API key 和 API base URL,例如:
pip install -U openai
# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
纯文本输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True, # 默认开启;不应关闭
"preserve_thinking": True, # 默认开启
},
},
reasoning_effort="xhigh", # 默认为 xhigh;支持 xhigh、medium 和 low
stream=True,
stream_options={"include_usage": True},
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
[!Note] 如果您使用的是 Qwen Cloud 的 API,除了更改
model之外,请传入extra_body={"enable_thinking": True, "preserve_thinking": True},而不是extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}。
最佳实践
为获得最佳性能,我们建议以下设置:
采样参数:
- 我们建议使用以下采样参数:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
- 对于支持的框架,您可以将
presence_penalty参数调整到 0 到 2 之间,以减少无休止的重复。但使用较高的值偶尔可能导致语言混杂和模型性能略有下降。
- 我们建议使用以下采样参数:
充足的输出长度:为优化 agentic 任务的性能,我们建议分配足够的输出长度,使模型能够生成详细且全面的响应。对于支持为内部推理和最终输出分别设置 token 上限的框架,我们建议在 1M 上下文长度内进行以下配置:
- 推理内容:将最大输出长度设置为 262,144 tokens。
- 最终响应:将最大输出长度设置为 131,072 tokens。
这些设置为复杂推理提供了必要的能力,同时为高质量的最终交付物保留了充足的空间。
引用
如果您觉得我们的工作有帮助,欢迎引用我们。
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}