Qwen3.8-2.4T-A95B-FP8
Qwen3.8-2.4T-A95B-FP8
Qwen 团队发布 Qwen3.8-2.4T-A95B-FP8,为 Qwen 开源家族中首个开源 Qwen-Max 级别模型。该模型总参数量 2.4T,激活 95B,原生上下文 262,144 token,可扩展至 1,010,000。采用块大小 128 的细粒度 FP8 量化,兼容 vLLM、SGLang、TokenSpeed 等框架。在 Terminal Bench 2.1、PaperBench 等编程与 agent 基准上,Qwen3.8-Max 得分分别为 86.6 和 93.0。
Qwen3.8-2.4T-A95B-FP8
[!Note] 本仓库包含后训练模型在 Hugging Face Transformers 格式下的 FP8 量化模型权重和配置文件。
这些产物兼容 vLLM、SGLang、TokenSpeed 等框架。
量化方法为块大小为 128 的细粒度 fp8 量化,其性能指标与原模型几乎一致。
[!Tip] 对于需要托管式、可扩展推理且无需维护基础设施的用户,官方 Qwen API 服务由 Qwen Cloud 提供。
特别是,Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多功能,如视觉输入与非思考模式支持、默认 1M 上下文长度、官方内置工具等。 更多信息请参阅 Qwen3.8-Max 概览。
继 Qwen3.5 和 Qwen3.6 系列获得社区广泛采用之后,我们很高兴推出 Qwen3.8,这是迄今为止 Qwen 开源模型家族中能力最强的一代。
Qwen3.8 首次将 Qwen-Max 级别的模型开源发布。 Qwen3.8 基于 Qwen3.5 的架构基础构建,在编程、专业工作、研究以及长周期 agentic 任务方面均实现了显著提升。除了回答更难的问题,Qwen3.8 还被设计为能够以更高的可靠性完成复杂、多步骤的任务。
Qwen3.8 亮点
Qwen3.8 具备以下增强特性:
- 核心能力:在编程、专业工作、研究和长周期 agentic 任务方面全面改进。
- Agent 执行:更强的自主规划能力和对环境反馈的更好处理,实现更可靠的端到端任务完成。
- 下游兼容性:对主流评测框架和开发工具的支持更广泛,更易于集成到现有技术栈中。
- 灵活的思考控制:可通过
reasoning_effort调节推理深度,并通过preserve_thinking保留历史消息中的推理上下文。
更多详情请参阅我们的博客文章 Qwen3.8-Max。
模型概览
- 类型:因果语言模型
- 训练阶段:预训练与后训练
- 语言模型
- 参数量:总计 2.4T,激活 95B
- 隐藏维度:8192
- Token 嵌入:248,320(已填充)
- 层数:92
- 隐藏布局:23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
- Gated DeltaNet:
- 线性注意力头数:V 为 128,QK 为 16
- 头维度:128
- Gated Attention:
- 注意力头数:Q 为 64,KV 为 4
- 头维度:256
- 旋转位置嵌入维度:64
- 混合专家(MoE):
- 专家数量:512
- 激活专家数量:10 个路由 + 1 个共享
- 专家中间维度:2048
- LM 输出:248,320(已填充)
- MTP(多 Token 预测):经过多步训练
- 上下文长度:原生 262,144,可扩展至 1,010,000 个 token。
基准测试结果
快速开始
为简化集成,我们建议通过 API 使用 Qwen3.8。
部署 Qwen3.8
[!Important] 不同框架的推理效率和吞吐量差异显著。 我们建议使用最新版本的框架以确保最佳性能和兼容性。 对于生产负载或高吞吐量场景,推荐使用 SGLang、vLLM 或 TokenSpeed 等专用推理引擎。
Qwen3.8 可使用主流推理框架部署,例如:
API 使用
[!Important] Qwen3.8-2.4T-A95B 是纯文本模型,所有交互均需使用思考模式。不支持多模态输入,且无法关闭思考。每个响应都会自动以
<think>\n...</think>\n\n中的推理内容开头,然后才是最终输出。
[!Tip] 我们建议使用以下采样参数进行生成:
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0请注意,不同推理框架对采样参数的支持有所不同。
Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度并控制成本:
xhigh(默认):适用于需要深入分析的复杂任务medium:在准确性和速度之间取得平衡low:高效推理,优化速度和成本
此外,preserve_thinking 默认对所有工作负载启用,以提供最佳的开箱即用体验。
Chat Completions API
Chat Completions API 可用于大多数推理框架,以及 Qwen Cloud。 开始之前,请确保已安装 OpenAI Python SDK,并配置好 API 密钥和 API 基础 URL,例如:
pip install -U openai
# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
纯文本输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B-FP8",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True, # 默认开启;不应关闭
"preserve_thinking": True, # 默认开启
},
},
reasoning_effort="xhigh", # 默认为 xhigh;支持的级别为 xhigh、medium 和 low
stream=True,
stream_options={"include_usage": True},
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
[!Note] 如果您使用的是 Qwen Cloud 的 API,除了更改
model之外,请传入extra_body={"enable_thinking": True, "preserve_thinking": True},而不是extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}。
最佳实践
为获得最佳性能,我们建议以下设置:
采样参数:
- 我们建议使用以下采样参数:
temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0
- 对于支持的框架,您可以将
presence_penalty参数调整为 0 到 2 之间的值,以减少无休止的重复。但使用较高的值偶尔可能导致语言混用和模型性能略有下降。
- 我们建议使用以下采样参数:
充足的输出长度:为优化 agentic 任务的性能,我们建议分配足够的输出长度,让模型生成详细且全面的响应。对于支持为内部推理和最终输出分别设置 token 上限的框架,我们建议在 1M 上下文长度内进行以下配置:
- 推理内容:将最大输出长度设置为 262,144 个 token。
- 最终响应:将最大输出长度设置为 131,072 个 token。
这些设置为复杂推理提供了必要的能力,同时确保为高质量的最终交付物留出充足空间。
引用
如果您觉得我们的工作有帮助,欢迎引用我们。
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}