Qwen · HF · 通义

Qwen3.8-2.4T-A95B-FP8

Qwen3.8-2.4T-A95B-FP8

二〇二六年八月二十六日 · 英文原文

Qwen 团队发布 Qwen3.8-2.4T-A95B-FP8,为 Qwen 开源家族中首个开源 Qwen-Max 级别模型。该模型总参数量 2.4T,激活 95B,原生上下文 262,144 token,可扩展至 1,010,000。采用块大小 128 的细粒度 FP8 量化,兼容 vLLM、SGLang、TokenSpeed 等框架。在 Terminal Bench 2.1、PaperBench 等编程与 agent 基准上,Qwen3.8-Max 得分分别为 86.6 和 93.0。

Qwen3.8-2.4T-A95B-FP8

Qwen Studio

[!Note] 本仓库包含后训练模型在 Hugging Face Transformers 格式下的 FP8 量化模型权重和配置文件。

这些产物兼容 vLLM、SGLang、TokenSpeed 等框架。

量化方法为块大小为 128 的细粒度 fp8 量化,其性能指标与原模型几乎一致。

[!Tip] 对于需要托管式、可扩展推理且无需维护基础设施的用户,官方 Qwen API 服务由 Qwen Cloud 提供。

特别是,Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多功能,如视觉输入与非思考模式支持、默认 1M 上下文长度、官方内置工具等。 更多信息请参阅 Qwen3.8-Max 概览

继 Qwen3.5 和 Qwen3.6 系列获得社区广泛采用之后,我们很高兴推出 Qwen3.8,这是迄今为止 Qwen 开源模型家族中能力最强的一代。

Qwen3.8 首次将 Qwen-Max 级别的模型开源发布。 Qwen3.8 基于 Qwen3.5 的架构基础构建,在编程、专业工作、研究以及长周期 agentic 任务方面均实现了显著提升。除了回答更难的问题,Qwen3.8 还被设计为能够以更高的可靠性完成复杂、多步骤的任务。

Qwen3.8 亮点

Qwen3.8 具备以下增强特性:

更多详情请参阅我们的博客文章 Qwen3.8-Max

模型概览

基准测试结果

快速开始

为简化集成,我们建议通过 API 使用 Qwen3.8。

部署 Qwen3.8

[!Important] 不同框架的推理效率和吞吐量差异显著。 我们建议使用最新版本的框架以确保最佳性能和兼容性。 对于生产负载或高吞吐量场景,推荐使用 SGLang、vLLM 或 TokenSpeed 等专用推理引擎。

Qwen3.8 可使用主流推理框架部署,例如:

API 使用

[!Important] Qwen3.8-2.4T-A95B 是纯文本模型,所有交互均需使用思考模式。不支持多模态输入,且无法关闭思考。每个响应都会自动以 <think>\n...</think>\n\n 中的推理内容开头,然后才是最终输出。

[!Tip] 我们建议使用以下采样参数进行生成:

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

请注意,不同推理框架对采样参数的支持有所不同。

Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度并控制成本:

此外,preserve_thinking 默认对所有工作负载启用,以提供最佳的开箱即用体验。

Chat Completions API

Chat Completions API 可用于大多数推理框架,以及 Qwen Cloud。 开始之前,请确保已安装 OpenAI Python SDK,并配置好 API 密钥和 API 基础 URL,例如:

pip install -U openai

# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
纯文本输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B-FP8",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # 默认开启;不应关闭
            "preserve_thinking": True, # 默认开启
        },
    },
    reasoning_effort="xhigh",  # 默认为 xhigh;支持的级别为 xhigh、medium 和 low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

[!Note] 如果您使用的是 Qwen Cloud 的 API,除了更改 model 之外,请传入 extra_body={"enable_thinking": True, "preserve_thinking": True},而不是 extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}

最佳实践

为获得最佳性能,我们建议以下设置:

  1. 采样参数

    • 我们建议使用以下采样参数:
      • temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
    • 对于支持的框架,您可以将 presence_penalty 参数调整为 0 到 2 之间的值,以减少无休止的重复。但使用较高的值偶尔可能导致语言混用和模型性能略有下降。
  2. 充足的输出长度:为优化 agentic 任务的性能,我们建议分配足够的输出长度,让模型生成详细且全面的响应。对于支持为内部推理和最终输出分别设置 token 上限的框架,我们建议在 1M 上下文长度内进行以下配置:

    • 推理内容:将最大输出长度设置为 262,144 个 token。
    • 最终响应:将最大输出长度设置为 131,072 个 token。

    这些设置为复杂推理提供了必要的能力,同时确保为高质量的最终交付物留出充足空间。

引用

如果您觉得我们的工作有帮助,欢迎引用我们。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}
译自 Qwen · HF · 通义 · 录于 二〇二六年八月二十六日