Qwen · HF · 通义

Qwen3.8-2.4T-A95B

Qwen3.8-2.4T-A95B

二〇二六年八月二十六日 · 英文原文

阿里巴巴 Qwen 团队发布 Qwen3.8-2.4T-A95B 开源模型,总参数量 2.4T,激活 95B,原生上下文 262,144 tokens,可扩展至 1,010,000。该模型基于 Qwen3.5 架构,在编程、专业工作、研究及长周期 agentic 任务上提升,支持通过 `reasoning_effort` 调节推理深度。权重以 Hugging Face Transformers 格式提供,兼容 vLLM、SGLang、TokenSpeed 等框架。官方版本 Qwen3.8-Max 由 Qwen Cloud 提供 API 服务,支持视觉输入及 1M 上下文。

Qwen3.8-2.4T-A95B

Qwen Studio

[!Note] 本仓库包含以 Hugging Face Transformers 格式存储的后训练模型权重和配置文件。

这些产物兼容 vLLM、SGLang、TokenSpeed 等框架。

[!Tip] 对于需要托管式、可扩展推理且无需维护基础设施的用户,官方 Qwen API 服务由 Qwen Cloud 提供。

特别地,Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,具备更多功能,例如视觉输入与非思考模式支持、默认 1M 上下文长度、官方内置工具等。 更多信息请参阅 Qwen3.8-Max 概览

继 Qwen3.5 和 Qwen3.6 系列获得社区广泛采用之后,我们很高兴推出 Qwen3.8,这是迄今为止 Qwen 开源模型家族中能力最强的一代。

Qwen3.8 首次将 Qwen-Max 级别的模型开源发布。 Qwen3.8 基于 Qwen3.5 的架构基础构建,在编程、专业工作、研究以及长周期 agentic 任务方面均实现了显著提升。除了能回答更难的问题,Qwen3.8 还被设计为能够以更高的可靠性完成复杂、多步骤的任务。

Qwen3.8 亮点

Qwen3.8 具备以下增强特性:

更多详情,请参阅我们的博客文章 Qwen3.8-Max

模型概览

基准测试结果

快速开始

为简化集成,我们建议通过 API 使用 Qwen3.8。

部署 Qwen3.8

[!Important] 不同框架的推理效率和吞吐量差异显著。 我们建议使用最新版本的框架,以确保获得最佳性能和兼容性。 对于生产工作负载或高吞吐量场景,建议使用专门的 serving 引擎,如 SGLang、vLLM 或 TokenSpeed。

Qwen3.8 可以使用主流推理框架进行部署,例如:

API 使用

[!Important] Qwen3.8-2.4T-A95B 是一个纯文本模型,所有交互均需使用思考模式。不支持多模态输入,且无法关闭思考。每个响应都会自动以 <think>\n...</think>\n\n 中的推理内容开头,然后才是最终输出。

[!Tip] 我们建议在生成时使用以下采样参数:

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

请注意,不同推理框架对采样参数的支持程度有所不同。

Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度并控制成本:

此外,preserve_thinking 默认对所有工作负载启用,以提供最佳的开箱即用体验。

Chat Completions API

Chat Completions API 可用于大多数推理框架,以及 Qwen Cloud。 开始之前,请确保已安装 OpenAI Python SDK,并已配置 API key 和 API base URL,例如:

pip install -U openai

# 根据实际情况设置以下环境变量
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
纯文本输入
from openai import OpenAI
# 通过环境变量配置
client = OpenAI()

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # 默认开启;不应关闭
            "preserve_thinking": True, # 默认开启
        },
    },
    reasoning_effort="xhigh",  # 默认为 xhigh;支持 xhigh、medium 和 low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

[!Note] 如果您使用的是 Qwen Cloud 的 API,除了更改 model 之外,请传入 extra_body={"enable_thinking": True, "preserve_thinking": True},而不是 extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}

最佳实践

为获得最佳性能,我们建议以下设置:

  1. 采样参数

    • 我们建议使用以下采样参数:
      • temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
    • 对于支持的框架,您可以将 presence_penalty 参数调整到 0 到 2 之间,以减少无休止的重复。但使用较高的值偶尔可能导致语言混杂和模型性能略有下降。
  2. 充足的输出长度:为优化 agentic 任务的性能,我们建议分配足够的输出长度,使模型能够生成详细且全面的响应。对于支持为内部推理和最终输出分别设置 token 上限的框架,我们建议在 1M 上下文长度内进行以下配置:

    • 推理内容:将最大输出长度设置为 262,144 tokens。
    • 最终响应:将最大输出长度设置为 131,072 tokens。

    这些设置为复杂推理提供了必要的能力,同时为高质量的最终交付物保留了充足的空间。

引用

如果您觉得我们的工作有帮助,欢迎引用我们。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}
译自 Qwen · HF · 通义 · 录于 二〇二六年八月二十六日