DeepSeek-V4-Pro-0813
DeepSeek-V4-Pro-0813
DeepSeek-AI 发布 DeepSeek-V4-Pro-0813,为 DeepSeek-V4-Pro 正式版,基于预览版结构并附加 DSpark 投机解码模块。在 HLE、Terminal Bench 2.1、NL2Repo、Cybergym、DeepSWE 等 benchmark 上优于预览版,与最强专有模型总体持平。支持 vLLM 与 SGLang 部署,`reasoning_effort` 提供 low、high、max 三档,模型权重按 MIT 许可证开源。
DeepSeek-V4-Pro-0813
引言
DeepSeek-V4-Pro-0813 是 DeepSeek-V4-Pro 的正式发布版本,取代了预览版,其 agentic 能力大幅增强,性能提升在生产环境中尤为显著。它基于 DeepSeek-V4-Pro(预览版)模型结构构建,并附加了 DSpark 投机解码模块。
DeepSeek-V4-Pro-0813 在以下基准测试中优于 DeepSeek-V4-Pro(预览版),并与当前最强的专有模型总体持平。
| 基准测试 | DeepSeek-V4-Pro-0813 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro (预览版) | DeepSeek-V4-Flash (预览版) | GLM-5.2 | Kimi K3 | Opus-4.8 | Fable-5 (带 fallback) |
|---|---|---|---|---|---|---|---|---|
| HLE (无 / 有工具) | 42.7 / 60.0 | 37.8 / 51.5 | 37.7 / 48.2 | 34.8 / 45.1 | 40.5 / 54.7 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 61.8 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 39.4 | 48.9 | - | 69.7 | - |
| Cybergym | 83.3 | 76.7 | 52.7 | 38.7 | - | 80.0 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 7.3 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 49.7 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents' Last Exam | 25.7 | 25.2 | 16.5 | 15.8 | 23.8 | 27.6 | 25.7 | - |
| AutomationBench (公开) | 31.8 | 25.1 | 12.8 | 10.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack † | 71.1 | 68.7 | 41.8 | 37.0 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard † | 67.2 | 59.6 | 31.1 | 25.8 | 54.5 | 63.0 | 71.7 | 68.3 |
说明:
- 对于上述公开基准中的代码 agent 任务,DeepSeek-V4-Pro-0813 使用 DeepSeek Harness 的最小模式作为 agent 框架进行评估,采用
max推理努力级别,temperature = 1.0, top_p = 0.95。 - † DSBench-FullStack 是内部全栈开发测试集;DSBench-Hard 是内部困难编码 agent 问题测试集。
对话模板
本版本不包含 Jinja 格式的对话模板。我们提供了一个专门的 encoding 文件夹,其中包含 Python 脚本和测试用例,演示如何将 OpenAI 兼容格式的消息编码为模型的输入字符串,以及如何解析模型的文本输出。请参阅 encoding 文件夹获取完整文档。
reasoning_effort 参数现在支持三个级别——low、high 和 max——用于控制模型在回答前的思考深度。
一个简单示例:
from encoding_dsv4 import encode_messages, parse_message_from_completion_text
messages = [
{"role": "user", "content": "hello"},
{"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."},
{"role": "user", "content": "1+1=?"}
]
# messages -> string
prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")
# string -> tokens
import transformers
tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Pro-0813")
tokens = tokenizer.encode(prompt)
使用 vLLM 运行
DSpark 投机解码通过一个标志即可启用——在 vLLM 启动命令中添加 --speculative-config,方法为 dspark:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
例如,以下命令在单个 4×GB300 节点上使用 vLLM 提供模型服务。 有关详细说明和其他硬件配置,请参阅 vLLM 配方。
vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \
--trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
--data-parallel-size 4 --enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
使用 SGLang 运行
使用 --speculative-algorithm DSPARK 启用 DSpark,并且不要设置单独的 --speculative-draft-model-path,因为目标模型和草稿模型的权重来自同一个 checkpoint。
有关详细说明、基准测试和其他硬件配置,请参阅 SGLang 指南。
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Pro-0813 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1 \
本地运行
请参阅 inference 文件夹,获取在本地运行 DeepSeek-V4 的详细说明,包括模型权重转换和交互式聊天演示。
对于本地部署,我们建议将采样参数设置为 temperature = 1.0,在 agentic 场景下使用 top_p = 0.95,其他场景使用 top_p = 1.0。对于 high 和 max 推理努力级别,我们建议最大输出长度为 384K tokens。
许可证
本仓库和模型权重根据 MIT 许可证 授权。
引用
@misc{deepseekai2026deepseekv4,
title={DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence},
author={DeepSeek-AI},
year={2026},
}
联系方式
如有任何问题,请提交 issue 或通过 service@deepseek.com 联系我们。