NVIDIA · Developer 博客

使用NVIDIA Model Optimizer通过QAD开发Nemotron 3.5 Lightning NVFP4

Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer

二〇二六年八月十七日 · 英文原文

开发者可基于开放的NVIDIA Nemotron模型系列定制模型,以满足延迟、速度、内存和计算目标。新的Nemotron 3.5 Lightning NVFP4 checkpoint在保持精度的同时,吞吐量提升至原来的4倍,其全精度checkpoint从66 GB压缩至22 GB。

团队会定制自己的模型,以达到延迟、速度、内存和计算方面的目标。借助开放的 NVIDIA Nemotron 模型系列,开发者可以找到适合自身需求的模型。例如,新的 Nemotron 3.5 Lightning NVFP4 checkpoint 在保持精度的同时,吞吐量可提升至原来的 4 倍。它从 66 GB 的全精度 checkpoint 压缩至 22 GB……来源

译自 NVIDIA · Developer 博客 · 录于 二〇二六年八月十七日