使用NVIDIA Model Optimizer通过QAD开发Nemotron 3.5 Lightning NVFP4
Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer
摘要
开发者可基于开放的NVIDIA Nemotron模型系列定制模型,以满足延迟、速度、内存和计算目标。新的Nemotron 3.5 Lightning NVFP4 checkpoint在保持精度的同时,吞吐量提升至原来的4倍,其全精度checkpoint从66 GB压缩至22 GB。
团队会定制自己的模型,以达到延迟、速度、内存和计算方面的目标。借助开放的 NVIDIA Nemotron 模型系列,开发者可以找到适合自身需求的模型。例如,新的 Nemotron 3.5 Lightning NVFP4 checkpoint 在保持精度的同时,吞吐量可提升至原来的 4 倍。它从 66 GB 的全精度 checkpoint 压缩至 22 GB……来源
译自 NVIDIA · Developer 博客 · 录于 二〇二六年八月十七日