分布式逐层卸载:在vLLM-Omni中高效扩展至200B+ DiT模型
Distributed Layerwise Offload: Scaling Toward 200B+ DiT Models Efficiently in vLLM-Omni
摘要
分布式逐层卸载(Distributed Layerwise Offload)将DiT权重分片并跨设备流式传输,在64 GB HBM上实测运行124 GB的Cosmos3模型,并预估了通往200B+参数模型的路径。
分布式逐层卸载(Distributed Layerwise Offload)将DiT权重分片并跨设备流式传输,在64 GB HBM上实测运行124 GB的Cosmos3模型,并预估了通往200B+参数模型的路径。
译自 vLLM · 官方博客 · 录于 二〇二六年八月十七日