LLM推理端点的自动缩放
Autoscaling endpoints for LLM inference
摘要
GPU 利用率可能显示健康,而你的队列却在积压,新副本需要数分钟才能预热。以下是如何选择自动扩缩容指标、调整扩容/缩容窗口,并为专用推理的冷启动做预算。
GPU 利用率可能显示健康,而你的队列却在积压,新副本需要数分钟才能预热。以下是如何选择自动扩缩容指标、调整扩容/缩容窗口,并为专用推理的冷启动做预算。
译自 Together AI · 官方 · 录于 二〇二六年七月三十一日