Together AI · 官方

LLM推理端点的自动缩放

Autoscaling endpoints for LLM inference

二〇二六年七月三十一日 · 英文原文

GPU 利用率可能显示健康,而你的队列却在积压,新副本需要数分钟才能预热。以下是如何选择自动扩缩容指标、调整扩容/缩容窗口,并为专用推理的冷启动做预算。

GPU 利用率可能显示健康,而你的队列却在积压,新副本需要数分钟才能预热。以下是如何选择自动扩缩容指标、调整扩容/缩容窗口,并为专用推理的冷启动做预算。

译自 Together AI · 官方 · 录于 二〇二六年七月三十一日