報導· Unknown· 發布於 2026年9月10日

Amazon SageMaker HyperPod 支援模型快取,縮短推論冷啟動

Amazon SageMaker HyperPod 新增可選的模型權重與容器映像快取,將資料預先載入節點的本機 NVMe 儲存空間,以縮短推論 Pod 啟動及擴展所需時間;未使用快取的節點仍可透過網路下載。

報導

情報判讀

訊號摘要

AWS 表示,未使用快取時,大型模型部署可能需要 30 分鐘以上,DeepSeek-R1 的模型資料量則超過 600 GB。啟用權重快取後,HyperPod Inference Operator 會先將模型權重下載至每個目標節點,待所有節點就緒後才建立部署;快取中的資料可從本機 NVMe 以約每秒 7 GB 的速度讀取,通常能讓 Pod 在數秒內開始提供流量。映像快取則可預先拉取推論伺服器映像,省去 Amazon ECR 下載流程,節省約 5 至 7 分鐘。

為什麼值得注意

這項功能把大型模型推論部署的等待時間,從每次依賴遠端下載改為可重複使用的本機快取,對需要快速擴展或重新啟動推論服務的工作負載尤其有影響。不過首次填充快取仍須從遠端來源下載,且可快取的模型與映像數量受每個節點 NVMe 容量限制。

來源證據

先看主要證據,再查看佐證來源與來源脈絡。

1 則

主要證據

1
  • 官方AWS Artificial Intelligence文件原始來源

    Reduce inference cold starts on Amazon SageMaker HyperPod with model caching

    Kareem Syed-Mohammed

    Amazon SageMaker HyperPod now supports model caching for inference, which pre-loads model weights and container images onto cluster nodes so pods read from local NVMe storage instead of downloading over the network. Learn how model caching cuts cold starts from tens of minutes to seconds, how it works, and how to enable it.