AWS 發布 SageMaker AI WhisperX 說話者標記轉錄指南
AWS 的技術指南介紹如何將整合 Whisper、wav2vec2 強制對齊與說話者分離的 GPU 容器部署至 SageMaker AI 即時或非同步端點,產生逐字且附說話者標記的轉錄。

完整報導
AWS 於 2026 年 9 月 24 日發布《Speaker-labeled transcription with WhisperX on SageMaker AI》,說明如何在 Amazon SageMaker AI 上部署 WhisperX,建立帶有說話者標記的語音轉錄流程。這篇指南聚焦於部署與正式環境操作,而非單獨介紹一個新的轉錄模型。
AWS WhisperX 深度學習容器將 Whisper、wav2vec2 強制對齊及說話者分離整合在 GPU 就緒映像中。指南說明如何將容器部署至 SageMaker AI 即時端點或非同步端點,輸出逐字層級、並標示不同說話者的轉錄結果。
除了部署流程,指南也涵蓋 GPU AMI 版本固定、擴縮及成本控制等正式環境考量。這些內容把焦點從模型推論延伸至服務如何配置與管理;指南提供的是部署操作資訊,並未在所提供的公告摘要中列出特定效能或成本數字。
這篇文章也延續 AWS 在 SageMaker AI 上展示不同生成式 AI 工作負載的技術指南。AWS 於 9 月 28 日介紹以 vLLM-Omni 串流生成 Qwen3-TTS 語音,並於 9 月 30 日展示以同一容器流程部署影像與影片生成模型。WhisperX 指南則將應用焦點放在語音轉錄、時間對齊與說話者辨識。
為什麼值得注意
對需要處理多人對話或長音訊的團隊而言,逐字時間對齊與說話者標記能提供比純文字轉錄更具結構的輸出;AWS 的指南也把端點選擇、GPU AMI 固定、擴縮與成本控制納入部署脈絡,讓讀者能評估正式環境所需的運作事項。
來源證據
先看主要證據,再查看佐證來源與來源脈絡。
主要證據
1Speaker-labeled transcription with WhisperX on SageMaker AI
Ayush Sharma
“The AWS WhisperX Deep Learning Container packages Whisper, wav2vec2 forced alignment, and speaker diarization into a GPU-ready image. Learn how to deploy it to Amazon SageMaker AI real-time and asynchronous endpoints for word-level, speaker-labeled transcription, plus the production details that matter: the GPU AMI pin, scaling, and cost controls.”
推薦消息
根據品牌、主題與近期相關消息推薦