官方來源· AWS Artificial Intelligence· AI· 發布於 2026年10月2日
AWS 示範以 SageMaker AI 多輪強化學習微調搜尋代理
AWS 分享以 Amazon SageMaker AI 多輪強化學習(The MTRL)微調 Qwen3.6-27B 搜尋代理的案例。代理使用 BM25 與向量搜尋工具,並在多輪互動中決定搜尋內容、檢索策略與停止時機。

完整報導
AWS 於 2026 年 10 月 2 日發布的技術文章,介紹如何運用 Amazon SageMaker AI 的多輪強化學習(The MTRL)微調大型語言模型搜尋代理。案例採用 Qwen3.6-27B;代理可在多輪互動中決定要查詢什麼、採用哪種檢索策略,以及何時停止,並透過反覆調整搜尋方式完成任務。
範例企業搜尋代理配備 BM25 詞彙搜尋與向量搜尋工具。AWS 說明,The MTRL 會以多輪 rollout 產生訓練資料,並提供可自訂獎勵、工具迴圈與對話形式的代理—環境介面;其執行採無伺服器方式、按 token 計費,不必自行配置或管理 GPU 叢集。
AWS 先前於 2026 年 7 月概述過 The MTRL 的代理訓練流程;這篇新文章則把方法落到搜尋任務案例。訓練後,The MTRL 評估工作可回報 reward、pass@k 與軌跡指標,再部署至 Amazon SageMaker AI endpoint 或 Amazon Bedrock。文章也指出,範例所用 Qwen3.6-27B 在 US West(Oregon)AWS Region(us-west-2)獲支援。
為什麼值得注意
這篇文章提供 The MTRL 如何用在多輪搜尋代理上的具體實例,並交代其檢索工具、訓練方式與評估至部署的流程,讓讀者能辨識它與一般單輪模型微調的差異。
來源證據
先看主要證據,再查看佐證來源與來源脈絡。
主要證據
1Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI
Huibin Shen
“Fine-tuning teaches a small search agent your tools and environment, giving it the reliability of a frontier model at lower latency and cost. In this post, we fine-tune an LLM-powered search agent with multi-turn reinforcement learning (MTRL) on Amazon SageMaker AI and share the gains we measured in retrieval quality and reliability.”
推薦消息
根據品牌、主題與近期相關消息推薦
目前沒有更多推薦消息