當我們在開發 AI Agent(人工智慧代理人)時,最容易遇到的挑戰不是模型不夠強,而是成本與延遲。與一般的聊天機器人不同,Agent 通常運行在一個「計畫-執行-觀察」的循環中,為了完成一個複雜任務,可能會在短時間內發出數百次 LLM 呼叫。
如果每一次簡單的判斷(例如:確認格式是否正確、輸出 Yes/No)都使用 GPT-4 等頂級模型,不僅成本會飆升,且因為頂級模型推理較慢,整個 Agent 的執行效率會大幅下降。此外,傳統的輪詢(Round-Robin)負載平衡在 GPU 環境中效果極差,因為它無法感知 GPU 的實際負荷,可能會將一個短請求排在一個巨大的預填充(Prefill)任務之後,導致不必要的等待。
為了解決這些問題,Microsoft 提出了一套在 Azure Kubernetes Service (AKS) 上運行的三層路由架構,將「選擇哪個模型」、「如何管理請求」以及「由哪個 GPU 副本處理」這三個維度完全解耦。
第一層:語義路由(Semantic Routing)決定模型等級
這層的核心是 RouteLLM。它的任務是判斷目前的 Prompt(提示詞)是否足夠簡單,可以用較便宜的小模型(Weak Model)來回答,而不需要動用強大但昂貴的模型(Strong Model)。
RouteLLM 使用了一種基於人類偏好數據訓練的矩陣分解(Matrix-Factorization)路由器。它會預測小模型是否能達到與大模型相近的回答品質。如果預測品質達標,就導向小模型;否則則升級(Escalate)到大模型。在測試中,這種做法能維持約 95% 的品質,卻能將強模型的呼叫量降低到 26%,最高可節省 85% 的成本。
第二層:AI 代理網關(AI Proxy)負責治理
一旦決定了模型等級,請求會進入 agentgateway。這是一個開源的代理層,它不關心 Prompt 的具體含義,而是專注於工程管理(Governance)。
它負責處理身分驗證(Authentication)、針對不同 Agent 設定的速率限制(Rate Limits)、成本追蹤以及安全護欄(Guardrails)。它充當了對外統一的 OpenAI 相容端點,讓後端模型的切換對前端應用透明。
第三層:GPU 感知調度(GPU-Aware Placement)決定實例
當請求被導向自託管(Self-hosted)模型時,最後一步是決定由哪一個 GPU Pod 處理。這裡使用了 Kubernetes Gateway API 的 Inference Extension。
傳統負載平衡只看連線數,但這層的 Endpoint Picker 會直接檢查 vLLM(一個高效能 LLM 推理引擎)的即時狀態,包括 KV-cache(鍵值快取)的占用率和請求隊列深度。這樣可以確保請求被分配到最空閒、資源最充足的 GPU 副本上,避免因單一 Pod 阻塞而導致的延遲。
實作脈絡與技術組件
在 AKS 的實際部署中,這套架構的運作流程如下:
首先,KAITO 負責管理 GPU 節點池並運行 vLLM 實例。
其次,RouteLLM 根據語義將請求分流。強路徑直接導向 Azure OpenAI;弱路徑則透過 agentgateway 進入服務後端。
最後,服務後端利用 inferenceRouting 策略,將請求交由 Endpoint Picker 根據 GPU 實時指標進行精準分發。
整個過程的監控則由 Azure Managed Prometheus 和 Grafana 承接,將路由成本指標與 vLLM 的 GPU 效能指標整合在同一個視圖中。
實務上的限制與建議
對於工程師在導入此架構時,有三點需要特別注意:
第一,模型配對的校準。RouteLLM 的節省效果取決於所使用的模型對(例如 Phi-4-mini 與 GPT-4)。你不能直接套用官方的百分比,而必須根據自己的業務流量與模型組合,調整升級閾值(Escalation Threshold)。
第二,快取成本的權衡。Prompt Caching(提示詞快取)能顯著降低 token 成本。如果你頻繁在強弱模型之間切換,會導致兩個模型的快取都失效(Cool down),這可能會抵消部分路由節省的成本。
第三,版本不穩定性。由於這套架構涉及的許多組件(如 Inference Extension)仍處於快速迭代期,CRD(自定義資源定義)的欄位名稱經常變動。建議在實作時嚴格鎖定版本號,並參考最新的官方文件。
導入路徑
這套架構不需要一次全部導入,可以根據需求分階段實施:
如果只需要治理功能,先部署 agentgateway。 如果開始自託管模型,加入 KAITO 與 Inference Extension 以優化 GPU 利用率。 如果發現有大量簡單重複的請求且成本壓力大,最後再引入 RouteLLM 進行語義分流。
來源:infoq.com
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。