AI 根因分析(Root Cause Analysis, RCA)是指在系統發生故障時,利用技術手段找出導致問題的最底層原因。隨著大型語言模型(LLM)的普及,許多團隊嘗試將 AI 引入故障排除流程中。然而,目前的業界共識正發生一個關鍵轉移:決定 AI 能否精準診斷問題的瓶頸,不再是模型本身的推理能力(Reasoning),而是上下文工程(Context Engineering),也就是如何決定哪些數據應該被餵給模型。
在實作 AI 根因分析時,目前主要分為兩種設計路線。第一種是基於代理的設計(Agent-based design),這種方式給予 AI 呼叫工具的權限,讓 AI 在推理過程中自行決定要抓取哪些監控數據(Telemetry)。第二種則是確定性設計(Deterministic design),由系統預先將相關信號進行關聯分析,整理成一份精簡的上下文資料後,一次性交給模型判斷。
對於初學者或剛接觸 AI 運維的工程師來說,這兩種路徑的差異在於靈活性與可預測性的權衡。基於代理的設計雖然靈活,能發現預定義規則之外的異常,但在生產環境中極難除錯。當 AI 診斷失敗時,你很難知道是因為模型推理能力不足,還是因為 AI 在抓取數據的過程中走錯了方向,導致餵入的證據錯誤。這種不可預測性使得多代理系統在實際部署時顯得非常脆弱。
相比之下,確定性設計將數據準備與模型推理分離。透過建立拓撲圖(Topology)或依賴關係圖,系統先在後端完成因果關聯分析,將精煉後的結果傳給模型。這種做法將 AI 的角色從調查員轉變為審核員。如果 AI 給出了錯誤答案,工程師可以很明確地判斷是模型沒分析好,還是前端準備的證據不足。
可觀測性廠商 Coroot 的研究進一步證實了這一點。他們模擬了一個網路延遲導致資料庫查詢變慢,進而引發前端 502 錯誤的故障場景,並在上下文中故意加入一些誤導性的信號。測試結果顯示,頂尖的閉源模型如 Claude Opus 或 GPT-5.5 都能在相同的上下文中準確找出根因。這意味著只要提供的上下文(Context)足夠精準且高信號,目前的模型推理能力已經足以應對大多數的根因分析任務。
這對工程實務的影響在於,我們不需要盲目追求更大、更貴的模型來提升診斷率。相反地,研發重心應該放在上下文工程上。上下文工程是指透過精確的數據篩選與格式化,將雜訊剔除,僅保留對解決問題最關鍵的資訊。這樣做不僅能提高診斷的可靠性,還能大幅降低 Token 的消耗成本,因為模型不需要在冗長的日誌中自行搜尋,而是直接處理精簡後的結論。
總結來說,AI 根因分析的挑戰已經從模型層面移到了數據管線層面。對於工程團隊而言,建立一套能夠穩定產出高質量上下文的確定性管線,比尋找更強的 LLM 更有實質價值。
來源:infoq.com
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。