Cloudflare

從基礎設施到行為分析:解析 Cloudflare Agents Tracing 的觀測能力與實務限制

作者

此功能精準擊中了 LLM Agent 開發中『HTTP 200 但邏輯失敗』的痛點,提供了一套標準化的可視化方案,評價為『必要但尚未完美的診斷工具』。其價值在於將非結構化的推理過程轉化為結構化的 Span 追蹤,但由於預設隱私設定不一且存在數據截斷風險,開發者在將其視為正式審計工具前必須極其謹慎。

從基礎設施到行為分析:解析 Cloudflare Agents Tracing 的觀測能力與實務限制

在開發基於大型語言模型(LLM)的 AI Agent 時,開發者經常面臨一個棘手的問題:即便 API 回傳 HTTP 200 狀態碼,代表請求成功,但 Agent 的行為可能依然是失敗的。例如,Agent 可能選擇了錯誤的工具、將過時的上下文傳遞給子代理,或者陷入了無止盡的重試迴圈導致 Token 消耗劇增。在傳統的應用程式遙測中,開發者只能看到一次 API 請求或資料庫查詢,卻無法得知導致該操作的 Agent 內部邏輯行為。

為了填補這一觀測空白,Cloudflare 推出了 Agent Tracing 功能,作為 Cloudflare Agents 體系的第一個核心組件。這項功能旨在將原本僅限於基礎設施層級的 Workers Tracing 擴展到 Agent 層級,讓開發者能透過統一的儀表板,將部署的 Agent 會話集中管理並進行深度除錯。

核心內容與運作方式

Cloudflare Agents Tracing 的核心在於引入了 Agent 層級的 Span(跨度),Span 是分散式追蹤中的基本單位,用來記錄一個特定操作的開始與結束時間及其元數據。過去的 Workers Tracing 僅能記錄基礎設施層的操作,例如 fetch 呼叫、KV 儲存讀取或 D1 資料庫查詢。現在,Agent Tracing 在這些基礎操作之上,新增了關於 Agent 呼叫、模型調用、工具執行以及人工審核(Approvals)的 Span。

在實際運作中,每一次的對話輪次(Turn)會產生一條完整的追蹤鏈。例如,一個典型的追蹤路徑會包含:啟動 Agent 類別 $\rightarrow$ 調用特定模型 $\rightarrow$ 執行特定工具 $\rightarrow$ 觸發工具審核。如果主 Agent 委派任務給子 Agent,其操作會以巢狀結構呈現。這意味著從主 Agent 委派、子 Agent 調用模型、執行工具、查詢 D1 並寫入 KV 的整個過程,在視覺上會呈現為一個連續的瀑布流(Waterfall),讓開發者能一眼看出模型調用與後續錯誤工具參數之間的因果關係。

為了將這些追蹤數據與儀表板連結,Cloudflare 使用了三個關鍵欄位:代表邏輯實作的 Agent Name、代表特定實例的 Agent ID,以及用於串聯對話的 Conversation ID。

實務意義與技術細節

除了追蹤視圖,Cloudflare 還提供了 Session Replay(會話回放)功能。該功能會將記錄的對話輪次重新組合成完整的對話流,包含訊息、推理過程、工具調用參數及其結果,以及子 Agent 的活動。需要注意的是,Session Replay 是回放已記錄的數據,而非重新執行 Agent。

在整合方式上,Cloudflare 提供了不同的路徑。使用 Think 或 Flue v2 以上版本的開發者可自動完成儀表板配置;直接調用 AI SDK 的開發者則需使用 wrapAISDK() 封裝函數,並在每次調用時提供身份識別欄位。對於使用自定義框架的團隊,則需透過 Workers Custom Spans API 實作,該 API 遵循 OpenTelemetry 的 GenAI 參考實作。雖然目前 Workers 尚未直接支援 OpenTelemetry API,但 Cloudflare 表示正致力於此,未來將允許符合標準的框架無需手動配置即可整合。

影響與限制

儘管 Agent Tracing 提升了可視性,但在實務應用中存在三個重要的限制與風險。

首先是隱私與預設值的不一致。不同的框架在記錄 Payload(有效載荷)時有截然不同的預設行為。Think 框架預設不儲存訊息或工具載荷,除非開發者明確開啟;而 Flue 框架則預設儲存所有訊息、系統指令、工具定義與結果。由於訊息載荷經常包含個人敏感資料或秘密金鑰,這種不一致的預設值可能導致開發團隊在無意中洩漏隱私。

其次是數據的完整性問題。Cloudflare 明確指出,這些追蹤並非對話的完全且無損記錄。由於 Span 的大小限制,較長的訊息、複雜的推理過程或龐大的工具參數可能會被截斷(Truncation)。此外,Session Replay 目前不支援顯示圖片。因此,開發者應將其視為除錯工具,而非法律級別的審計軌跡(Audit Trail)。

最後是成本與保留期限。從 2026 年 10 月 1 日起,該功能將納入 Workers Observability 計費體系。計費單位是每個 Span 算作一個事件,這包含了一些 SDK 內部運作且未在儀表板顯示的隱藏 Span,因此實際成本可能高於視覺上的預期。此外,免費版僅提供 3 天的數據保留期,付費版則為 7 天,對於需要長期分析行為模式而非單次事故的團隊來說,這個期限相當短。

總結而言,Cloudflare Agents Tracing 的推出反映了當前 AI 運維的趨勢:僅有基礎設施的遙測已不足以解釋 AI Agent 的行為。透過建立專屬的遙測層,開發者才能將結構化的追蹤數據回饋到評估流程中,實現 Agent 的自我優化與生命週期管理。

本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。