在即時外送市場中,消費者、外送員與商家之間頻繁透過聊天與通話溝通。對於 DoorDash 而言,確保使用者在平台上的安全感至關重要,而其中最棘手的問題之一便是「言語濫用」(Verbal Abuse)。由於外送過程中的互動時間極短(通常僅 6 到 40 分鐘),系統必須在極短時間內偵測並攔截不安全訊息,否則無法在傷害發生前採取行動。
面對每日超過 400 萬則聊天訊息、40 萬通電話以及 20 萬張圖片的龐大流量,傳統的 AI 實作方式面臨巨大的挑戰。若直接將每則訊息發送到大型語言模型(LLM, Large Language Model)進行審核,將面臨兩個致命問題:首先是延遲(Latency),LLM 的回應時間通常在 2 到 10 秒之間,這會嚴重破壞即時聊天的體驗;其次是成本,每日數百萬次的 API 呼叫將產生天文數字般的費用。
為了在效能、成本與安全性之間取得平衡,DoorDash 的工程團隊開發了名為 SafeChat 的系統,並最終將其演進為一個內容不可知(Content-Agnostic)的通用審核平台。
核心架構:分層過濾與評分機制
SafeChat 的核心在於一套「混合模式」的架構,將審核流程分為兩個主要層級,確保只有最困難的案例才會交由昂貴的 LLM 處理。
第一層是快速且廉價的內部分類器(Internal Classifier)。這是一個在公司內部訓練的小型機器學習模型,其目標不是做最終判定,而是像機場的金屬探測器一樣,快速篩出「顯然安全」的訊息。該模型要求回應時間必須在 100 毫秒內,且不產生單次呼叫費用。根據 DoorDash 對數據的分析,絕大多數的訊息都是安全的,因此這一層可以攔截掉 90% 以上的流量,僅將剩餘 10% 的可疑訊息傳遞到下一層。
第二層則是智慧判斷層,由 LLM 負責處理。這裡有一個關鍵的設計選擇:不要求 LLM 給出「安全或不安全」的布林值(Boolean),而是要求它在多個維度上進行評分(Score),例如威脅程度、粗俗程度或色情程度。
使用評分而非標籤的重要性在於,評分就像一個可調節的旋鈕,讓團隊可以根據嚴重程度採取分級行動(Graduated Action)。例如,低嚴重程度的粗口可能僅需遮蔽文字;中等嚴重程度的侮辱則直接攔截訊息;而高嚴重程度的威脅則會觸發取消訂單、警告違規者並將受害者從該對話環節中完全移出。
從專屬系統演進為通用平台
當 SafeChat 證明有效後,DoorDash 內部其他團隊也產生了類似需求,例如審核使用者頭像、註冊名稱或食物評論,甚至是用於偵測詐騙行為。團隊意識到,真正具有價值的是這套「廉價過濾 $\rightarrow$ 昂貴判斷 $\rightarrow$ 分級行動」的架構模式,而非單一的聊天審核功能。
於是,他們將其重構為一個內容不可知的審核平台。該平台將複雜的邏輯抽象化為三個構建塊:內部模型(Internal Models)、外部模型(External Models)以及外部提示詞(External Prompts)。
內部模型由公司 ML 平台訓練並部署,速度快且成本低;外部模型則直接對接成熟的第三方 API(如圖像安全偵測);外部提示詞則透過一個 LLM Gateway(LLM 閘道器)連接市場上各種不同的模型。這個閘道器至關重要,它處理了模型崩潰時的後備方案(Fallback)與重試策略(Retry),確保系統的高可用性。
現在,其他團隊無需編寫程式碼,只需透過 UI 介面配置「審核代理人」(Moderation Agent),定義模型之間的條件跳轉(例如:若內部模型評分 $> 0.5$,則跳轉至 LLM 評分),即可快速搭建自己的審核工作流。
實務意義、限制與經驗總結
SafeChat 的實施讓 DoorDash 在言語濫用引起的安全事件中減少了約 50%。從這次開發過程中,團隊總結出三個關鍵經驗。
首先,在高流量的熱路徑(Hot Path)中使用 LLM 之前,必須在前方放置一個廉價模型。雖然這需要花時間分析數據並訓練模型,但這是確保經濟可行性的唯一方法。
其次,應利用 LLM 的推理能力而非分類能力。要求 LLM 給出具體維度的評分,比要求它給出是非答案能獲得更穩定且靈活的結果。
最後是關於系統生命週期的思考。當一個特定功能的系統被證明成功且具有普適性時,應該果斷將其「拋棄」並將其模式轉化為平台。雖然撰寫程式碼成本降低,但維護代碼的成本依然高昂,透過平台化配置可以大幅降低長期維護壓力。
在限制方面,該系統仍依賴人力進行回測(Backtesting)。為了確保新提示詞或模型上線後不會產生大量誤判,團隊會使用約 1,000 筆歷史數據讓人工標記真陽性與假陽性,以計算精準度指標。雖然無法完全自動化,但在安全敏感的場景中,這種「先測試再信任」的流程是不可或缺的。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。