背景與挑戰
在現代電商與外送平台中,傳統的推薦系統大多依賴單次預測模型,也就是所謂的 One-shot Prediction。這種模式在處理簡單的推薦需求時表現尚可,但當平台規模擴大,且涉及雜貨、便利店、酒類等多元零售類別時,單次預測模型往往缺乏對使用者即時意圖的理解。對於 DoorDash 而言,單純的預測模型無法捕捉使用者在特定情境下的上下文資訊,導致推薦結果雖然在統計上正確,但在實際使用場景中缺乏相關性,進而影響轉單率與使用者體驗。
為了克服這個問題,DoorDash 的機器學習與 AI 團隊開始將系統從單純的模型預測轉向代理人架構,即 Agentic Recommendation Platform。這種轉變的核心在於將 AI 從一個被動的預測工具,提升為能夠感知上下文、具備記憶能力且能主動決策的代理人,使其能根據使用者的消費習慣與即時需求,提供更精準的個性化建議。
核心技術:語義 ID 與 RQ-VAE
在構建大規模推薦代理人時,一個關鍵的技術瓶頸在於如何讓大語言模型有效率地處理海量的商品目錄。傳統的商品 ID 通常是隨機的數字或字串,對模型而言沒有任何含義。為了讓模型能理解商品之間的內在聯繫,DoorDash 引入了 RQ-VAE 語義 ID 技術。
RQ-VAE 全稱為 Residual Quantized Variational AutoEncoder,是一種殘差量化變分自動編碼器。這項技術的作用是將高維度的商品特徵(例如商品的描述、類別、圖像特徵等)壓縮成一串具有階層結構的離散代碼,即語義 ID。與傳統 ID 不同,語義 ID 讓相似的商品在代碼空間中具有相近的表示。例如,兩種不同品牌的全脂牛奶,其語義 ID 的前幾位可能會非常接近。
這種設計解決了兩個核心問題。首先,它大幅降低了模型處理海量商品目錄的複雜度,讓模型不需要學習數百萬個獨立的 ID,而是學習語義空間的分佈。其次,它讓 AI 代理人能夠在不依賴繁瑣查詢的情況下,直接透過 ID 的語義特徵快速定位相關商品,顯著提升了推薦的相關性。
上下文記憶與接地搜索
除了商品表示法的優化,DoorDash 還開發了語言原生消費者記憶系統,即 Language-native Consumer Memory。這是一種專為大語言模型設計的記憶層,旨在記錄使用者的偏好、過往行為以及即時的交互上下文。當使用者在平台上搜尋或瀏覽時,代理人能從記憶層中提取相關資訊,將其作為 Prompt 的一部分輸入模型,使 AI 能夠像人類店員一樣記得使用者的特定需求,例如使用者偏好低糖飲料或對某些食材過敏。
為了確保 AI 代理人不會產生幻覺,DoorDash 結合了接地搜索技術,即 Grounded Search。這是一種將模型生成的結果與真實數據庫進行校驗的機制。當代理人決定推薦某項商品時,系統會強制要求推薦結果必須基於目前庫存中真實存在的商品,而非由模型憑空想像。透過將語義 ID 的檢索能力與接地搜索相結合,系統能確保推薦結果既符合使用者的語義需求,又具備實際的可用性。
實務影響與限制
從傳統預測模型轉向代理人架構後,DoorDash 在推薦的相關性與轉單率指標上獲得了顯著提升。這種架構讓平台能夠快速擴展至新的業務垂直領域,如零售與雜貨,因為語義 ID 系統提供了一套通用的商品表示方法,減少了為每個新類別重新訓練模型的成本。
然而,這種規模化的代理人系統也面臨一定的限制。首先是延遲問題,由於引入了記憶提取與多步決策過程,系統的響應速度比單純的預測模型慢。其次,維護 RQ-VAE 的量化碼本需要持續的更新,以確保新上架的商品能被正確地映射到語義空間中。此外,在處理極大規模的即時上下文時,如何平衡記憶的精準度與計算資源的消耗,依然是系統優化過程中的核心挑戰。
總結來說,DoorDash 的經驗表明,AI 代理人的失敗往往不是模型本身的能力不足,而是上下文數據層的設計問題。透過將商品目錄語義化以及構建專屬的消費者記憶層,可以有效地將 AI 從單純的預測工具轉化為真正能理解需求的消費助手。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。