LLM Agent

Microsoft RD-Agent:打造自動化數據驅動研發的 AI Agent 框架

作者 github.com

RD-Agent 是由微軟開源的一個多 Agent 框架,旨在將數據驅動的研發過程(R&D)自動化。它透過「研究(Research)」與「開發(Development)」的協同循環,實現從閱讀論文、提出假設到編寫代碼與驗證的閉環,目前在量化金融、Kaggle 競賽及 LLM 微調等場景展現出強大的自動化工程能力。

Microsoft RD-Agent:打造自動化數據驅動研發的 AI Agent 框架

RD-Agent 是一個由微軟開發的開源框架,旨在將工業界中高價值的數據驅動研發(R&D)過程自動化。在現代 AI 研發中,核心工作通常集中在數據工程與模型優化上,這類工作高度依賴專家的經驗來提出假設、設計實驗並反覆調優。RD-Agent 的核心目標是讓 AI 驅動 AI,將研發人員從重複性的代碼實現與參數調試中解放出來,轉而由 Agent 自主完成從想法到實踐的演進循環。

專案定位

該框架將研發過程拆解為兩個核心組成部分:R(Research,研究)與 D(Development,開發)。研究階段負責提出新想法或優化方向,開發階段則負責將這些想法轉化為可執行的代碼並在真實環境中驗證。這種設計模擬了人類專家的工作流:提出假設 $\rightarrow$ 設計實驗 $\rightarrow$ 編寫代碼 $\rightarrow$ 執行驗證 $\rightarrow$ 根據反饋修正假設。透過這種迭代演進,RD-Agent 能夠在沒有人類干預的情況下,持續提升模型性能或挖掘更有效的特徵。

核心做法

RD-Agent 採用多 Agent 協同機制,針對不同場景提供專門的流水線。在量化金融場景中,它能自動閱讀財報或論文,提取因子公式並將其實現為代碼,透過因子與模型的共同優化(Co-optimization)來提升策略收益。在通用數據科學場景中,它能對接 Kaggle 等競賽平台,自主進行特徵工程與模型調優。

技術上,RD-Agent 整合了 LiteLLM 作為後端,使其能兼容多種大語言模型(如 GPT-4o、DeepSeek 等)。為了確保生成的代碼能安全且一致地運行,框架大量依賴 Docker 容器化環境,將代碼執行與主系統隔離,並透過標準化的反饋機制(Feedback Loop)將執行結果(如 Loss 曲線、評估指標)傳回給研究 Agent,以驅動下一輪的優化。

技術亮點

RD-Agent 在機器學習工程(MLE)能力的評估中表現突出。在 MLE-bench 基準測試中,其結合 o3 與 GPT-4.1 的版本在處理複雜度不同的 ML 任務上均領先於其他公開 Agent 方案。此外,框架展現了極強的場景擴展能力,例如 FT-Agent 能夠自動化 LLM 的微調全流程,包括分析基準測試、處理訓練數據、配置 LLaMA-Factory 訓練參數以及使用 OpenCompass 進行評估。

另一個亮點在於其數據中心(Data-Centric)的設計理念。它不單純追求模型結構的複雜化,而是強調透過自動化挖掘高品質特徵(Factors)來提升性能。在量化交易的實測中,RD-Agent(Q) 能夠以更少的因子數量達成比基準庫更高的年化收益率(ARR),證明了其在特徵篩選與優化上的高效能。

導入限制與成熟度判斷

從實務角度看,RD-Agent 目前仍處於 Alpha 階段,具有較高的導入門檻。首先,該框架目前僅支持 Linux 系統,且強依賴 Docker 環境,用戶必須配置無需 sudo 權限的 Docker 運行環境。其次,由於涉及大量的 LLM API 調用(尤其是需要強推理能力的模型來擔任研究角色),運行的 Token 成本較高。

在風險方面,自動化生成的代碼雖然在 Docker 中運行,但對於涉及金融交易或醫療預測等高風險領域,完全脫離人類審核的自動演進可能帶來不可預知的風險。此外,對於 LLM 微調場景,該框架對計算資源(GPU)有較高要求,且數據集下載與環境構建過程較為耗時。

總結來說,RD-Agent 並非一個開箱即用的工具軟件,而是一個強大的研發自動化框架。它最適合的場景是擁有大量歷史數據、需要反覆迭代特徵工程或模型結構的專業研究團隊,將其作為「研究副駕駛(Research Copilot)」來加速原型開發與方案驗證,而非完全替代專業的數據科學家。