LLM

以代碼繪製水彩畫:利用 TRL 與 OpenEnv 實現審美導向的強化學習

作者

該實驗成功將「主觀審美」這一模糊概念工程化,透過『受限代碼輸出 $ ightarrow$ 視覺渲染 $ ightarrow$ 偏好評分』的閉環實現藝術風格遷移,其邏輯嚴密且具前瞻性。然而,由於模型在繪圖時處於『盲繪』狀態(缺乏即時視覺反饋),且極度依賴參考池的質量,目前的創作仍屬『模仿』而非『創造』,其藝術上限被策展者的品味所封頂。

以代碼繪製水彩畫:利用 TRL 與 OpenEnv 實現審美導向的強化學習

這篇文章探討了一個將大型語言模型(LLM)轉化為「水彩畫家」的技術實驗。其核心概念並非讓模型直接生成像素圖像,而是讓模型撰寫 JavaScript 代碼,透過特定的繪圖庫在數位畫布上模擬水彩的暈染與筆觸。這個項目的目標是探索如何將「審美偏好」這種主觀的感受,轉化為強化學習(Reinforcement Learning, RL)中的獎勵函數,從而教導模型學習特定風格的藝術創作。

背景與技術媒介

該實驗基於 Surya Narreddi 的原創構思,並由 Hugging Face 的工程師使用 TRL(Transformer Reinforcement Learning,一個用於微調語言模型的強化學習庫)與 OpenEnv(一個將外部環境連接至 RL 訓練流程的框架)進行開源複現。

模型使用的媒介是 p5.brush,這是一個基於 p5.js 的擴展庫,專門用於模擬自然繪圖工具。與傳統的幾何繪圖不同,p5.brush 能夠模擬顏料在紙張上的滲透(Bleed)、紋理以及筆觸的質量感。為了確保生成結果具有水彩風格,研究者對模型進行了嚴格的限制,僅允許其使用 10 個特定的函數(如 fillBleed 模擬滲透、beginShape 定義形狀等),禁止使用線條或陰影線等會破壞水彩感的工具。

核心運作:將審美轉化為獎勵

在一般的強化學習中,獎勵通常是可驗證的(例如數學題的正確答案或代碼是否通過測試)。然而,藝術創作沒有標準答案,因此本項目嘗試實現「基於品味的強化學習」(RL over taste)。

為了量化審美,系統設計了一套複合式獎勵函數,包含以下四個維度:

第一是門檻檢查(Gate),確保代碼能成功編譯且沒有嘗試透過在畫布上寫文字來欺騙評分系統。第二是長度控制(Length),輕微鼓勵模型撰寫較長的代碼以增加細節。第三是 HPSv3 評分,這是一個 7B 參數的開源偏好模型,能根據人類的大數據偏好對圖像的美感給出分數。最後是最關鍵的成對判斷(Pairwise Judge),由 Qwen3-VL 視覺模型擔任。

成對判斷的運作方式是將模型生成的作品與從「參考池」中隨機抽取的四張作品進行對比。參考池是由人類手工篩選出的 178 張水彩畫,分為「喜愛」與「尚可」兩個等級。視覺模型會根據預設的審美準則(如透明洗色、柔和邊緣)判斷候選作品是否勝過參考作品。這意味著,參考池的組成直接定義了模型的「品味」。

訓練過程與技術挑戰

在實作過程中,研究者使用了 Qwen3.5-35B-A3B 模型,並採用 GRPO(Group Relative Policy Optimization,一種無需價值模型即可優化策略的 RL 算法)進行訓練。

訓練過程中遇到了顯著的技術挑戰。首先是學習率(Learning Rate)過低導致獎勵曲線平坦,無法學習;其次是 LoRA(低秩自適應,一種高效微調技術)的參數設定問題。由於 Qwen3.5 採用混合專家(MoE)架構,傳統的模組清單無法覆蓋所有層,必須將目標模組設為 all-linear 才能讓模型有效學習。

此外,基礎設施的穩定性至關重要。由於渲染過程需要在無頭瀏覽器(Headless Chromium)中執行 WebGL 運算,且缺乏 GPU 加速,單次渲染需耗時 70 至 90 秒。任何渲染超時或評分模型失效都會被視為零分,若不妥善處理,會導致模型在噪聲中訓練而失效。

影響與實務意義

實驗結果顯示,不同的獎勵權重會導致截然不同的藝術風格。僅依賴 HPSv3 的模型雖然能穩定生成像花的形狀,但缺乏靈魂且色彩單一;而增加「成對判斷」權重的模型,其作品在色彩豐富度與藝術多樣性上明顯提升,且能更接近人類定義的「美感」。

這項研究的實務意義在於證明了 LLM 可以透過受限的代碼輸出與視覺反饋迴路,學習非結構化的審美標準。它將 AI 創作的瓶頸從「如何生成」轉移到了「如何定義美」(即參考池的策展工作)。

限制與未來方向

目前該系統仍存在明顯限制。首先,模型是在「閉眼」狀態下繪圖,它無法看到自己畫了什麼,僅能依賴最終的獎勵分數來調整。未來若能引入多輪對話,讓模型在繪圖過程中獲取視覺反饋,預計將大幅提升品質。其次,參考池的規模與多樣性限制了模型的創造力,若參考池只有一種花,模型最終也會傾向於只畫那種花。

總結來說,這個項目展示了如何將藝術直覺轉化為工程路徑,透過精心設計的環境與獎勵機制,讓編碼模型在限制中綻放出藝術美感。

本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。