在大型語言模型(LLM)的安全性對齊(Safety Alignment)過程中,業界普遍將「有害性」視為一種與「主題」綁定的屬性。目前的主流做法是建立一套主題層級的分類法(Topic-level Taxonomy),例如將武器、詐騙或自殘定義為危險類別。當模型偵測到輸入內容屬於這些類別時,就會觸發拒絕機制。然而,這種粗粒度的管理方式在實際部署中面臨嚴重的挑戰:模型往往無法區分「關於該主題的有害請求」與「關於該主題的合法請求」。
這種現象導致了所謂的過度拒絕(Over-refusal),即模型因為看到某些敏感關鍵字,就將完全安全的提示詞(Prompt)誤判為危險而拒絕回答。例如,一個被設定為拒絕政治議題的模型,可能會在回答選舉制度的客觀事實時也選擇拒絕,儘管這對教育用途的助手來說是必要的功能。
為了克服這個問題,Multiverse Computing 團隊發表了研究論文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,提出了一種「邊界感知」的對齊方法,旨在讓模型學會拒絕主題中的特定有害子集,而非整個主題。
核心概念:從主題拒絕轉向邊界拒絕
研究團隊將安全問題重新定義為在「主題宇宙」中尋找特定的「有害子集」。以政治議題為例,目標不是拒絕所有政治相關的對話,而是僅拒絕其中涉及「政治操縱」或「定向說服」的有害部分,同時保留對「事實性資訊」的回答能力。
理想的行為模式應該是一個陡峭的階梯函數:在有害子集內部立即拒絕,而在子集之外的合法區域則完全回答。然而,模型在訓練過程中學習到的拒絕機率通常是平滑的曲線,這意味著當模型被訓練去提高對有害提示的拒絕率時,這種拒絕傾向會向外擴散,滲透到邊界附近的合法區域,導致過度拒絕。
為了精準塑造這個邊界,研究者引入了「邊界對(Boundary Pairs)」的概念。這是一種特殊的數據構造,包含兩組提示詞:它們共享同一個主題錨點(Topic Anchor),但意圖截然不同。一組是應被拒絕的有害請求,另一組則是應被回答的合法請求。透過這種對比,模型能更清晰地識別出哪些特徵代表「有害」,而哪些僅僅是「主題相關」。
技術實作與數據優化
研究團隊發現,傳統的自我生成(Self-generation)安全微調流程存在三個關鍵缺陷,並對此提出了相應的解決方案。
首先是覆蓋率缺口(Coverage Gap)。在單次嘗試生成拒絕樣本時,許多困難的有害提示詞無法成功觸發模型的拒絕回應,導致這些樣本被直接捨棄。為了修復此問題,團隊採用了遞增式重試策略(Escalating Retry Strategy),透過逐步加強引導強度來確保困難樣本也能被正確標記。在實驗中,這將樣本丟失率從 19.88% 降低至 0.20%,大幅增加了訓練集的完整性。
其次是副作用反應(Downside Reactions)。模型容易將具有「危險外觀」但實則安全的提示詞誤判。對此,研究者在訓練集中加入了分佈內(In-distribution)的良性數據,包含 11,955 個經過驗證的、外觀危險但內容安全的提示詞,讓模型在訓練階段就學會區分「危險詞彙」與「危險意圖」。
最後是衡量指標的失效。傳統的安全性指標僅關注有害拒絕率,這會形成一個陷阱:模型只要採取「全面拒絕」的極端策略,有害拒絕率會變得非常高,看起來很安全,但實際上失去了可用性。因此,團隊同步衡量良性側的拒絕率,確保安全增益不會以犧牲可用性為代價。
實務意義與限制
在 Qwen3-8B 模型的實驗中,採用邊界感知訓練的模型在政治拒絕率上從 9.47% 提升至 84.75%,且在 HarmBench 等通用安全基準測試中表現優異。然而,若不加入良性邊界數據,模型在 XSTest(專門測試過度拒絕的基準)上的誤拒率會從 2% 飆升至 74%,變成一台毫無用處的拒絕機器。
透過引入良性邊界對數據,研究結果顯示,邊界合法側的過度拒絕率從 32.94% 大幅下降至 4.16%,而有害側的拒絕率僅輕微下降(從 91.88% 降至 87.72%)。這證明了精準的數據組成可以在幾乎不損失安全性前提下,極大地消除過度拒絕現象。
這項研究的實務意義在於,LLM 的安全性不應由單一的拒絕率來定義。對於企業級部署而言,不同場景需要不同的安全邊界。開發者必須同時評估「有害拒絕率」與「良性誤拒率」這兩個維度。透過覆蓋率修復、分佈內補償以及邊界對訓練,可以將模型的行為控制在真實部署所需的精準度上,而非僅僅依賴粗糙的主題分類。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。