在大型語言模型(LLM)的開發過程中,基準測試(Benchmark)是衡量模型能力的核心工具。無論是評估模型的安全性、通用推理能力還是指令遵循程度,研究人員通常依賴一個總體分數來判斷模型的強弱。然而,這種將所有題目平均化為單一分數的做法隱藏了一個關鍵問題:一個旨在測試特定能力的基準測試,其內部的個別題目是否真的只在衡量該能力?
例如,一個設計用來測試社會刻板印象的安全性測試,可能會包含一個關於祖孫預約 Uber 的題目。雖然其目標是探測年齡偏見,但模型若要答對,必須先具備追蹤人物關係並根據證據推理的能力。這意味著模型的分數可能同時受到安全性意識與通用推理能力的影響。為了釐清這一點,Allen Institute for AI (AI2) 推出了 BenchMIRT,一種在單一題目層級對基準測試進行審計的新方法,旨在分析驅動基準測試分數的底層信號究竟是什麼。
核心技術:從心理測量學到多維度 IRT
BenchMIRT 的理論基礎源自心理測量學(Psychometrics)中的項目反應理論(Item Response Theory, IRT)。IRT 的核心理念在於,並非所有考題對衡量受試者能力的貢獻都相同。有些題目較簡單,而有些題目則能更有效地將強者與弱者區分開來。
傳統的 IRT 通常是單維度的,僅衡量一種能力。而 BenchMIRT 將其擴展為多維度項目反應理論(Multidimensional IRT, MIRT),使其能夠在同一組題目中分離出多種不同的能力維度。BenchMIRT 同時在模型層級與題目層級進行估算:針對模型,它估計模型在各項能力維度上的強度;針對題目,它估計該題目的難度,以及該題目在區分不同能力強度模型時的有效性。
為了驗證此方法,研究團隊使用 100 個 LLM 在 16 個基準測試(包含 MMLU-Pro、GPQA 等推理測試,以及 HarmBench、BBQ 等安全性測試)中,針對超過 3.4 萬個問題進行訓練。值得注意的是,研究人員在訓練過程中並未告知 BenchMIRT 各個基準測試的預設目的,結果系統仍能獨立地還原出兩個主導維度:安全性(Safety)與通用推理(General Reasoning),證明了該分析方法的穩定性。
基準測試的實務揭露與信號分離
透過 BenchMIRT 的分析,研究團隊發現許多基準測試的實際測量目標與其設計初衷並不完全一致。雖然大部分推理測試確實與推理能力掛鉤,但部分安全性測試卻呈現出複雜的信號混合。
以 BBQ(評估社會偏見)為例,分析結果顯示其分數與通用推理能力的相關性遠高於安全性。這意味著如果一個模型在 BBQ 上得分較低,可能並非因為它缺乏安全性意識,而是因為它無法理解或推理出題目中的複雜邏輯。同樣地,WMDP(測試危險雙用途知識)的分數也與通用推理強烈相關,但呈現負相關:推理能力越強的模型,反而越傾向於拒絕提供危險知識,從而獲得較高的 WMDP 安全得分。
在 HarmBench 測試中,信號的分離更加明顯。該測試中的標準問題與上下文問題與安全性維度一致,但關於版權的題目(例如要求生成特定歌詞)則與通用推理維度更為相關。這些發現揭示了單一的基準測試分數往往是多種能力信號的綜合體,而 BenchMIRT 能幫助研究人員將這些信號解構,使評分結果更具可解釋性。
效能優化與評測限制
除了分析能力維度,BenchMIRT 還能優化評測效率。研究發現,如果僅保留 10% 最具代表性的題目,依然能大致維持對模型能力分佈的判斷;而保留 50% 的題目,其測量結果甚至能與全量測試高度吻合。此外,BenchMIRT 具備預測能力,能以 79% 的準確率預測模型在未見過的題目上的表現,優於僅依賴平均分的傳統方法(70%)。
然而,這項技術也存在一定的限制。首先,訓練 BenchMIRT 的模型數據僅更新至 2025 年 3 月,可能無法完全捕捉新一代 LLM 的行為特徵。其次,發現的維度取決於輸入的基準測試集,若更換測試組合,可能會發現不同的能力維度。
最關鍵的風險在於透明度的雙面性。雖然辨識出最具代表性的安全性題目有助於精簡測試,但同樣的邏輯也可以被用來移除這些關鍵題目,從而讓不安全模型通過一個被削弱的測試。儘管如此,研究團隊認為這種對評測基準的深入洞察,對於構建更精準、更高效且更易於解釋的 LLM 評估體系至關重要。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。