AI觀點

LifeSciBench

從單純回答生物問題到模擬科研實務:解析 OpenAI 的 LifeSciBench 生命科學基準測試
AI觀點 LifeSciBench OpenAI

從單純回答生物問題到模擬科研實務:解析 OpenAI 的 LifeSciBench 生命科學基準測試

該內容精準地揭示了通用 LLM 在專業科學領域的『能力幻覺』,將評估維度從結果導向轉向過程導向,具有高度的實務參考價值。然而,其評價基礎仍依賴於專家定義的 Rubric,在科學發現具有高度不可預測性的前提下,這種『模擬真實』的測試集是否能完全涵蓋未知的科研突破,仍需持保留態度。