在目前的 AI 浪潮中,許多工程師傾向於認為「模型越大、越新就越強」。然而,Dharma AI 的實務經驗告訴我們一個相反的結論:在特定任務(如巴西葡萄牙語 OCR)中,一個經過精準特化(Specialization)的小模型,其表現可以輕易超越資源更豐富、架構更新的通用大模型。
這篇文章將解析 DharmaOCR 如何在面對 Mistral OCR4 和 Unlimited-OCR 等強大對手時,依然能保持領先的技術脈絡。
領域特化的結構性優勢
要理解為什麼專精模型能贏,首先要明白模型參數的分配邏輯。任何基於生成式 AI 的 OCR 系統本質上都是機率模型,其表現取決於模型架構(天花板)以及參數如何被訓練(資源分配)。
通用模型(Multilingual Models)試圖處理數十種語言,這意味著有限的參數必須分攤給所有語言。雖然神經網路具有疊加原理(Superposition Principle),允許單一參數編碼多個特徵,但資源的分散依然存在。
相比之下,DharmaOCR 採取了極端的特化策略:它放棄對其他語言的兼容性,將所有參數完全導向巴西葡萄牙語的詞彙、形態學與正字法。這種將資源高度集中在單一領域的做法,創造了一種結構性的優勢,使其在處理特定語言的細節時,比通用模型更精準。
兩階段訓練 pipeline 的實務設計
為了達成高精度且穩定的 OCR 輸出,DharmaOCR 採用了兩個關鍵的訓練階段,分別解決「能力」與「穩定性」問題。
第一階段:監督式微調 (Supervised Fine-Tuning, SFT) SFT 的目的是建立領域能力。透過大量不同格式、複雜度的葡萄牙語文件進行訓練,讓模型對目標語言的語法和文件結構產生強烈的對齊(Alignment)。這讓模型學會「如何正確識別」該語言的文字。
第二階段:直接偏好優化 (Direct Preference Optimization, DPO) 即便 SFT 讓模型變強,但生成式模型在面對模糊輸入(如字體過小、掃描品質差)時,容易陷入文字退化(Text Degeneration)現象。所謂的退化,是指模型不再根據圖像內容輸出,而是根據機率分佈開始胡言亂語或陷入無限重複。
DPO 解決的是穩定性問題。不同於 SFT 逐個 Token 預測正確性,DPO 是讓模型在多個可能的完整輸出結果中,學習選擇最連貫、最符合邏輯的那一個。這就像是在告訴模型:即便你對某個字不確定,也不要開始亂編,要保持整段輸出的結構完整性。
實務案例:通用模型在細節處的崩潰
在針對巴西國家高中考試(ENEM)論文的測試中,這種差異顯現得非常明顯。
通用模型(如 Mistral OCR4)在處理巴西知名音樂家 Chico Buarque 的名字時,會將其錯誤識別為 Chico Barque 或 chico bique。這並非隨機錯誤,而是典型的領域知識缺失。對於通用模型來說,這個名字在海量數據中權重不足;但對於專精於巴西葡萄牙語的 DharmaOCR 而言,這是基礎知識。
更嚴重的問題在於穩定性。當面對小字體文件時,通用模型常會產生完全與原文無關的退化輸出。對於企業端應用(如自動化合規審查)來說,錯字還可以修正,但退化輸出則是結構性失效,導致後續的自動化流程直接崩潰。
總結與工程啟示
DharmaOCR 的成功證明了:新架構雖然能提高性能天花板,但資源的導向(Direction)決定了模型能否觸及該天花板。
對於工程師在選擇或建構 AI 方案時,有三個核心啟示:
第一,不要盲目追求最新、最大的通用模型。如果你的業務場景高度集中在特定語言或特定文檔類型,特化小模型通常能提供更高的精度與更低的推論成本。
第二,區分準確度(Accuracy)與穩定性(Stability)。SFT 提升準確度,而 DPO 等偏好優化技術能有效抑制生成式模型的退化現象,這在生產環境中至關重要。
第三,專精化並非靜止不動。DharmaOCR 的策略不是守住舊模型,而是將最新的 AI 技術(如新架構、新對齊方法)持續應用到這個固定的專精領域中。
來源:Cardoso, Gabriel Pimenta de Freitas, et al. "DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines." arXiv preprint arXiv:2604.14314 (2026).
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。