在企業數位轉型的過程中,從複雜的 PDF 文件中提取結構化數據始終是一個巨大的挑戰。傳統的 OCR(光學字元辨識技術通常依賴於脆弱的規則集,面對財務報表、科學論文或包含複雜表格的政府文件時,經常會出現讀取順序錯誤、表格結構崩潰或語義遺失等問題。為了克服這些痛點,Cohere 推出了 Parse 5(parse-v5.0),這是一款專為企業級文件解析設計的多模態基礎模型,旨在將視覺豐富的非結構化文件直接轉換為乾淨且具備結構的 Markdown 格式。
Parse 5 的核心定位是一個視覺語言模型(Vision Language Model, VLM),其參數規模約為 23 億。與傳統先將影像轉文字、再由文字模型處理的兩階段流程不同,Parse 5 採取的是多模態整合路徑。它能夠同時處理文本與視覺輸入,並在輸出 Markdown 的同時,提供精確的 Bounding Box 邊界框座標。所謂的 Bounding Box,是指標記出文件上每個元素(如表格、標題、圖片)在原始頁面中的具體位置座標。這項功能對於受監管行業至關重要,因為它實現了視覺接地(Visual Grounding),讓使用者能將提取出的數據回溯至原始文件的具體位置,以滿足嚴格的審計與驗證需求。
從技術架構來看,Parse 5 建構在 Cohere Labs 的開源權重模型 North-Micro-Vision-Instruct 之上,其運作流程分為三個關鍵組件。首先是視覺編碼器(Vision Encoder),這是一個擁有 4 億參數的原生解析度模型,基於 SigLIP 2 SO400M 初始化。為了精準捕捉文件的空間結構,它採用了 2D 旋轉位置嵌入(2D Rotary Positional Embeddings, RoPE)與學習後的 1D 位置嵌入,確保模型能理解文字在頁面上的相對位置。接著,透過一個投影器(Projector)將提取的視覺特徵映射到語言模型的嵌入空間中。最後,核心推理由一個 20 億參數的 North Micro LLM 語言模型驅動,該模型基於 Cohere 的 Command A+ 架構。
值得注意的是,Parse 5 採用了一種稱為 DeepStack 的整合方法。這種方法將視覺編碼器多個層級的 Patch Embeddings(分塊嵌入)直接注入到語言模型的早期層級中。這樣設計的目的在於讓語言模型在處理資訊時,能同時獲取不同抽象層級的視覺表示,從而更精準地解析複雜的版面佈局,而非僅僅依賴最終的視覺輸出。
為了驗證其實際效能,Cohere 使用了 ParseBench 基準測試集,其中包含超過 2,000 頁由人工驗證的保險、金融與政府部門企業文件。測試重點在於表格提取、內容忠實度以及語義格式化這三個關鍵維度。結果顯示,Parse 5 在這些指標上的平均得分為 79.2。雖然在排行榜上略低於 LlamaParse Agentic Plus 等頂級配置,但其表現已超越了 Mistral OCR 與 Google Gemini 3 Flash (Thinking High) 等競爭對手。
對於開發者而言,Parse 5 的實務意義在於大幅簡化了 RAG(檢索增強生成)系統的資料 ingestion 流程。開發者不再需要維護複雜的 OCR 管道,只需透過 API 即可將 PDF 轉換為 Markdown。目前該模型已在 Cohere 平台、Microsoft Azure AI Foundry 以及 Amazon SageMaker 上線。此外,由於其基礎模型 North-Micro-Vision-Instruct 提供開源權重,開發者可以用於原型開發或針對特定任務進行微調(Fine-tuning)。
然而,Parse 5 在實務應用中仍存在一些限制與挑戰。根據開發者社群的討論,部分使用者反映在整合過程中仍有摩擦,例如希望 API 能直接支援原生 PDF 檔案輸入,而不需要先將 PDF 渲染成頁面影像再傳送。此外,雖然 23 億的參數規模在效能與延遲之間取得了良好平衡,使其適合處理高吞吐量的企業工作負載,但對於極端複雜的專業領域文件,可能仍需要透過微調來提升精準度。
總結來說,Parse 5 的推出標誌著 Cohere 從純文本處理向多模態分析的擴展。透過將視覺理解與語言推理深度整合,它為企業處理混亂的真實世界非結構化數據提供了一套更高效、低延遲且具備可追溯性的解決方案。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。