新開源庫

新開源庫

DFlash:利用區塊擴散模型實現高效並行投機採樣,大幅提升 LLM 推理速度
新開源庫 AI Google

DFlash:利用區塊擴散模型實現高效並行投機採樣,大幅提升 LLM 推理速度

DFlash 是一個專為投機採樣(Speculative Decoding)設計的輕量化區塊擴散模型(Block Diffusion Model)。它不再像傳統投機採樣那樣逐個 Token 預測,而是能一次性並行生成一整塊(Block)Token 候選集,並由大模型一次性驗證,從而顯著降低推理延遲。該專案已提供多款主流模型(如 Qwen3, Gemma-4)的預訓練 Draft 模型,並深度整合至 vLLM 與 SGLang 等高效推理框架。

GitHub →