Tech Eval Lab
Gemma 4 語言模型 / 輕量部署

Gemma 4 實測:輕量模型能不能扛中文任務

小尺寸模型在中文任務上還是吃虧,英文任務表現不錯,適合當輔助模型而非主力。

  • 語言模型
  • 輕量部署
  • 中文任務
Gemma 4 實測畫面

為什麼想測

專案裡有些輕量任務(例如把使用者輸入分類、抽取關鍵字)不想每次都打成本較高 的大型模型 API,想看小尺寸的 Gemma 4 能不能接手這些工作,把主力模型的 用量省下來。

英文任務表現

英文的分類、摘要任務表現符合預期,回應速度快,本機也跑得動, 拿來做輕量的前處理很划算,判斷結果跟大型模型的落差不大。

中文任務表現

中文的表現明顯比英文弱,尤其是需要理解語境或抓多義詞的任務,錯誤率 比英文任務高出不少,遇到比較口語化或帶有台灣用語習慣的輸入時, 判斷結果的穩定度會再往下掉。

結論

如果專案主要處理英文內容,或任務本身不需要太細緻的語言理解(像是簡單的 關鍵字比對),Gemma 4 這個量級可以省下不少 API 成本。中文為主的場景, 現階段還是需要大型模型把關,Gemma 4 比較適合放在流程前段做初步篩選, 而不是直接拿來做最終判斷。