xcloud-emb-zhtw

云碩科技(xCloudinfo)自製繁體中文檢索 Embedding 模型。

以 Google EmbeddingGemma-300m 為底模(非中國血統、Gemma 授權可商用), 使用台達 DRCD 繁體中文閱讀理解資料集之 26,936 組 QA、經困難負例挖掘(hard negative mining)擴增為 80,808 組三元組, 以 CachedMultipleNegativesRankingLoss(batch 256、bf16)對比學習微調;v2 再經 8192 長上下文擴展與教師模型蒸餾強化。 目標場景:繁體中文 RAG 檢索(知識管理、企業文件問答)。

v2(本版,2026-07-18)重點

  • 最大長度 2048 → 8192 tokens(原生 rope_theta 1M 全域層,免 RoPE scaling,長文續訓)
  • 短文檢索 hit@1 85.4 → 86.0(教師蒸餾強化)
  • 向量維度 768 不變;與 v1 向量空間不相容,升級需全庫重嵌(v1 權重仍可由 git revision 取得)

短段落檢索評測(DRCD test:3,493 查詢 / 1,000 段落庫)

排名 模型 參數 hit@1 hit@5 hit@10
1 Qwen3-Embedding-8B(參考組) 8B 86.5 97.9 99.0
2 xcloud-emb-zhtw v2(本模型) 0.3B 86.0 97.4 98.7
3 xcloud-emb-zhtw v1 0.3B 85.4 97.4 98.4
4 multilingual-e5-large 0.56B 82.8 95.3 97.0
5 BAAI/bge-m3 0.57B 82.2 95.6 97.2
6 google/embeddinggemma-300m(原版底模) 0.3B 82.1 94.9 96.7
7 snowflake-arctic-embed-l-v2.0 0.57B 80.9 94.2 96.4
  • 以 0.3B 參數超越所有 0.5B 級多語模型,距 8B 級開源第一名僅 0.5 個百分點(hit@1)。
  • 誠實聲明:本評測與訓練資料同為 DRCD 分布(維基百科型知識問答),跨領域表現請以實際語料實測為準。

長文整篇檢索評測(DRCD test:378 篇完整文章 / 3,493 查詢)

模型 hit@1 hit@5 hit@10
xcloud-emb-zhtw 長文特化版(GGUF,見下) 84.7 94.5 96.6
xcloud-emb-zhtw v1(2048 截斷) 80.6 91.6 94.1
xcloud-emb-zhtw v2(本模型,8192) 79.2 91.2 94.3
BAAI/bge-m3(8k 原生) 77.5 90.3 93.4
  • 誠實聲明:v2 的蒸餾強化以短文檢索為主要目標,長文整篇檢索相對長文特化版有取捨。 若你的檢索單位是整份長文件(法規、報告全文),請改用 GGUF repo長文特化版(hit@1 84.7); 一般段落級 RAG(chunk ≤ 2048 tokens)用本模型即可,短文分數最佳。

用法(sentence-transformers)

from sentence_transformers import SentenceTransformer

model = SentenceTransformer("xCloudinfo/xcloud-emb-zhtw")

# 查詢端與文檔端必須使用 EmbeddingGemma 規格的 prompt:
q = model.encode("台灣最高的山是哪一座?",
                 prompt="task: search result | query: ")
d = model.encode(["玉山主峰海拔 3,952 公尺,為台灣第一高峰。"],
                 prompt="title: none | text: ")
print((q @ d.T))

為什麼 0.3B 夠用——模型大小與檢索品質的取捨

Embedding 與生成模型的規律不同:參數容量買的是知識廣度與推理能力,而檢索要的是語意空間的排列品質。 把語意相近的文字映射到相近的向量位置,任務複雜度的天花板遠低於文字生成——這也是 MTEB 排行榜長年由 0.1B-0.6B 模型霸榜(e5、bge、GTE 皆是)的原因。

本模型的實測數字說明了邊際效益:26 倍的參數差(8B vs 0.3B),在 3,493 題繁中檢索上只換到 0.5 個百分點的 hit@1(86.5 vs 86.0)。而 0.3B 換來的是:

  • 推理成本約 1/26,單張消費級 GPU、純 CPU 甚至邊緣裝置(Jetson 等)即可部署
  • 全庫重嵌(RAG 換模型的一次性成本)快一個數量級
  • 查詢延遲低,適合線上服務

大容量模型真正的優勢在 zero-shot 廣度:數十種語言、冷門領域、程式碼檢索、指令式查詢。若你的場景是 單一語言、領域收斂的 RAG(如繁中企業文件問答),領域特化的小模型是成本效益最高的選擇;若場景高度 跨域跨語言,仍建議評估更大的模型。

誠實的限制:非中文查詢與跨領域冷僻術語未特化;長文整篇檢索請用長文特化版。上線前建議以自有語料做 A/B 實測驗收。

版本歷史

版本 日期 最大長度 短文 hit@1 長文 hit@1 取得方式
v2(本版) 2026-07-18 8192 86.0 79.2 main
v1 2026-07-06 2048 85.4 80.6(截斷) git revision(2026-07-18 前之 commit)

訓練細節

項目 設定
底模 google/embeddinggemma-300m
資料 DRCD train 26,936 QA → 困難負例三元組 80,808 組;v2 增長文對與蒸餾資料
損失 CachedMultipleNegativesRankingLoss;v2 蒸餾階段以教師模型排序打分
批次 256(in-batch negatives + 3 hard negatives)
精度 bf16
硬體 NVIDIA RTX 6000 Ada(云碩地端 GPU 機群)

授權

底模依 Gemma Terms of Use 授權,本微調模型之使用同受其約束。訓練資料 DRCD 為台達電子公開釋出之繁體中文閱讀理解資料集(CC BY-SA 3.0)。


云碩科技股份有限公司(xCloudinfo Corp. Limited)

Downloads last month
184
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for xCloudinfo/xcloud-emb-zhtw

Finetuned
(264)
this model
Quantizations
1 model

Collection including xCloudinfo/xcloud-emb-zhtw