中文與 Code-switch 本機實測

實測日期:2026-09-25 · 六模型報告快照

M1 Pro · 10 CPU / 16 GPU cores · 32 GiB · macOS 15.7.4 · 6 模型 × 99 筆基準 · 完整報告

先看適合你的選擇

初步實用預設:Qwen MLX BF16,兼顧術語、速度與噪音拒絕。Whisper large-v3 的 mixed English WER 較低,FireRed 是重要的縮寫對照。不能只看中文 CER 或推論速度。

自然台灣國語:目前不能公允判定贏家,需人工 reference。Hotwords 維持選擇性開啟,並非永遠更好。

品質:把中文、英文與縮寫分開

普通中文 10 筆;台灣聲線 10 筆;mixed 20 筆;縮寫含自然與逐字母共 40 筆。台灣「display CER」是明示的繁體顯示轉換後診斷,不是 raw 模型輸出。

Model中文 raw CER ↓台灣 TTS raw CER ↓台灣 TTS display CER ↓Mixed English WER ↓Mixed term accuracy ↑Acronym accuracy ↑非語音輸出 ↓
Whisper large-v30.7%32.5%3.0%16.2%80.8%52.5%9/10
Whisper large-v3 turbo0.0%31.3%1.8%39.7%65.4%55.0%9/10
SenseVoiceSmall0.7%32.5%3.6%63.2%48.1%62.5%10/10
FireRedASR2-AED0.0%31.9%3.6%35.3%67.3%82.5%0/10
Qwen3-ASR-1.7B0.0%31.3%1.8%26.5%82.7%77.5%0/10
Paraformer-zh0.0%31.9%3.0%47.1%55.8%45.0%10/10

效能與記憶體

同一批音訊、模型依序執行。warm latency 是不同長度樣本的平均;RTF = 總 warm processing / 總 audio。RSS 不與 GPU allocator 相加。OS page cache 和其他應用未重置。

ModelDevicePrecisionMean warmRTF ↓Peak RSSWeightsCold load
Whisper large-v3Metal GPUFP162.497s0.4523.67 GiB3.08 GB1.71s
Whisper large-v3 turboMetal GPUFP161.917s0.3471.89 GiB1.61 GB1.09s
SenseVoiceSmallmpsFP320.092s0.0173.09 GiB0.94 GB5.50s
FireRedASR2-AEDMPSFP321.833s0.3329.20 GiB4.73 GB15.47s
Qwen3-ASR-1.7BMetal GPUBF160.662s0.1204.03 GiB4.08 GB0.62s
Paraformer-zhMPSFP320.094s0.0172.99 GiB0.88 GB8.10s

實際英文錯誤

以下列出六模型的實測錯誤與 sample ID。完整音訊與逐筆對照保留於私人本機 Lab。

Whisper large-v3

  • mixed-08: RAG → real
  • mixed-12: OAuth → auth
  • mixed-13: Qwen → [missing]
  • mixed-13: STT → pointstt
  • mixed-18: PostgreSQL → sql

Whisper large-v3 turbo

  • mixed-01: latency → size
  • mixed-08: RAG → [missing]
  • mixed-09: GPU → [missing]
  • mixed-11: GitHub → [missing]
  • mixed-12: OAuth → off

SenseVoiceSmall

  • mixed-01: API → 个
  • mixed-01: latency → apilet
  • mixed-02: backend → backland
  • mixed-06: deploy → deployy
  • mixed-07: frontend → froned

FireRedASR2-AED

  • mixed-01: latency → 三
  • mixed-07: frontend → end
  • mixed-08: RAG → real
  • mixed-12: OAuth → off
  • mixed-13: Qwen → quant

Qwen3-ASR-1.7B

  • mixed-02: backend → backland
  • mixed-08: RAG → data
  • mixed-11: GitHub → b
  • mixed-12: OAuth → earth
  • mixed-13: Qwen → quantas

Paraformer-zh

  • mixed-01: latency → ltencze
  • mixed-02: backend → backard
  • mixed-03: hallucination → hlusentation
  • mixed-07: frontend → fronted
  • mixed-08: RAG → reality

Hotwords OFF → ON:60 筆 code-switch / acronym

ModelCasesEnglish WER ↓Term accuracy ↑Acronym accuracy ↑
whisper6027.8% → 22.2%68.5% → 76.1%61.8% → 70.6%
qwen6037.0% → 25.9%80.4% → 87.0%80.9% → 86.8%
turbo6041.7% → 36.1%60.9% → 64.1%58.8% → 55.9%

只有 Whisper、turbo、Qwen 在本次選用 backend 有支援的 model-level biasing。FireRed、SenseVoice 和這個 Paraformer checkpoint 的 ON 顯示 unsupported,沒有用文字替換冒充改善。

VAD 與 hallucination

每個模型使用同一個 Silero、同樣門檻。10 個 known non-speech signals,另測短語音、前後長靜音、模糊語音;結果不代表所有自然噪音都已涵蓋。

ModelVAD非空輸出 / 非語音VAD 擋下額外字元語音誤擋
whisper / Metal GPUOFF9/10094none
whisper / Metal GPUON0/10100none
sensevoice / CPUOFF10/10010none
sensevoice / CPUON0/10100none
firered / MPSOFF0/1000none
firered / MPSON0/10100none
qwen / Metal GPUOFF0/1000none
qwen / Metal GPUON0/10100none
paraformer / MPSOFF10/100110none
paraformer / MPSON0/10100none
turbo / Metal GPUOFF9/10062none
turbo / Metal GPUON0/10100none

97 分鐘真人錄音

Rec08 97.35 分鐘:推論流程 899.86 秒,RTF 0.154。真人錄音無 reference,不計 CER。

原音與完整 Qwen transcript 保留於私人本機 Lab。

相容性、timestamp 與 confidence 限制

FireRed 為 MPS FP32,CTC forced alignment 放 CPU。Paraformer 的 FP64 CIF sum 保留 FP64 在 CPU 執行,沒有偷偷改 FP32 累加;CPU/MPS 數值與五筆輸出已核對。Qwen 是 community MLX runtime,BF16 權重型別有實測記錄,未量化。

Paraformer 可回傳負的 native timestamp,UI 保留原值並標示越界。沒有人工 word-time reference,所以不能宣稱時間戳準確。Qwen selected runtime 和 SenseVoice 沒有 native word timestamps;confidence 不存在時是 N/A,各模型 confidence 不能直接互相比機率。

模型原文、OpenCC 顯示值、VAD 邊界、原始 provider metadata、所有條件與失敗紀錄都保留。原始系統 FFmpeg 壞在 jpeg-xl 連結,這個流程用 SoundFile/SoXR,不改 Homebrew。GPU utilization 需額外權限,未捏造數字。

本頁為公開的靜態實測報告。推論於 MacBook Pro 本機執行;原始音訊、完整逐字稿與私人 Lab 未隨本頁發布。