中文與 Code-switch 本機實測
實測日期:2026-09-25 · 六模型報告快照
M1 Pro · 10 CPU / 16 GPU cores · 32 GiB · macOS 15.7.4 · 6 模型 × 99 筆基準 · 完整報告
先看適合你的選擇
初步實用預設:Qwen MLX BF16,兼顧術語、速度與噪音拒絕。Whisper large-v3 的 mixed English WER 較低,FireRed 是重要的縮寫對照。不能只看中文 CER 或推論速度。
- 普通中文 raw CER 最低:Whisper large-v3 turbo、FireRedASR2-AED、Qwen3-ASR-1.7B、Paraformer-zh
- 台灣 TTS 顯示轉換後 CER 最低:Whisper large-v3 turbo、Qwen3-ASR-1.7B
- 中英混合 English WER 最低:Whisper large-v3
- 指定英文術語 accuracy 最高:Qwen3-ASR-1.7B
- 40 筆縮寫 accuracy 最高:FireRedASR2-AED
- 非語音誤輸出最少:FireRedASR2-AED、Qwen3-ASR-1.7B
- 此流程 RTF 最低:SenseVoiceSmall
- Peak RSS 最低:Whisper large-v3 turbo
自然台灣國語:目前不能公允判定贏家,需人工 reference。Hotwords 維持選擇性開啟,並非永遠更好。
品質:把中文、英文與縮寫分開
普通中文 10 筆;台灣聲線 10 筆;mixed 20 筆;縮寫含自然與逐字母共 40 筆。台灣「display CER」是明示的繁體顯示轉換後診斷,不是 raw 模型輸出。
| Model | 中文 raw CER ↓ | 台灣 TTS raw CER ↓ | 台灣 TTS display CER ↓ | Mixed English WER ↓ | Mixed term accuracy ↑ | Acronym accuracy ↑ | 非語音輸出 ↓ |
|---|---|---|---|---|---|---|---|
| Whisper large-v3 | 0.7% | 32.5% | 3.0% | 16.2% | 80.8% | 52.5% | 9/10 |
| Whisper large-v3 turbo | 0.0% | 31.3% | 1.8% | 39.7% | 65.4% | 55.0% | 9/10 |
| SenseVoiceSmall | 0.7% | 32.5% | 3.6% | 63.2% | 48.1% | 62.5% | 10/10 |
| FireRedASR2-AED | 0.0% | 31.9% | 3.6% | 35.3% | 67.3% | 82.5% | 0/10 |
| Qwen3-ASR-1.7B | 0.0% | 31.3% | 1.8% | 26.5% | 82.7% | 77.5% | 0/10 |
| Paraformer-zh | 0.0% | 31.9% | 3.0% | 47.1% | 55.8% | 45.0% | 10/10 |
效能與記憶體
同一批音訊、模型依序執行。warm latency 是不同長度樣本的平均;RTF = 總 warm processing / 總 audio。RSS 不與 GPU allocator 相加。OS page cache 和其他應用未重置。
| Model | Device | Precision | Mean warm | RTF ↓ | Peak RSS | Weights | Cold load |
|---|---|---|---|---|---|---|---|
| Whisper large-v3 | Metal GPU | FP16 | 2.497s | 0.452 | 3.67 GiB | 3.08 GB | 1.71s |
| Whisper large-v3 turbo | Metal GPU | FP16 | 1.917s | 0.347 | 1.89 GiB | 1.61 GB | 1.09s |
| SenseVoiceSmall | mps | FP32 | 0.092s | 0.017 | 3.09 GiB | 0.94 GB | 5.50s |
| FireRedASR2-AED | MPS | FP32 | 1.833s | 0.332 | 9.20 GiB | 4.73 GB | 15.47s |
| Qwen3-ASR-1.7B | Metal GPU | BF16 | 0.662s | 0.120 | 4.03 GiB | 4.08 GB | 0.62s |
| Paraformer-zh | MPS | FP32 | 0.094s | 0.017 | 2.99 GiB | 0.88 GB | 8.10s |
實際英文錯誤
以下列出六模型的實測錯誤與 sample ID。完整音訊與逐筆對照保留於私人本機 Lab。
Whisper large-v3
- mixed-08: RAG → real
- mixed-12: OAuth → auth
- mixed-13: Qwen → [missing]
- mixed-13: STT → pointstt
- mixed-18: PostgreSQL → sql
Whisper large-v3 turbo
- mixed-01: latency → size
- mixed-08: RAG → [missing]
- mixed-09: GPU → [missing]
- mixed-11: GitHub → [missing]
- mixed-12: OAuth → off
SenseVoiceSmall
- mixed-01: API → 个
- mixed-01: latency → apilet
- mixed-02: backend → backland
- mixed-06: deploy → deployy
- mixed-07: frontend → froned
FireRedASR2-AED
- mixed-01: latency → 三
- mixed-07: frontend → end
- mixed-08: RAG → real
- mixed-12: OAuth → off
- mixed-13: Qwen → quant
Qwen3-ASR-1.7B
- mixed-02: backend → backland
- mixed-08: RAG → data
- mixed-11: GitHub → b
- mixed-12: OAuth → earth
- mixed-13: Qwen → quantas
Paraformer-zh
- mixed-01: latency → ltencze
- mixed-02: backend → backard
- mixed-03: hallucination → hlusentation
- mixed-07: frontend → fronted
- mixed-08: RAG → reality
Hotwords OFF → ON:60 筆 code-switch / acronym
| Model | Cases | English WER ↓ | Term accuracy ↑ | Acronym accuracy ↑ |
|---|---|---|---|---|
| whisper | 60 | 27.8% → 22.2% | 68.5% → 76.1% | 61.8% → 70.6% |
| qwen | 60 | 37.0% → 25.9% | 80.4% → 87.0% | 80.9% → 86.8% |
| turbo | 60 | 41.7% → 36.1% | 60.9% → 64.1% | 58.8% → 55.9% |
只有 Whisper、turbo、Qwen 在本次選用 backend 有支援的 model-level biasing。FireRed、SenseVoice 和這個 Paraformer checkpoint 的 ON 顯示 unsupported,沒有用文字替換冒充改善。
VAD 與 hallucination
每個模型使用同一個 Silero、同樣門檻。10 個 known non-speech signals,另測短語音、前後長靜音、模糊語音;結果不代表所有自然噪音都已涵蓋。
| Model | VAD | 非空輸出 / 非語音 | VAD 擋下 | 額外字元 | 語音誤擋 |
|---|---|---|---|---|---|
| whisper / Metal GPU | OFF | 9/10 | 0 | 94 | none |
| whisper / Metal GPU | ON | 0/10 | 10 | 0 | none |
| sensevoice / CPU | OFF | 10/10 | 0 | 10 | none |
| sensevoice / CPU | ON | 0/10 | 10 | 0 | none |
| firered / MPS | OFF | 0/10 | 0 | 0 | none |
| firered / MPS | ON | 0/10 | 10 | 0 | none |
| qwen / Metal GPU | OFF | 0/10 | 0 | 0 | none |
| qwen / Metal GPU | ON | 0/10 | 10 | 0 | none |
| paraformer / MPS | OFF | 10/10 | 0 | 110 | none |
| paraformer / MPS | ON | 0/10 | 10 | 0 | none |
| turbo / Metal GPU | OFF | 9/10 | 0 | 62 | none |
| turbo / Metal GPU | ON | 0/10 | 10 | 0 | none |
97 分鐘真人錄音
Rec08 97.35 分鐘:推論流程 899.86 秒,RTF 0.154。真人錄音無 reference,不計 CER。
原音與完整 Qwen transcript 保留於私人本機 Lab。
相容性、timestamp 與 confidence 限制
FireRed 為 MPS FP32,CTC forced alignment 放 CPU。Paraformer 的 FP64 CIF sum 保留 FP64 在 CPU 執行,沒有偷偷改 FP32 累加;CPU/MPS 數值與五筆輸出已核對。Qwen 是 community MLX runtime,BF16 權重型別有實測記錄,未量化。
Paraformer 可回傳負的 native timestamp,UI 保留原值並標示越界。沒有人工 word-time reference,所以不能宣稱時間戳準確。Qwen selected runtime 和 SenseVoice 沒有 native word timestamps;confidence 不存在時是 N/A,各模型 confidence 不能直接互相比機率。
模型原文、OpenCC 顯示值、VAD 邊界、原始 provider metadata、所有條件與失敗紀錄都保留。原始系統 FFmpeg 壞在 jpeg-xl 連結,這個流程用 SoundFile/SoXR,不改 Homebrew。GPU utilization 需額外權限,未捏造數字。
本頁為公開的靜態實測報告。推論於 MacBook Pro 本機執行;原始音訊、完整逐字稿與私人 Lab 未隨本頁發布。