项目文件夹

文件
2026-07-13 12:28:27 +08:00

3.5 KiB

模型下载的若干问题

CapsWriter-Offline 完全离线运行,所有模型都在本地:

引擎名 准确性 速度 格式 调用方式 显卡加速
Paraformer ★★★☆☆ ★★★★★ ONNX sherpa_onnx
SenseVoice-Small ★★★☆☆ ★★★★★ ONNX 自定义引擎
Fun-ASR-Nano ★★★★☆ ★★★★☆ ONNX + GGUF 自定义引擎
Qwen3-ASR-1.7B ★★★★★ ★★★☆☆ ONNX + GGUF 自定义引擎

模型选择:

  • 独显电脑优先用 Qwen3-ASR-1.7B-q5_k,准确率夯爆
  • 集显电脑可尝试 Qwen3-ASR-1.7B-q4_k,如果延迟太高,可降至 Fun-ASR-Nano
  • 性能太差则建议 SenseVoice-Small

性能参考(20s 音频转录延迟):

模型 CPU U9-285H GPU RTX5050
Paraformer 0.6s -
SenseVoice-Small 0.6s 0.15s
Fun-ASR-Nano 2.0s 0.5s
Qwen3-ASR-1.7B 4.0s 1.0s

Paraformer 通过 sherpa_onnx 调用,不支持显卡加速,且需要外挂标点符号模型 Punct-CT-Transformer,不建议使用,仅作纪念性保留。 Qwen3-ASR 不具备时间戳能力,需要外挂时间戳模型 ForcedAligner 才能在文件转录时生成时间准确的 srt 字幕。


一、下载地址

所有模型统一在 GitHub Release 页面下载:

https://github.com/HaujetZhao/CapsWriter-Offline/releases/tag/models

为方便国内下载,百度网盘中也有:


二、目录结构

下载模型压缩包后,解压到 models/ 中对应模型的文件夹内,结构如下:

models/
├── SenseVoice-Small/
│   ├── Sensevoice-Small-ONNX/
│   │   ├── SenseVoice-Encoder.fp16.onnx
│   │   ├── SenseVoice-CTC.fp16.onnx
│   │   └── tokenizer.bpe.model
│   └── 模型下载链接.txt
│
├── Fun-ASR-Nano/
│   ├── Fun-ASR-Nano-GGUF/
│   │   ├── Fun-ASR-Nano-Encoder-Adaptor.fp16.onnx
│   │   ├── Fun-ASR-Nano-CTC.fp16.onnx
│   │   ├── Fun-ASR-Nano-Decoder.q5_k.gguf
│   │   └── tokens.txt
│   └── 模型下载链接.txt
│
├── Qwen3-ASR/
│   ├── Qwen3-ASR-1.7B/
│   │   ├── qwen3_asr_encoder_frontend.onnx
│   │   ├── qwen3_asr_encoder_backend.onnx
│   │   └── qwen3_asr_llm.gguf
│
├── Qwen3-ForcedAligner/
│   ├── Qwen3-ForcedAligner-0.6B/
│   │   ├── qwen3_aligner_encoder_frontend.int4.onnx
│   │   ├── qwen3_aligner_encoder_backend.int4.onnx
│   │   └── qwen3_aligner_llm.q5_k.gguf
│   └── 模型下载链接.txt
│
├── Paraformer/
│   ├── speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-onnx/
│   │   ├── model.onnx
│   │   ├── tokens.txt
│   │   ├── am.mvn
│   │   ├── config.yaml
│   │   └── tokens.json
│   └── 下载与转换.ipynb
│
└── Punct-CT-Transformer/
    ├── sherpa-onnx-punct-ct-transformer-zh-en-vocab272727-2024-04-12/
    │   ├── model.onnx
    │   ├── tokens.json
    │   └── config.yaml
    └── 模型下载链接.txt

三、如何切换引擎

`config_server.py 中设置:

model_type = 'fun_asr_nano'    # 可选:'qwen_asr', 'fun_asr_nano', 'sensevoice', 'paraformer'