haujetzhao--capswriter-offline
3.5 KiB
3.5 KiB
模型下载的若干问题
CapsWriter-Offline 完全离线运行,所有模型都在本地:
| 引擎名 | 准确性 | 速度 | 格式 | 调用方式 | 显卡加速 |
|---|---|---|---|---|---|
| Paraformer | ★★★☆☆ | ★★★★★ | ONNX | sherpa_onnx | ❌ |
| SenseVoice-Small | ★★★☆☆ | ★★★★★ | ONNX | 自定义引擎 | ✅ |
| Fun-ASR-Nano | ★★★★☆ | ★★★★☆ | ONNX + GGUF | 自定义引擎 | ✅ |
| Qwen3-ASR-1.7B | ★★★★★ | ★★★☆☆ | ONNX + GGUF | 自定义引擎 | ✅ |
模型选择:
- 独显电脑优先用 Qwen3-ASR-1.7B-q5_k,准确率夯爆
- 集显电脑可尝试 Qwen3-ASR-1.7B-q4_k,如果延迟太高,可降至 Fun-ASR-Nano
- 性能太差则建议 SenseVoice-Small
性能参考(20s 音频转录延迟):
| 模型 | CPU U9-285H | GPU RTX5050 |
|---|---|---|
| Paraformer | 0.6s | - |
| SenseVoice-Small | 0.6s | 0.15s |
| Fun-ASR-Nano | 2.0s | 0.5s |
| Qwen3-ASR-1.7B | 4.0s | 1.0s |
Paraformer 通过 sherpa_onnx 调用,不支持显卡加速,且需要外挂标点符号模型 Punct-CT-Transformer,不建议使用,仅作纪念性保留。 Qwen3-ASR 不具备时间戳能力,需要外挂时间戳模型 ForcedAligner 才能在文件转录时生成时间准确的 srt 字幕。
一、下载地址
所有模型统一在 GitHub Release 页面下载:
https://github.com/HaujetZhao/CapsWriter-Offline/releases/tag/models
为方便国内下载,百度网盘中也有:
- 链接: https://pan.baidu.com/s/1GsrHynsRg3bAvNFoj8GuJQ
- 提取码: ngjo
二、目录结构
下载模型压缩包后,解压到 models/ 中对应模型的文件夹内,结构如下:
models/
├── SenseVoice-Small/
│ ├── Sensevoice-Small-ONNX/
│ │ ├── SenseVoice-Encoder.fp16.onnx
│ │ ├── SenseVoice-CTC.fp16.onnx
│ │ └── tokenizer.bpe.model
│ └── 模型下载链接.txt
│
├── Fun-ASR-Nano/
│ ├── Fun-ASR-Nano-GGUF/
│ │ ├── Fun-ASR-Nano-Encoder-Adaptor.fp16.onnx
│ │ ├── Fun-ASR-Nano-CTC.fp16.onnx
│ │ ├── Fun-ASR-Nano-Decoder.q5_k.gguf
│ │ └── tokens.txt
│ └── 模型下载链接.txt
│
├── Qwen3-ASR/
│ ├── Qwen3-ASR-1.7B/
│ │ ├── qwen3_asr_encoder_frontend.onnx
│ │ ├── qwen3_asr_encoder_backend.onnx
│ │ └── qwen3_asr_llm.gguf
│
├── Qwen3-ForcedAligner/
│ ├── Qwen3-ForcedAligner-0.6B/
│ │ ├── qwen3_aligner_encoder_frontend.int4.onnx
│ │ ├── qwen3_aligner_encoder_backend.int4.onnx
│ │ └── qwen3_aligner_llm.q5_k.gguf
│ └── 模型下载链接.txt
│
├── Paraformer/
│ ├── speech_paraformer-large-vad-punc_asr_nat-zh-cn-16k-common-vocab8404-onnx/
│ │ ├── model.onnx
│ │ ├── tokens.txt
│ │ ├── am.mvn
│ │ ├── config.yaml
│ │ └── tokens.json
│ └── 下载与转换.ipynb
│
└── Punct-CT-Transformer/
├── sherpa-onnx-punct-ct-transformer-zh-en-vocab272727-2024-04-12/
│ ├── model.onnx
│ ├── tokens.json
│ └── config.yaml
└── 模型下载链接.txt
三、如何切换引擎
在 `config_server.py 中设置:
model_type = 'fun_asr_nano' # 可选:'qwen_asr', 'fun_asr_nano', 'sensevoice', 'paraformer'