Qwen-ASR / FunASR:中文生态极佳的方案
Qwen-ASR / FunASR:ASR中文生态极佳的方案。
国内玩家常通过本地 API 或第三方 Docker 将阿里 FunASR 模型接入 HA,实现极高精度的中文语音识别。
Table of Contents
可运行 Parakeet 等多语言模型,速度相比传统 Whisper 快数倍,且准确率极佳
HA 官方原生支持的默认本地 STT 引擎。包含从 tiny 到 large 等不同尺寸,全本地运行,但对硬件算力有一定要求。
夸克在客户端离线(端侧)
运行 SenseVoice 语音大模型,
采用 ONNX Runtime作为核心推理引擎,使用微软开源的 ONNX Runtime 引擎。
算子优化:它负责直接加载经过 INT8 量化的 ASR 计算图,在不依赖独立显卡的情况下,直接调用低功耗的 CPU 端侧推理,完成极速解码。
方案
1.FunASR语音 AI 框架
FunASR 的 Runtime 可替换
AutoModel
│
┌───────────────┼───────────────┐
▼ ▼ ▼
PyTorch ONNX Runtime GGUF Runtime 已测试方案 FunASR 1.3 + PyTorch。
2.FunASR ONNX
未测试方案 FunASR 1.5 + ONNX
3.sherpa-onnx
在用方案:Sherpa-ONNX + ONNX Runtime 1.34 + SenseVoiceSmall onnx FP32
sherpa-onnx 是 Next-gen Kaldi 团队基于 ONNX Runtime 的开源语音工具库。负责加载并执行转换为ONNX格式的语音AI模型,实现本地离线的低延迟推理。
ONNX Runtime
微软开源的跨平台、跨硬件的通用AI推理运行时
esp32音箱接入https://esphome.io/components/voice_assistant.html
github:https://github.com/k2-fsa/sherpa-onnx/
Comments
Comments are closed