Qwen-ASR / FunASR:ASR中文生态极佳的方案。

国内玩家常通过本地 API 或第三方 Docker 将阿里 FunASR 模型接入 HA,实现极高精度的中文语音识别。

可运行 Parakeet 等多语言模型,速度相比传统 Whisper 快数倍,且准确率极佳

 

HA 官方原生支持的默认本地 STT 引擎。包含从 tiny 到 large 等不同尺寸,全本地运行,但对硬件算力有一定要求。

 

 

夸克在客户端离线(端侧)

运行 SenseVoice 语音大模型,

采用 ONNX Runtime作为核心推理引擎,使用微软开源的 ONNX Runtime 引擎。

算子优化:它负责直接加载经过 INT8 量化的 ASR 计算图,在不依赖独立显卡的情况下,直接调用低功耗的 CPU 端侧推理,完成极速解码。

 

 

方案

1.FunASR语音 AI 框架

FunASR 的 Runtime 可替换

               AutoModel
                    │
    ┌───────────────┼───────────────┐
    ▼               ▼               ▼
 PyTorch      ONNX Runtime      GGUF Runtime

已测试方案 FunASR 1.3 + PyTorch。

2.FunASR ONNX

未测试方案 FunASR 1.5 + ONNX

3.sherpa-onnx

在用方案:Sherpa-ONNX + ONNX Runtime 1.34 + SenseVoiceSmall onnx FP32

sherpa-onnx 是 Next-gen Kaldi 团队基于 ONNX Runtime 的开源语音工具库。负责加载并执行转换为ONNX格式的语音AI模型,实现本地离线的低延迟推理。

 

ONNX Runtime

微软开源的跨平台、跨硬件的通用AI推理运行时

 

 

 

esp32音箱接入https://esphome.io/components/voice_assistant.html 

 

 

github:https://github.com/k2-fsa/sherpa-onnx/

Comments


Comments are closed