Skip to content

x-onnxkit-s 离线语音识别与合成(单独付费)

离线 ASR / TTS / 流式 ASR。模型不内置,用 ZIP 解压后把目录传给 modelRoot

模型下载见 sherpa-onnx

兼容性

HarmonyIOSAndroidWEB小程序
支持支持支持支持不支持

调用

ts
import { prepareModel, loadAsrModel, recognizeWav, startStreamingAsr, loadTtsModel, synthesize } from "@/uni_modules/x-onnxkit-s"

prepareModel({
  archivePath: zipPath,
  modelId: "asr",
  success: (r) => {
    loadAsrModel({
      modelType: "sense-voice",
      modelRoot: r.modelRoot,
      files: { model: "model.int8.onnx", tokens: "tokens.txt" },
      language: "zh",
      success: () => {
        recognizeWav({
          wavUri: wavPath,
          success: (res) => {
            console.log(res.text)
          }
        })
      }
    })
  }
})

TTS:

ts
loadTtsModel({
  modelType: "vits",
  modelRoot: ttsRoot,
  files: { model: "model.onnx", tokens: "tokens.txt", lexicon: "lexicon.txt" },
  success: () => {
    synthesize({
      text: "你好,这是离线语音合成。",
      sid: 0,
      speed: 1,
      success: (res) => {
        console.log(res.audioUri)
      }
    })
  }
})

方法

名称需要说明
prepareModelarchivePathmodelId,可选回调解压 ZIP,成功返回 modelRoot
loadAsrModelmodelTypemodelRootfiles,可选 languagetasknumThreads加载离线识别模型。modelTypesense-voice / whisper / paraformer / transducer / qwen3-asr
recognizeWavwavUri识别一段 wav,成功返回 text
unloadAsr卸载识别模型
loadTtsModelmodelTypemodelRootfiles,可选 numThreads加载合成模型。modelTypevits / matcha / kokoro / kitten
synthesizetext,可选 sid(默认 0)、speed(默认 1)合成语音,成功返回 audioUri
unloadTts卸载合成模型
startStreamingAsrmodelRootfilesonEvent开始流式识别,onEvent 收 partial / final
stopStreamingAsr结束流式识别
getRuntimeInfo同步返回运行时信息
getAsrState / getTtsState / getStreamingState查询对应模块状态
releaseAudioUriWeb 上的音频地址释放 Web Blob URL,其它端可忽略

files 里的路径相对 modelRoot。移动端 ZIP 不需要 manifest。

平台差异

  1. 微信不支持。
  2. Web 的 modelRoot 必须是带 CORS 的 HTTP(S) 目录,且要有 x-onnxkit-manifest.json
  3. 鸿蒙需在 harmony-configs 里配置 Worker,否则加载失败。
  4. releaseAudioUri 仅 Web 有效。

版本

版权归https://xui.tmui.design你不得修改及二次开发,仅供TMUI4会员商用使用。不得转给非VIP会员使用,一经查实数倍赔偿,并追究法律责任。

更新日志

1.0.0(2026-07-31)

  • Android/iOS 离线 WAV 语音识别。
  • 支持 SenseVoice、Whisper、Paraformer、Transducer 模型配置。
  • tts语音合成支持通过参数配置调试音色,语速等各种配置
  • 模型文件比较大,请通过作者提前编译好的模型离线下载共模型加载使用。
  • ASR ,语音转文字
  • TTS ,文字转语音
最近更新