跳转到内容

stt-services

1. 开源语音转文字(STT/ASR)服务

Section titled “1. 开源语音转文字(STT/ASR)服务”

本文汇总了目前业界主流的开源语音转文字(Speech-to-Text / Automatic Speech Recognition)服务与框架,以便进行技术选型。

由 Mozilla 开发的基于 TensorFlow 的开源语音识别引擎。

由 OpenAI 开源的多语言通用语音识别模型,具有极高的准确率和鲁棒性,支持翻译与转录。

  • 优势:支持多种语言,能够应对复杂的背景噪音,社区活跃度极高(衍生出如 whisper.cpp 等高性能推理实现)。
  • 相关资源

基于百度飞桨(PaddlePaddle)平台开发的易用、高效的语音方向开发套件。

  • 优势:对中文语音识别(ASR)、语音合成(TTS)、声音分类等任务支持极为友好,提供一键式预测和部署。
  • 相关资源

由阿里巴巴达摩院开源的语音端到端学习及开放包,致力于构建工业级的语音识别、语音端点检测(VAD)等工具。

  • 优势:具备极强的工程落地能力,支持中文高精度实时转写及多场景定制。
  • 相关资源