Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.
-
Updated
Sep 21, 2026 - Python
Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.
Open-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.
Fun-ASR speech recognition models, with native Hugging Face Transformers support for Fun-ASR-Nano and separate FunASR, vLLM and llama.cpp deployment paths.
High-performance Google Colab Notebook for fast & accurate audio transcription/translation using OpenAI Whisper. Accelerated on TPUs with PyTorch/XLA. Features an interactive UI for model selection, multi-language support, and long-form audio processing.
Lightweight real-time ASR powered by a Microsoft offline speech recognition model. CPU-only, supporting 10 languages, Windows, Linux, macOS, and C#, C++, Python SDKs. 基于微软离线语音识别模型的轻量级实时 ASR,纯 CPU 运行,支持 10 种语言及 Windows、Linux、macOS,提供 C#、C++ 和 Python SDK。
本地优先的 AI 双语字幕工作台:WhisperX/MLX 转录、智能断句、上下文翻译与字幕编辑,支持 macOS 和 Windows。
Point of Interest Error Rate (PIER) Metric for Code-Switching ASR: A specialized evaluation metric designed to focus on critical points in multilingual speech recognition, providing a more accurate analysis of code-switched utterances.
Real-time transformer-based ASR supporting 100+ languages - Google Cloud integration with noise cancellation & low-latency optimization
AISRT - 本地 AI 字幕生成工具 / local AI subtitle generator for video/audio to SRT, multilingual ASR, timestamp alignment, GUI/CLI batch processing, and local SRT translation.
Benchmarking AI4Bharat IndicConformer ASR across major Indian languages using the Kathbath dataset and Word Error Rate (WER).
Code-switching ASR adaptation for strong multilingual speech recognition models. Synthetic CSW data generation, Whisper adaptation, Bayesian LoRA (BLoRA), and robust multilingual ASR evaluation.
Evidence-preserving transcription for Hokkien, Singlish, Mandarin and English—multilingual ASR, diarization, cost controls, provenance and human review.
To associate your repository with the multilingual-asr topic, visit your repo's landing page and select "manage topics."