跳到主要内容
buildradar
Sign in
主题 · asr

asr

标记 asr 主题、收录中的开源项目,按星标数排序。

项目数
85
总星标数
260,867
平均星标数
3,069
占比
0.01%

常跟 asr 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 asr 主题的项目。

  • audio.cpp@0xShug0

    一款由 ggml 驱动的一体化纯 C++ 音频模型推理引擎。支持 TTS、STT、VAD、语音转换、音乐生成等功能,具备高度优化的性能,无 Python 依赖。

    2,128
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    494
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    313
  • whisperX@m-bain

    WhisperX:具备单字层级时间戳(及说话者分割)的自动语音识别

    23,803+117近 7 天星标变化
  • FunASR@modelscope

    开源语音识别工具包,支持训练、推理、流式 ASR、VAD、标点、说话人分离流水线,并提供兼容 OpenAI / MCP 的服务接口

    20,072+108近 7 天星标变化
  • Speech@NVIDIA-NeMo

    为研究人员与开发者打造的可扩展生成式 AI 框架,支持大型语言模型、多模态与语音 AI(自动语音识别与文本转语音)

    18,358+155近 7 天星标变化
  • vosk-api@alphacep

    支持 Android、iOS、Raspberry Pi 与服务器的离线语音识别 API,提供 Python、Java、C# 与 Node 接口

    15,084+17近 7 天星标变化
  • sherpa-onnx@k2-fsa

    使用次世代 Kaldi 与 onnxruntime 的语音转文字、文字转语音、说话者分离、语音增强、声源分离与 VAD,支持离线运行。支持嵌入式系统、Android、iOS、HarmonyOS、Raspberry Pi、RISC‑V、RK NPU、Axera NPU、Ascend NPU、x86_64 服务器、WebSocket 服务器/客户端,支持 12 种编程语言

    14,480+169近 7 天星标变化
  • PaddleSpeech@PaddlePaddle

    易用的语音工具包,包含自监督学习模型、SOTA/流式 ASR(含标点)、流式 TTS(含文字前端)、说话者验证系统、端到端语音翻译与关键词检测。荣获 NAACL2022 最佳示范奖

    12,671+6近 7 天星标变化
  • speechbrain@speechbrain

    基于 PyTorch 的语音工具包

    11,792+22近 7 天星标变化
  • SenseVoice@QwenAudio

    开源 SenseVoiceSmall 模型,支持普通话、粤语、英语、日语和韩语的语音识别、语言识别、情绪识别和音频事件检测。

    9,172+51近 7 天星标变化
  • 这是一个 Python API,可获取指定 YouTube 视频的文字稿/字幕,支持自动生成的字幕,且不需要 API 密钥或无头浏览器,与其他基于 Selenium 的解决方案不同

    8,129+41近 7 天星标变化
  • wukong-robot@wzpan

    🤖 wukong-robot 是一个简单、灵活、优雅的中文语音对话机器人/智能音箱项目,支持 ChatGPT 多轮对话能力,还可能是首个支持脑机交互的开源智能音箱项目

    7,124-1近 7 天星标变化
  • FunClip@modelscope

    基于 FunASR 的视频转录、字幕生成与 LLM 协助剪辑工具,配备本地 Gradio UI

    6,197+25近 7 天星标变化
  • whisper-diarization@MahmoudAshraf97

    基于 OpenAI Whisper 的自动语音识别与说话者分离

    5,633+7近 7 天星标变化
  • Recorder@xiangyuecn

    html5 js 录音 mp3 wav ogg webm amr g711a g711u 格式,支持 PC 和 Android、iOS 部分 Web 浏览器、Hybrid App(提供 Android iOS App 源码)、微信,提供 ASR 语音识别转文字 H5 版语音通话聊天示例 DTMF 编码解码

    5,628+0近 7 天星标变化
  • wenet@wenet-e2e

    先行生产且即时可用的端到端语音识别工具包

    5,228+4近 7 天星标变化
  • LLPlayer@umlx5h

    语言学习媒体播放器,支持双字幕、AI 生成字幕、实时翻译等功能。

    4,058+20近 7 天星标变化
  • Streamer-Sales@PeterH0323

    Streamer-Sales 销冠 —— 卖货主播 LLM 大模型🛒🎁,一个能够根据给定的商品特点从激发用户购买意愿角度出发进行商品解说的卖货主播大模型。🚀⭐内含详细的数据生成流程❗ 📦另外还集成了 LMDeploy 加速推理🚀、RAG检索增强生成 📚、TTS文字转语音🔊、数字人生成 🦸、Agent 使用网络查询实时信息🌐、ASR 语音转文字🎙️、Vue 生态搭建前端🍍、FastAPI 搭建后端🗝️、Docker-compose 打包部署🐋

    3,763+7近 7 天星标变化
  • openless@Open-Less

    按住快捷键说话,松开即得到经 AI 精炼的文字。开源语音输入,支持 macOS & Windows。

    3,359+164近 7 天星标变化
  • OpenAI Whisper ASR 网络服务 API

    3,326+2近 7 天星标变化
  • 适合不想折腾 Python 的用户的 Whisper 与 Faster-Whisper 独立可执行文件。

    3,169+9近 7 天星标变化
  • faster-whisper-GUI@CheshireCC

    使用 PySide6 的 faster_whisper 图形用户界面

    2,991+4近 7 天星标变化
  • GPA@AutoArk

    [AutoArk] GPA (General Purpose Audio) 只需一个极小的模型即可进行 ASR、TTS 与语音转换!

    2,897+305近 7 天星标变化
  • lingvo@tensorflow

    Lingvo

    2,864+0近 7 天星标变化
  • whisper-timestamped@linto-ai

    支持词级时间戳和置信度的多语言自动语音识别

    2,841+2近 7 天星标变化
  • FluidAudio@FluidInference

    在你的应用中使用前沿的 CoreML 音频模型——文字转语音、语音转文字、语音活动检测与发言者分离。使用 Swift 开发,由 SOTA 开源技术驱动。

    2,710+40近 7 天星标变化
  • STT@coqui-ai

    🐸STT - 用于语音转文字的深度学习工具包。训练与部署 STT 模型从未如此简单。

    2,605+1近 7 天星标变化
  • AudioNotes@harry0703

    快速提取音视频内容,整理成一份结构化的markdown笔记

    2,477+39近 7 天星标变化
  • audio.cpp@0xShug0

    一款由 ggml 驱动的一体化纯 C++ 音频模型推理引擎。支持 TTS、STT、VAD、语音转换、音乐生成等功能,具备高度优化的性能,无 Python 依赖。

    2,128+178近 7 天星标变化
  • FireRedASR@FireRedTeam

    支援普通话、中文方言与英语的开源工业级 ASR 模型,在公开的普通话 ASR 基准测试中达到全新的 SOTA,同时提供出色的歌唱歌词辨识能力。

    1,974+9近 7 天星标变化
  • transcribe.cpp@handy-computer

    支持 16 种以上模型家族的 ggml 语音转文本推理

    1,860+33近 7 天星标变化
  • 次世代 AI+IoT 框架,支援 T2/T3/T5AI/ESP32 等晶片 – 快速整合物联网与 AI Agent 硬件

    1,812+12近 7 天星标变化
← 返回主题列表