asr
标记 asr 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 asr 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 asr 主题的项目。
- #1★ 2,128
- #2
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 494 - #3
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 313
- #1★ 23,803+117近 7 天星标变化
- #2★ 20,072+108近 7 天星标变化
- #3★ 18,358+155近 7 天星标变化
- #4★ 15,084+17近 7 天星标变化
- #5
使用次世代 Kaldi 与 onnxruntime 的语音转文字、文字转语音、说话者分离、语音增强、声源分离与 VAD,支持离线运行。支持嵌入式系统、Android、iOS、HarmonyOS、Raspberry Pi、RISC‑V、RK NPU、Axera NPU、Ascend NPU、x86_64 服务器、WebSocket 服务器/客户端,支持 12 种编程语言
★ 14,480+169近 7 天星标变化 - #6
易用的语音工具包,包含自监督学习模型、SOTA/流式 ASR(含标点)、流式 TTS(含文字前端)、说话者验证系统、端到端语音翻译与关键词检测。荣获 NAACL2022 最佳示范奖
★ 12,671+6近 7 天星标变化 - #7
基于 PyTorch 的语音工具包
★ 11,792+22近 7 天星标变化 - #8
开源 SenseVoiceSmall 模型,支持普通话、粤语、英语、日语和韩语的语音识别、语言识别、情绪识别和音频事件检测。
★ 9,172+51近 7 天星标变化 - #9
这是一个 Python API,可获取指定 YouTube 视频的文字稿/字幕,支持自动生成的字幕,且不需要 API 密钥或无头浏览器,与其他基于 Selenium 的解决方案不同
★ 8,129+41近 7 天星标变化 - #10
🤖 wukong-robot 是一个简单、灵活、优雅的中文语音对话机器人/智能音箱项目,支持 ChatGPT 多轮对话能力,还可能是首个支持脑机交互的开源智能音箱项目
★ 7,124-1近 7 天星标变化 - #11★ 6,197+25近 7 天星标变化
- #12
基于 OpenAI Whisper 的自动语音识别与说话者分离
★ 5,633+7近 7 天星标变化 - #13
html5 js 录音 mp3 wav ogg webm amr g711a g711u 格式,支持 PC 和 Android、iOS 部分 Web 浏览器、Hybrid App(提供 Android iOS App 源码)、微信,提供 ASR 语音识别转文字 H5 版语音通话聊天示例 DTMF 编码解码
★ 5,628+0近 7 天星标变化 - #14★ 5,228+4近 7 天星标变化
- #15★ 4,058+20近 7 天星标变化
- #16
Streamer-Sales 销冠 —— 卖货主播 LLM 大模型🛒🎁,一个能够根据给定的商品特点从激发用户购买意愿角度出发进行商品解说的卖货主播大模型。🚀⭐内含详细的数据生成流程❗ 📦另外还集成了 LMDeploy 加速推理🚀、RAG检索增强生成 📚、TTS文字转语音🔊、数字人生成 🦸、Agent 使用网络查询实时信息🌐、ASR 语音转文字🎙️、Vue 生态搭建前端🍍、FastAPI 搭建后端🗝️、Docker-compose 打包部署🐋
★ 3,763+7近 7 天星标变化 - #17★ 3,359+164近 7 天星标变化
- #18
OpenAI Whisper ASR 网络服务 API
★ 3,326+2近 7 天星标变化 - #19
适合不想折腾 Python 的用户的 Whisper 与 Faster-Whisper 独立可执行文件。
★ 3,169+9近 7 天星标变化 - #20
使用 PySide6 的 faster_whisper 图形用户界面
★ 2,991+4近 7 天星标变化 - #21★ 2,897+305近 7 天星标变化
- #22★ 2,864+0近 7 天星标变化
- #23
支持词级时间戳和置信度的多语言自动语音识别
★ 2,841+2近 7 天星标变化 - #24
在你的应用中使用前沿的 CoreML 音频模型——文字转语音、语音转文字、语音活动检测与发言者分离。使用 Swift 开发,由 SOTA 开源技术驱动。
★ 2,710+40近 7 天星标变化 - #25★ 2,605+1近 7 天星标变化
- #26
快速提取音视频内容,整理成一份结构化的markdown笔记
★ 2,477+39近 7 天星标变化 - #27★ 2,128+178近 7 天星标变化
- #28
支援普通话、中文方言与英语的开源工业级 ASR 模型,在公开的普通话 ASR 基准测试中达到全新的 SOTA,同时提供出色的歌唱歌词辨识能力。
★ 1,974+9近 7 天星标变化 - #29
支持 16 种以上模型家族的 ggml 语音转文本推理
★ 1,860+33近 7 天星标变化 - #30★ 1,812+12近 7 天星标变化