跳到主要内容
buildradar
登录
主题 · asr

asr

标记 asr 主题、收录中的开源项目,按星标数排序。

共 88 个项目
  • sherpa-ncnn@k2-fsa

    使用新一代 Kaldi 与 ncnn 在无网络连接下进行实时语音识别与语音活动检测(VAD)。支持 iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4A 等。

    1,777+0近 7 天星标变化
  • bailing@wwbin2017

    百聆 是一个类似 GPT-4o 的语音对话机器人,通过 ASR+LLM+TTS 实现,集成 DeepSeek R1 等优秀大模型,接入 openClaw,真正的个人语音助手,时延低至 800ms,Mac 等低配置也可运行,支持打断

    1,759+0近 7 天星标变化
  • dsnote@mkiol

    Speech Note Linux 应用程序。具备离线语音转文字、文字转语音以及机器翻译的笔记、阅读与翻译功能。

    1,622+0近 7 天星标变化
  • video-analyzer@byjlw

    使用 LLM、计算机视觉和自动语音识别来分析视频。

    1,570+0近 7 天星标变化
  • amical@amicalhq

    🎙️ AI 语音听写应用程序 - 开源且本地优先 ⚡ 输入速度提升 3 倍,无需键盘。 🆓 基于开源模型驱动,可离线运行,快速且准确。

    1,520+0近 7 天星标变化
  • Fun-ASR@QwenAudio

    开源基于 LLM 的中文、方言、口音及多语种语音 ASR 模型家族,具备 FunASR、vLLM、流式与 llama.cpp 运行时。

    1,512+0近 7 天星标变化
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge 是一个围绕 TTS 生成模型开发的项目,实现了 API 服务器与基于 Gradio 的 WebUI。

    1,418+0近 7 天星标变化
  • SoniTranslate@R3gm

    视频同步翻译与视频配音

    1,413+0近 7 天星标变化
  • CrisperWhisper@nyrahealth

    可控制的转录。逐字(包含每个语气词、停顿、口吃、声音)或意图(说话者想表达的意思,针对可读性优化),并带有单词级别的时间戳。

    1,371+0近 7 天星标变化
  • voicemode@mbailey

    与 Claude Code 进行自然语音对话

    1,347+0近 7 天星标变化
  • VideoChat@Henry-23

    实时交互数字人,可自定义形象与音色,支持音色克隆,对话延迟低至 3 秒

    1,303+0近 7 天星标变化
  • StreamSpeech@ictnlp

    StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。

    1,288+0近 7 天星标变化
  • vosk-server@alphacep

    基于 Vosk 与 Kaldi 库的 WebSocket、gRPC 和 WebRTC 语音识别服务器

    1,262+0近 7 天星标变化
  • Whisper-Finetune@yeyupiaoling

    微调 Whisper 语音识别模型,支持无时间戳数据训练、有时间戳数据训练以及无语音数据训练。加速推理并支持 Web 部署、Windows 桌面部署与 Android 部署

    1,222+0近 7 天星标变化
  • speech-swift@soniqo

    适用于 Apple Silicon 的 AI 语音工具组 — 由 MLX 与 CoreML 驱动的 ASR、TTS、语音转语音、VAD 与说话者分段

    1,161+0近 7 天星标变化
  • Mega-ASR@xzf-thu

    专为真实世界打造的第一个基础 ASR——具备 7 种原子级声学条件、54 种复合场景、260 万个样本,在其他模型纷纷失效的环境下,效能比 SOTA 提升高达约 30%。**当其他模型在实战中失败时,你最后还是会回到 MEGA-ASR。⭐**

    1,136+0近 7 天星标变化
  • conformer@sooftware

    [非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 实现

    1,132+0近 7 天星标变化
  • sglang-omni@sgl-project

    SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。

    1,118+56近 7 天星标变化
  • violin@shang-zhu

    开源视频翻译技能

    1,057+6近 7 天星标变化
  • 使用 Vosk 库为 Android 提供离线语音识别。

    1,057+1近 7 天星标变化
  • murmure@Kieirra

    完全本地、隐私且跨平台的语音转文字工具,并具备 LLM 后处理功能

    1,056+9近 7 天星标变化
  • pykaldi@pykaldi

    Kaldi 的 Python 包装器

    1,040+1近 7 天星标变化
  • jonex@yuezhiai

    多合一多模态解析引擎,结合本体论与 LLM Wiki 驱动的 AI 就绪知识引擎

    1,022+63近 7 天星标变化
  • sherpa@k2-fsa

    基于新一代 Kaldi 的语音转文字服务器框架

    985+4近 7 天星标变化
  • espresso@freewym

    Espresso:一个快速的端到端神经语音识别工具包

    939+0近 7 天星标变化
  • vocotype-cli@233stone

    VocoType 是一款运行在本地端侧的隐私安全语音输入工具,通过快捷键即可将语音实时转换为文字并自动输入到当前应用。支持语音转文字 MCP、AI 优化文本、自定义替换词典、录音视频转文字等功能,让语音输入更高效、更安全。

    930+10近 7 天星标变化
  • whisper.api@innovatorved

    此项目提供具备用户级访问支持的 API,使用微调并处理过的 Whisper ASR 模型将语音转为文字。

    914+0近 7 天星标变化
  • SmartJavaAI@geekwenjie

    🔥🔥🔥Java免费离线AI算法工具箱,支持人脸识别、活体检测、表情识别、目标检测、实例分割、行人检测、OCR文字识别、车牌识别、表格识别、ASR+TTS、机器翻译等功能,Maven引用即可使用。支持PyTorch、Tensorflow,已集成 Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper等主流模型

    910+4近 7 天星标变化
  • Easy-Voice-Toolkit@Spr-Aachen

    一个用户友好的语音识别、转录、转换等工具箱 | 简单易用的语音工具箱

    873+0近 7 天星标变化
  • PPASR@yeyupiaoling

    基于 PaddlePaddle 实现端到端中文语音识别,从入门到实战,超简单的入门案例,超实用的企业项目。支持当前最流行的 DeepSpeech2、Conformer、Squeezeformer 模型

    870-1近 7 天星标变化
← 返回主题列表