跳到主要内容
buildradar
登录
主题 · speech-recognition

speech-recognition

标记 speech-recognition 主题、收录中的开源项目,按星标数排序。

共 156 个项目
  • 💎 适用于 ASR、TTS 及其他语音技术的无障碍语音语料库列表

    1,399+0近 7 天星标变化
  • mlx-tune@ARahim3

    在配备 Apple Silicon 的 Mac 上微调 LLMs。支持 SFT、DPO、GRPO、Vision、TTS、STT、Embedding 与 OCR 微调 —— 基于 MLX 原生实现。兼容 Unsloth API。

    1,398+0近 7 天星标变化
  • CrisperWhisper@nyrahealth

    可控制的转录。逐字(包含每个语气词、停顿、口吃、声音)或意图(说话者想表达的意思,针对可读性优化),并带有单词级别的时间戳。

    1,371+0近 7 天星标变化
  • whisper-ctranslate2@Softcatala

    基于 CTranslate2、兼容原始 OpenAI 客户端的 Whisper 命令行客户端。

    1,346+0近 7 天星标变化
  • J.A.R.V.I.S@GauravSingh9356

    使用 Python 库构建的个人助理。它几乎可以做任何事情,包括发送电子邮件、光学文字识别、通过 API 集成随时动态播报新闻、待办事项列表生成器、仅通过语音命令打开任何网站、播放音乐、维基百科搜索、具有智能感知功能的词典(即自动拼写检查)、天气报告(即温度、风速、湿度)

    1,341+0近 7 天星标变化
  • voxtype@peteonrails

    适用于 Wayland 复合管理器的按住发言语音转文字工具

    1,338+0近 7 天星标变化
  • StreamSpeech@ictnlp

    StreamSpeech 是一个用于离线与同步语音识别、语音翻译及语音合成的“一体化”无缝模型。

    1,288+0近 7 天星标变化
  • pruna@PrunaAI

    Pruna 是一个为开发者打造的模型优化框架,能让你以极低的额外开销交付更快、更高效的模型。

    1,274+0近 7 天星标变化
  • vosk-server@alphacep

    基于 Vosk 与 Kaldi 库的 WebSocket、gRPC 和 WebRTC 语音识别服务器

    1,262+0近 7 天星标变化
  • Whisper-Finetune@yeyupiaoling

    微调 Whisper 语音识别模型,支持无时间戳数据训练、有时间戳数据训练以及无语音数据训练。加速推理并支持 Web 部署、Windows 桌面部署与 Android 部署

    1,222+0近 7 天星标变化
  • quillman@modal-labs

    一个语音聊天应用程序

    1,212+0近 7 天星标变化
  • Treasure-of-Transformers@ashishpatel26

    💁 自然语言处理 Transformers 模型精选宝库,包含论文、视频、博客、官方代码库以及 Colab 笔记本。 🛫☑️

    1,179+0近 7 天星标变化
  • 使用 Apple Foundation Models 框架构建、测试与评估应用程序的实作实验室。

    1,178+0近 7 天星标变化
  • lotti@matthiasn

    配备个人 AI 助理团队的私人日志。AI 会读取你的记录并建议下一步操作——由你批准更改。在你的设备之间进行端到端加密同步——服务器永远只能看到密文。可选用本地 AI。

    1,168+0近 7 天星标变化
  • speech-swift@soniqo

    适用于 Apple Silicon 的 AI 语音工具组 — 由 MLX 与 CoreML 驱动的 ASR、TTS、语音转语音、VAD 与说话者分段

    1,161+0近 7 天星标变化
  • Irina - 离线运行的俄语语音助手。通过插件支持技能。

    1,153+0近 7 天星标变化
  • lhotse@lhotse-speech

    用于在机器学习项目中处理多模态数据的工具。

    1,149+0近 7 天星标变化
  • 应用程序的自我编码系统 — 适用于 Cordova 的 Alan AI SDK

    1,132+0近 7 天星标变化
  • conformer@sooftware

    [非官方] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) 的 PyTorch 实现

    1,132+0近 7 天星标变化
  • sglang-omni@sgl-project

    SGLang-Omni 为 TTS、ASR、语音与全能模型提供高性能服务。

    1,118+56近 7 天星标变化
  • AI-Waifu-Vtuber@ardha27

    用于在 Youtube/Twitch 上进行串流直播的 AI Vtuber

    1,116+3近 7 天星标变化
  • Whisperboard@Saik0s

    这是一款开源的 iOS 应用程序,让移动设备上的高质量语音转录变得更容易获取。

    1,102+6近 7 天星标变化
  • whisper-writer@savbell

    💬📝 使用 OpenAI 的 Whisper 语音识别模型的轻量语音听写应用程序。

    1,100+0近 7 天星标变化
  • 基于 Kaldi 工具包与 GStreamer 架构的实时全双工语音识别服务器。

    1,094+1近 7 天星标变化
  • 使用 Vosk 库为 Android 提供离线语音识别。

    1,057+1近 7 天星标变化
  • pykaldi@pykaldi

    Kaldi 的 Python 包装器

    1,040+1近 7 天星标变化
  • TensorFlowASR@TensorSpeech

    ⚡ TensorFlowASR:Tensorflow 2 中几乎达 SOTA 的自动语音识别。支持使用字符或子字的语言

    1,010+0近 7 天星标变化
  • StoryToolkitAI@octimot

    使用 AI 进行逐字稿转录、内容理解与视频中任意内容搜索的编辑工具,已整合 ChatGPT 与其他 AI 模型

    1,009+1近 7 天星标变化
  • sherpa@k2-fsa

    基于新一代 Kaldi 的语音转文字服务器框架

    985+4近 7 天星标变化
  • VoiceStreamAI@alesaccoia

    使用自托管 Whisper 与 WebSocket 在 Python/JS 中实现近即时音频转录。

    960+0近 7 天星标变化
← 返回主题列表