Aller au contenu principal
buildradar
Sign in
Sujet · speech-to-text

speech-to-text

Dépôts open source suivis étiquetés speech-to-text, triés par étoiles.

Dépôts
152
Total d'étoiles
640 857
Étoiles en moyenne
4 216
Part
0,03%

Sujets qui apparaissent souvent aux côtés de speech-to-text sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés speech-to-text.

  • audio.cpp@0xShug0

    Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.

    2 214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    1 001
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    544
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    541
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    502
  • whisper.cpp@ggml-org

    Portage du modèle Whisper d'OpenAI en C/C++.

    53 389+103Évolution des étoiles sur les 7 derniers jours
  • Handy@cjpais

    Une application de reconnaissance vocale gratuite, open source et extensible, fonctionnant entièrement hors ligne.

    30 916+280Évolution des étoiles sur les 7 derniers jours
  • meetily@Zackriya-Solutions

    Assistant de réunion IA axé sur la confidentialité, avec transcription en direct 4x plus rapide via Parakeet/Whisper, diarisation des locuteurs et résumé par Ollama, le tout en Rust. Traitement 100 % local, sans cloud. Meetily est l'outil open-source auto-hébergé de prise de notes de réunion pour macOS et Windows.

    30 252+195Évolution des étoiles sur les 7 derniers jours
  • llamafile@mozilla-ai

    Distribuez et exécutez des LLM avec un seul fichier.

    25 859+113Évolution des étoiles sur les 7 derniers jours
  • faster-whisper@SYSTRAN

    Transcription Faster Whisper optimisée avec CTranslate2

    25 206+71Évolution des étoiles sur les 7 derniers jours
  • whisperX@m-bain

    WhisperX : reconnaissance vocale automatique avec horodatage au niveau du mot et diarisation.

    23 864+61Évolution des étoiles sur les 7 derniers jours
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Enregistrez votre écran en continu localement et fournissez du contexte à vos agents (Claude, Codex, Openclaw, Hermes, Runner...)

    21 376+80Évolution des étoiles sur les 7 derniers jours
  • FunASR@modelscope

    Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.

    20 136+64Évolution des étoiles sur les 7 derniers jours
  • pyvideotrans@jianchang512

    Traduire une vidéo d'une langue à une autre et intégrer le doublage et les sous-titres.

    18 871+38Évolution des étoiles sur les 7 derniers jours
  • leon@leon-ai

    Leon est votre assistant personnel open source.

    17 476+1Évolution des étoiles sur les 7 derniers jours
  • kaldi@kaldi-asr

    kaldi-asr/kaldi est le dépôt officiel du projet Kaldi.

    15 474+3Évolution des étoiles sur les 7 derniers jours
  • vosk-api@alphacep

    API de reconnaissance vocale hors ligne pour Android, iOS, Raspberry Pi et serveurs avec Python, Java, C# et Node.

    15 101+17Évolution des étoiles sur les 7 derniers jours
  • VoiceStudio@debpalash

    VoiceStudio est l'alternative open source et entièrement locale à ElevenLabs : clonage vocal, design vocal, doublage vidéo, dictée, transcription et création de livres audio en 646 langues.

    14 835+2 880Évolution des étoiles sur les 7 derniers jours
  • sherpa-onnx@k2-fsa

    Transcription, synthèse vocale, diarisation, amélioration de la parole, séparation de sources et VAD utilisant la nouvelle génération de Kaldi avec onnxruntime, sans connexion Internet. Supporte les systèmes embarqués, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, NPU RK, NPU Axera, NPU Ascend, serveurs x86_64, client/serveur websocket, et 12 langages de programmation.

    14 575+95Évolution des étoiles sur les 7 derniers jours
  • speech-to-speech@huggingface

    Créez des agents vocaux avec des modèles open-source

    13 015+82Évolution des étoiles sur les 7 derniers jours
  • voice-pro@abus-aikorea

    Interface Web Gradio pour créateurs et développeurs, intégrant des fonctionnalités clés de TTS (Edge-TTS, kokoro) et de clonage vocal zero-shot (E2 & F5-TTS, CosyVoice), avec traitement audio Whisper, téléchargement YouTube, isolation vocale Demucs et traduction multilingue.

    12 730+54Évolution des étoiles sur les 7 derniers jours
  • speechbrain@speechbrain

    Une boîte à outils pour la parole basée sur PyTorch.

    11 802+10Évolution des étoiles sur les 7 derniers jours
  • WhisperLiveKit@QuentinFuxa

    Transcription parole-texte locale en temps réel avec ASR en streaming, diarisation des locuteurs, traduction et API compatibles OpenAI/Deepgram.

    10 990+16Évolution des étoiles sur les 7 derniers jours
  • RealtimeSTT@KoljaB

    Bibliothèque de reconnaissance vocale robuste, efficace et à faible latence avec détection d'activité vocale avancée, activation par mot-clé et transcription instantanée.

    10 108+18Évolution des étoiles sur les 7 derniers jours
  • SenseVoice@QwenAudio

    Modèle open source SenseVoiceSmall pour la reconnaissance vocale (ASR) en mandarin, cantonais, anglais, japonais et coréen, incluant l'identification de la langue, la reconnaissance des émotions et la détection d'événements audio.

    9 209+37Évolution des étoiles sur les 7 derniers jours
  • Module de reconnaissance vocale pour Python, prenant en charge plusieurs moteurs et API, en ligne et hors ligne.

    8 987+0Évolution des étoiles sur les 7 derniers jours
  • Système de reconnaissance vocale chinoise basé sur l'apprentissage profond.

    8 386+0Évolution des étoiles sur les 7 derniers jours
  • mlx-audio@Blaizzy

    Une bibliothèque de synthèse vocale (TTS), de reconnaissance vocale (STT) et de conversion parole-à-parole (STS) basée sur le framework MLX d'Apple, offrant une analyse vocale efficace sur Apple Silicon.

    7 826+23Évolution des étoiles sur les 7 derniers jours
  • annyang@TalAter

    Reconnaissance vocale pour votre site web.

    6 815-1Évolution des étoiles sur les 7 derniers jours
  • argmax-oss-swift@argmaxinc

    IA vocale embarquée pour Apple Silicon

    6 353+8Évolution des étoiles sur les 7 derniers jours
  • FunClip@modelscope

    Outil de transcription vidéo, de génération de sous-titres et de découpage assisté par LLM basé sur FunASR, avec une interface Gradio locale.

    6 210+13Évolution des étoiles sur les 7 derniers jours
  • openwhispr@OpenWhispr

    Application de dictée vocale avec modèles locaux (Nvidia Parakeet/Whisper) et cloud (BYOK). Axée sur la confidentialité et disponible sur toutes les plateformes.

    6 133+305Évolution des étoiles sur les 7 derniers jours
  • silero-models@snakers4

    Silero Models : modèles de synthèse vocale pré-entraînés rendus extrêmement simples.

    6 084-1Évolution des étoiles sur les 7 derniers jours
  • ODS@Osmantic

    Transformez votre PC, Mac ou machine Linux en serveur d'IA. Inférence LLM, interface de chat, voix, agents, workflows, RAG et génération d'images.

    5 931+1 108Évolution des étoiles sur les 7 derniers jours
  • whisper-diarization@MahmoudAshraf97

    Reconnaissance vocale automatique avec diarisation des locuteurs basée sur OpenAI Whisper.

    5 634+1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets