speech-to-text
Dépôts open source suivis étiquetés speech-to-text, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de speech-to-text sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés speech-to-text.
- #1
Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.
★ 2 214 - #2
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 1 001 - #3
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 544 - #4
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541 - #5
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 502
- #1
Portage du modèle Whisper d'OpenAI en C/C++.
★ 53 389+103Évolution des étoiles sur les 7 derniers jours - #2
Une application de reconnaissance vocale gratuite, open source et extensible, fonctionnant entièrement hors ligne.
★ 30 916+280Évolution des étoiles sur les 7 derniers jours - #3
Assistant de réunion IA axé sur la confidentialité, avec transcription en direct 4x plus rapide via Parakeet/Whisper, diarisation des locuteurs et résumé par Ollama, le tout en Rust. Traitement 100 % local, sans cloud. Meetily est l'outil open-source auto-hébergé de prise de notes de réunion pour macOS et Windows.
★ 30 252+195Évolution des étoiles sur les 7 derniers jours - #4★ 25 859+113Évolution des étoiles sur les 7 derniers jours
- #5
Transcription Faster Whisper optimisée avec CTranslate2
★ 25 206+71Évolution des étoiles sur les 7 derniers jours - #6
WhisperX : reconnaissance vocale automatique avec horodatage au niveau du mot et diarisation.
★ 23 864+61Évolution des étoiles sur les 7 derniers jours - #7
YC (S26) | Open Computer History | Enregistrez votre écran en continu localement et fournissez du contexte à vos agents (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21 376+80Évolution des étoiles sur les 7 derniers jours - #8
Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.
★ 20 136+64Évolution des étoiles sur les 7 derniers jours - #9
Traduire une vidéo d'une langue à une autre et intégrer le doublage et les sous-titres.
★ 18 871+38Évolution des étoiles sur les 7 derniers jours - #10★ 17 476+1Évolution des étoiles sur les 7 derniers jours
- #11★ 15 474+3Évolution des étoiles sur les 7 derniers jours
- #12
API de reconnaissance vocale hors ligne pour Android, iOS, Raspberry Pi et serveurs avec Python, Java, C# et Node.
★ 15 101+17Évolution des étoiles sur les 7 derniers jours - #13
VoiceStudio est l'alternative open source et entièrement locale à ElevenLabs : clonage vocal, design vocal, doublage vidéo, dictée, transcription et création de livres audio en 646 langues.
★ 14 835+2 880Évolution des étoiles sur les 7 derniers jours - #14
Transcription, synthèse vocale, diarisation, amélioration de la parole, séparation de sources et VAD utilisant la nouvelle génération de Kaldi avec onnxruntime, sans connexion Internet. Supporte les systèmes embarqués, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, NPU RK, NPU Axera, NPU Ascend, serveurs x86_64, client/serveur websocket, et 12 langages de programmation.
★ 14 575+95Évolution des étoiles sur les 7 derniers jours - #15
Créez des agents vocaux avec des modèles open-source
★ 13 015+82Évolution des étoiles sur les 7 derniers jours - #16
Interface Web Gradio pour créateurs et développeurs, intégrant des fonctionnalités clés de TTS (Edge-TTS, kokoro) et de clonage vocal zero-shot (E2 & F5-TTS, CosyVoice), avec traitement audio Whisper, téléchargement YouTube, isolation vocale Demucs et traduction multilingue.
★ 12 730+54Évolution des étoiles sur les 7 derniers jours - #17
Une boîte à outils pour la parole basée sur PyTorch.
★ 11 802+10Évolution des étoiles sur les 7 derniers jours - #18
Transcription parole-texte locale en temps réel avec ASR en streaming, diarisation des locuteurs, traduction et API compatibles OpenAI/Deepgram.
★ 10 990+16Évolution des étoiles sur les 7 derniers jours - #19
Bibliothèque de reconnaissance vocale robuste, efficace et à faible latence avec détection d'activité vocale avancée, activation par mot-clé et transcription instantanée.
★ 10 108+18Évolution des étoiles sur les 7 derniers jours - #20
Modèle open source SenseVoiceSmall pour la reconnaissance vocale (ASR) en mandarin, cantonais, anglais, japonais et coréen, incluant l'identification de la langue, la reconnaissance des émotions et la détection d'événements audio.
★ 9 209+37Évolution des étoiles sur les 7 derniers jours - #21
Module de reconnaissance vocale pour Python, prenant en charge plusieurs moteurs et API, en ligne et hors ligne.
★ 8 987+0Évolution des étoiles sur les 7 derniers jours - #22
Système de reconnaissance vocale chinoise basé sur l'apprentissage profond.
★ 8 386+0Évolution des étoiles sur les 7 derniers jours - #23
Une bibliothèque de synthèse vocale (TTS), de reconnaissance vocale (STT) et de conversion parole-à-parole (STS) basée sur le framework MLX d'Apple, offrant une analyse vocale efficace sur Apple Silicon.
★ 7 826+23Évolution des étoiles sur les 7 derniers jours - #24★ 6 815-1Évolution des étoiles sur les 7 derniers jours
- #25
IA vocale embarquée pour Apple Silicon
★ 6 353+8Évolution des étoiles sur les 7 derniers jours - #26
Outil de transcription vidéo, de génération de sous-titres et de découpage assisté par LLM basé sur FunASR, avec une interface Gradio locale.
★ 6 210+13Évolution des étoiles sur les 7 derniers jours - #27
Application de dictée vocale avec modèles locaux (Nvidia Parakeet/Whisper) et cloud (BYOK). Axée sur la confidentialité et disponible sur toutes les plateformes.
★ 6 133+305Évolution des étoiles sur les 7 derniers jours - #28
Silero Models : modèles de synthèse vocale pré-entraînés rendus extrêmement simples.
★ 6 084-1Évolution des étoiles sur les 7 derniers jours - #29
Transformez votre PC, Mac ou machine Linux en serveur d'IA. Inférence LLM, interface de chat, voix, agents, workflows, RAG et génération d'images.
★ 5 931+1 108Évolution des étoiles sur les 7 derniers jours - #30
Reconnaissance vocale automatique avec diarisation des locuteurs basée sur OpenAI Whisper.
★ 5 634+1Évolution des étoiles sur les 7 derniers jours