asr
Dépôts open source suivis étiquetés asr, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de asr sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés asr.
- #1
Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.
★ 2 214 - #2
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501 - #3
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 327
- #1
WhisperX : reconnaissance vocale automatique avec horodatage au niveau du mot et diarisation.
★ 23 864+61Évolution des étoiles sur les 7 derniers jours - #2
Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.
★ 20 136+64Évolution des étoiles sur les 7 derniers jours - #3
Framework d'IA générative évolutif conçu pour les chercheurs et développeurs travaillant sur les grands modèles de langage, le multimodal et l'IA vocale (ASR et TTS).
★ 18 379+21Évolution des étoiles sur les 7 derniers jours - #4
API de reconnaissance vocale hors ligne pour Android, iOS, Raspberry Pi et serveurs avec Python, Java, C# et Node.
★ 15 101+17Évolution des étoiles sur les 7 derniers jours - #5
Transcription, synthèse vocale, diarisation, amélioration de la parole, séparation de sources et VAD utilisant la nouvelle génération de Kaldi avec onnxruntime, sans connexion Internet. Supporte les systèmes embarqués, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, NPU RK, NPU Axera, NPU Ascend, serveurs x86_64, client/serveur websocket, et 12 langages de programmation.
★ 14 575+95Évolution des étoiles sur les 7 derniers jours - #6
Boîte à outils vocale facile à utiliser incluant l'apprentissage auto-supervisé, la reconnaissance vocale (ASR) SOTA/en continu avec ponctuation, la synthèse vocale (TTS) en continu avec interface textuelle, un système de vérification du locuteur, la traduction vocale de bout en bout et la détection de mots-clés. Lauréat du prix Best Demo à NAACL2022.
★ 12 676+5Évolution des étoiles sur les 7 derniers jours - #7
Une boîte à outils pour la parole basée sur PyTorch.
★ 11 802+10Évolution des étoiles sur les 7 derniers jours - #8
Modèle open source SenseVoiceSmall pour la reconnaissance vocale (ASR) en mandarin, cantonais, anglais, japonais et coréen, incluant l'identification de la langue, la reconnaissance des émotions et la détection d'événements audio.
★ 9 209+37Évolution des étoiles sur les 7 derniers jours - #9
API Python permettant d'obtenir la transcription ou les sous-titres d'une vidéo YouTube. Fonctionne également avec les sous-titres générés automatiquement et ne nécessite ni clé API ni navigateur headless, contrairement aux solutions basées sur Selenium.
★ 8 143+14Évolution des étoiles sur les 7 derniers jours - #10
wukong-robot est un robot de conversation vocale et une enceinte intelligente simple, flexible et élégante, prenant en charge les dialogues multi-tours ChatGPT et potentiellement la première interface cerveau-machine open source.
★ 7 126+2Évolution des étoiles sur les 7 derniers jours - #11
Outil de transcription vidéo, de génération de sous-titres et de découpage assisté par LLM basé sur FunASR, avec une interface Gradio locale.
★ 6 210+13Évolution des étoiles sur les 7 derniers jours - #12
Reconnaissance vocale automatique avec diarisation des locuteurs basée sur OpenAI Whisper.
★ 5 634+1Évolution des étoiles sur les 7 derniers jours - #13
Enregistrement audio HTML5 (mp3, wav, ogg, webm, amr, g711a, g711u). Supporte PC, navigateurs mobiles, applications hybrides et WeChat. Inclut la reconnaissance vocale ASR et des exemples de chat vocal.
★ 5 631+3Évolution des étoiles sur les 7 derniers jours - #14★ 5 229+1Évolution des étoiles sur les 7 derniers jours
- #15
Lecteur multimédia pour l'apprentissage des langues, avec sous-titres doubles, sous-titres générés par IA, traduction en temps réel, et plus encore.
★ 4 070+12Évolution des étoiles sur les 7 derniers jours - #16
Streamer-Sales 销冠 —— LLM pour le live shopping. Un modèle capable de présenter des produits en stimulant l'intention d'achat selon leurs caractéristiques. Inclut un processus de génération de données, l'accélération d'inférence avec LMDeploy, RAG, TTS, avatars numériques, agents avec recherche web, ASR, frontend Vue et backend FastAPI avec déploiement Docker-compose.
★ 3 764+1Évolution des étoiles sur les 7 derniers jours - #17
Maintenez une touche, parlez, relâchez : du texte optimisé par IA apparaît à votre curseur dans n'importe quelle application. Saisie vocale open-source pour macOS et Windows.
★ 3 403+44Évolution des étoiles sur les 7 derniers jours - #18
API de service web ASR pour OpenAI Whisper.
★ 3 328+2Évolution des étoiles sur les 7 derniers jours - #19
Exécutables autonomes pour Whisper et Faster-Whisper pour ceux qui ne souhaitent pas utiliser Python.
★ 3 171+2Évolution des étoiles sur les 7 derniers jours - #20
[AutoArk] GPA (General Purpose Audio) permet la reconnaissance vocale (ASR), la synthèse vocale (TTS) et la conversion de voix avec un seul modèle compact.
★ 3 061+164Évolution des étoiles sur les 7 derniers jours - #21
Interface graphique pour faster_whisper utilisant PySide6
★ 2 995+4Évolution des étoiles sur les 7 derniers jours - #22★ 2 864+0Évolution des étoiles sur les 7 derniers jours
- #23
Reconnaissance vocale automatique multilingue avec horodatages au niveau du mot et indices de confiance
★ 2 842+1Évolution des étoiles sur les 7 derniers jours - #24
Modèles audio CoreML de pointe dans vos applications : synthèse vocale, reconnaissance vocale, détection d'activité vocale et diarisation des locuteurs. En Swift, propulsé par des solutions open source SOTA.
★ 2 723+13Évolution des étoiles sur les 7 derniers jours - #25
🐸STT - La boîte à outils de deep learning pour la conversion parole-texte. L'entraînement et le déploiement de modèles STT n'ont jamais été aussi simples.
★ 2 606+1Évolution des étoiles sur les 7 derniers jours - #26
Extraction rapide de contenu audio et vidéo pour organiser des notes structurées en Markdown.
★ 2 483+7Évolution des étoiles sur les 7 derniers jours - #27
Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.
★ 2 214+115Évolution des étoiles sur les 7 derniers jours - #28
Modèles ASR open-source de qualité industrielle prenant en charge le mandarin, les dialectes chinois et l'anglais, atteignant un nouvel état de l'art sur les benchmarks ASR publics en mandarin, tout en offrant une capacité exceptionnelle de reconnaissance des paroles de chansons.
★ 1 975+2Évolution des étoiles sur les 7 derniers jours - #29
Inférence speech-to-text ggml pour plus de 16 familles de modèles
★ 1 872+19Évolution des étoiles sur les 7 derniers jours - #30
Framework IA+IoT de nouvelle génération pour T2/T3/T5AI/ESP32 et plus – Intégration matérielle rapide pour l'IoT et les agents IA
★ 1 816+5Évolution des étoiles sur les 7 derniers jours