Aller au contenu principal
buildradar
Sign in
Sujet · asr

asr

Dépôts open source suivis étiquetés asr, triés par étoiles.

Dépôts
86
Total d'étoiles
261 812
Étoiles en moyenne
3 044
Part
0,01%

Sujets qui apparaissent souvent aux côtés de asr sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés asr.

  • audio.cpp@0xShug0

    Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.

    2 214
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    327
  • whisperX@m-bain

    WhisperX : reconnaissance vocale automatique avec horodatage au niveau du mot et diarisation.

    23 864+61Évolution des étoiles sur les 7 derniers jours
  • FunASR@modelscope

    Boîte à outils de reconnaissance vocale open source pour l'entraînement, l'inférence, l'ASR en streaming, le VAD, la ponctuation, les pipelines de diarisation du locuteur et le service compatible OpenAI/MCP.

    20 136+64Évolution des étoiles sur les 7 derniers jours
  • Speech@NVIDIA-NeMo

    Framework d'IA générative évolutif conçu pour les chercheurs et développeurs travaillant sur les grands modèles de langage, le multimodal et l'IA vocale (ASR et TTS).

    18 379+21Évolution des étoiles sur les 7 derniers jours
  • vosk-api@alphacep

    API de reconnaissance vocale hors ligne pour Android, iOS, Raspberry Pi et serveurs avec Python, Java, C# et Node.

    15 101+17Évolution des étoiles sur les 7 derniers jours
  • sherpa-onnx@k2-fsa

    Transcription, synthèse vocale, diarisation, amélioration de la parole, séparation de sources et VAD utilisant la nouvelle génération de Kaldi avec onnxruntime, sans connexion Internet. Supporte les systèmes embarqués, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, NPU RK, NPU Axera, NPU Ascend, serveurs x86_64, client/serveur websocket, et 12 langages de programmation.

    14 575+95Évolution des étoiles sur les 7 derniers jours
  • PaddleSpeech@PaddlePaddle

    Boîte à outils vocale facile à utiliser incluant l'apprentissage auto-supervisé, la reconnaissance vocale (ASR) SOTA/en continu avec ponctuation, la synthèse vocale (TTS) en continu avec interface textuelle, un système de vérification du locuteur, la traduction vocale de bout en bout et la détection de mots-clés. Lauréat du prix Best Demo à NAACL2022.

    12 676+5Évolution des étoiles sur les 7 derniers jours
  • speechbrain@speechbrain

    Une boîte à outils pour la parole basée sur PyTorch.

    11 802+10Évolution des étoiles sur les 7 derniers jours
  • SenseVoice@QwenAudio

    Modèle open source SenseVoiceSmall pour la reconnaissance vocale (ASR) en mandarin, cantonais, anglais, japonais et coréen, incluant l'identification de la langue, la reconnaissance des émotions et la détection d'événements audio.

    9 209+37Évolution des étoiles sur les 7 derniers jours
  • API Python permettant d'obtenir la transcription ou les sous-titres d'une vidéo YouTube. Fonctionne également avec les sous-titres générés automatiquement et ne nécessite ni clé API ni navigateur headless, contrairement aux solutions basées sur Selenium.

    8 143+14Évolution des étoiles sur les 7 derniers jours
  • wukong-robot@wzpan

    wukong-robot est un robot de conversation vocale et une enceinte intelligente simple, flexible et élégante, prenant en charge les dialogues multi-tours ChatGPT et potentiellement la première interface cerveau-machine open source.

    7 126+2Évolution des étoiles sur les 7 derniers jours
  • FunClip@modelscope

    Outil de transcription vidéo, de génération de sous-titres et de découpage assisté par LLM basé sur FunASR, avec une interface Gradio locale.

    6 210+13Évolution des étoiles sur les 7 derniers jours
  • whisper-diarization@MahmoudAshraf97

    Reconnaissance vocale automatique avec diarisation des locuteurs basée sur OpenAI Whisper.

    5 634+1Évolution des étoiles sur les 7 derniers jours
  • Recorder@xiangyuecn

    Enregistrement audio HTML5 (mp3, wav, ogg, webm, amr, g711a, g711u). Supporte PC, navigateurs mobiles, applications hybrides et WeChat. Inclut la reconnaissance vocale ASR et des exemples de chat vocal.

    5 631+3Évolution des étoiles sur les 7 derniers jours
  • wenet@wenet-e2e

    Boîte à outils de reconnaissance vocale de bout en bout, prête pour la production

    5 229+1Évolution des étoiles sur les 7 derniers jours
  • LLPlayer@umlx5h

    Lecteur multimédia pour l'apprentissage des langues, avec sous-titres doubles, sous-titres générés par IA, traduction en temps réel, et plus encore.

    4 070+12Évolution des étoiles sur les 7 derniers jours
  • Streamer-Sales@PeterH0323

    Streamer-Sales 销冠 —— LLM pour le live shopping. Un modèle capable de présenter des produits en stimulant l'intention d'achat selon leurs caractéristiques. Inclut un processus de génération de données, l'accélération d'inférence avec LMDeploy, RAG, TTS, avatars numériques, agents avec recherche web, ASR, frontend Vue et backend FastAPI avec déploiement Docker-compose.

    3 764+1Évolution des étoiles sur les 7 derniers jours
  • openless@Open-Less

    Maintenez une touche, parlez, relâchez : du texte optimisé par IA apparaît à votre curseur dans n'importe quelle application. Saisie vocale open-source pour macOS et Windows.

    3 403+44Évolution des étoiles sur les 7 derniers jours
  • API de service web ASR pour OpenAI Whisper.

    3 328+2Évolution des étoiles sur les 7 derniers jours
  • Exécutables autonomes pour Whisper et Faster-Whisper pour ceux qui ne souhaitent pas utiliser Python.

    3 171+2Évolution des étoiles sur les 7 derniers jours
  • GPA@AutoArk

    [AutoArk] GPA (General Purpose Audio) permet la reconnaissance vocale (ASR), la synthèse vocale (TTS) et la conversion de voix avec un seul modèle compact.

    3 061+164Évolution des étoiles sur les 7 derniers jours
  • faster-whisper-GUI@CheshireCC

    Interface graphique pour faster_whisper utilisant PySide6

    2 995+4Évolution des étoiles sur les 7 derniers jours
  • lingvo@tensorflow

    Lingvo

    2 864+0Évolution des étoiles sur les 7 derniers jours
  • whisper-timestamped@linto-ai

    Reconnaissance vocale automatique multilingue avec horodatages au niveau du mot et indices de confiance

    2 842+1Évolution des étoiles sur les 7 derniers jours
  • FluidAudio@FluidInference

    Modèles audio CoreML de pointe dans vos applications : synthèse vocale, reconnaissance vocale, détection d'activité vocale et diarisation des locuteurs. En Swift, propulsé par des solutions open source SOTA.

    2 723+13Évolution des étoiles sur les 7 derniers jours
  • STT@coqui-ai

    🐸STT - La boîte à outils de deep learning pour la conversion parole-texte. L'entraînement et le déploiement de modèles STT n'ont jamais été aussi simples.

    2 606+1Évolution des étoiles sur les 7 derniers jours
  • AudioNotes@harry0703

    Extraction rapide de contenu audio et vidéo pour organiser des notes structurées en Markdown.

    2 483+7Évolution des étoiles sur les 7 derniers jours
  • audio.cpp@0xShug0

    Un moteur d'inférence tout-en-un en C++ pur pour les modèles audio, propulsé par ggml. Prend en charge TTS, STT, VAD, conversion vocale, génération musicale et plus encore, avec des performances hautement optimisées. Aucune dépendance Python.

    2 214+115Évolution des étoiles sur les 7 derniers jours
  • FireRedASR@FireRedTeam

    Modèles ASR open-source de qualité industrielle prenant en charge le mandarin, les dialectes chinois et l'anglais, atteignant un nouvel état de l'art sur les benchmarks ASR publics en mandarin, tout en offrant une capacité exceptionnelle de reconnaissance des paroles de chansons.

    1 975+2Évolution des étoiles sur les 7 derniers jours
  • transcribe.cpp@handy-computer

    Inférence speech-to-text ggml pour plus de 16 familles de modèles

    1 872+19Évolution des étoiles sur les 7 derniers jours
  • Framework IA+IoT de nouvelle génération pour T2/T3/T5AI/ESP32 et plus – Intégration matérielle rapide pour l'IoT et les agents IA

    1 816+5Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets