Aller au contenu principal
buildradar
Sign in
Sujet · speech

speech

Dépôts open source suivis étiquetés speech, triés par étoiles.

74 dépôts
  • MARS5-TTS@Camb-ai

    Modèle de synthèse vocale (TTS) MARS5 de CAMB.AI.

    2 818+1Évolution des étoiles sur les 7 derniers jours
  • speechgpt@hahahumble

    SpeechGPT est une application web permettant de converser avec ChatGPT.

    2 750-1Évolution des étoiles sur les 7 derniers jours
  • gTTS@pndurette

    Bibliothèque Python et outil CLI pour interagir avec l'API de synthèse vocale de Google Translate.

    2 628+0Évolution des étoiles sur les 7 derniers jours
  • ten-vad@TEN-framework

    Détecteur d'activité vocale (VAD) : faible latence, haute performance et léger.

    2 256+7Évolution des étoiles sur les 7 derniers jours
  • IMS-Toucan@DigitalPhonetics

    Synthèse vocale rapide et contrôlable pour plus de 7000 langues.

    2 207-1Évolution des étoiles sur les 7 derniers jours
  • soloud@jarikomppa

    Moteur audio gratuit, simple et portable pour les jeux.

    2 170+3Évolution des étoiles sur les 7 derniers jours
  • openai-edge-tts@travisvn

    Point de terminaison d'API de synthèse vocale gratuit et de haute qualité pour remplacer OpenAI, Azure ou ElevenLabs.

    2 075+5Évolution des étoiles sur les 7 derniers jours
  • Praat : faire de la phonétique par ordinateur

    1 970+1Évolution des étoiles sur les 7 derniers jours
  • julius@julius-speech

    Moteur de reconnaissance vocale continue à large vocabulaire open source.

    1 935+1Évolution des étoiles sur les 7 derniers jours
  • Liste communautaire de startups travaillant sur l'IA dans la technologie audio et musicale

    1 769+1Évolution des étoiles sur les 7 derniers jours
  • SALMONN@bytedance

    Famille SALMONN : une suite de LLM multimodaux avancés.

    1 521+3Évolution des étoiles sur les 7 derniers jours
  • voicefixer@haoheliu

    Restauration de parole générale

    1 375+0Évolution des étoiles sur les 7 derniers jours
  • CrisperWhisper@nyrahealth

    Transcription contrôlable. Verbatim (chaque mot, remplissage, pause, bégaiement, son vocal) ou intentionnelle (ce que l'orateur voulait dire, optimisé pour la lisibilité) avec horodatage au niveau du mot.

    1 371+13Évolution des étoiles sur les 7 derniers jours
  • nlp-paper@DengBoCong

    Articles de recherche en traitement du langage naturel (avec notes de lecture), implémentations de modèles et traitement de données (code disponible en TensorFlow et PyTorch)

    1 333+1Évolution des étoiles sur les 7 derniers jours
  • MTools@HG-ha

    MTools est une application de bureau polyvalente intégrant le traitement audio/vidéo, l'édition d'images, la manipulation de texte et des outils de codage, avec des fonctionnalités d'IA intégrées pour simplifier votre flux de travail et améliorer votre productivité.

    1 305+5Évolution des étoiles sur les 7 derniers jours
  • StreamSpeech@ictnlp

    StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.

    1 288+0Évolution des étoiles sur les 7 derniers jours
  • Deep-Learning-Experiments@roatienza

    Vidéos, notes et expériences pour comprendre l'apprentissage profond

    1 198+0Évolution des étoiles sur les 7 derniers jours
  • lhotse@lhotse-speech

    Outils pour manipuler des données multimodales dans des projets d'apprentissage automatique

    1 149-1Évolution des étoiles sur les 7 derniers jours
  • conformer@sooftware

    [Non officiel] Implémentation PyTorch de "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020).

    1 132+1Évolution des étoiles sur les 7 derniers jours
  • pykaldi@pykaldi

    Un wrapper Python pour Kaldi

    1 040+1Évolution des étoiles sur les 7 derniers jours
  • FireRedTTS@FireRedTeam

    Un système de synthèse vocale (TTS) open source basé sur des LLM.

    920+1Évolution des étoiles sur les 7 derniers jours
  • inaSpeechSegmenter@ina-foss

    Boîte à outils de segmentation audio basée sur les CNN. Permet de détecter la parole, la musique, le bruit et le genre du locuteur. Conçue pour des études à grande échelle sur l'égalité des genres basées sur le temps de parole par genre.

    910+1Évolution des étoiles sur les 7 derniers jours
  • diffwave@lmnt-com

    DiffWave est un vocodeur neuronal et un synthétiseur de forme d'onde rapide et de haute qualité.

    885+0Évolution des étoiles sur les 7 derniers jours
  • AnyGPT@OpenMOSS

    Code pour "AnyGPT : LLM multimodal unifié avec modélisation de séquence discrète"

    881-1Évolution des étoiles sur les 7 derniers jours
  • PPASR@yeyupiaoling

    Reconnaissance vocale chinoise de bout en bout basée sur PaddlePaddle, de l'initiation à la pratique, avec des cas d'étude simples et des projets d'entreprise concrets. Prend en charge les modèles DeepSpeech2, Conformer et Squeezeformer les plus populaires.

    870-1Évolution des étoiles sur les 7 derniers jours
  • Voxtral ASR & TTS fonctionnant nativement et dans le navigateur. Une implémentation en Rust du modèle Voxtral mini de Mistral pour l'ASR/TTS en temps réel, utilisant le framework Burn ML.

    819+2Évolution des étoiles sur les 7 derniers jours
  • AlphaAvatar@AlphaAvatar

    Un avatar omni interactif en temps réel basé sur LiveKit, permettant une intégration transparente avec tout composant d'avatar open source (modèle temps réel, visuel, voix, mémoire, recherche, etc.).

    813+4Évolution des étoiles sur les 7 derniers jours
  • XR3Player@goxr3plus

    Le lecteur multimédia JavaFX le plus avancé

    771+0Évolution des étoiles sur les 7 derniers jours
  • cboard@cboard-org

    Système de communication améliorée et alternative (CAA) avec synthèse vocale pour le navigateur

    755+9Évolution des étoiles sur les 7 derniers jours
  • allosaurus@xinjli

    Allosaurus est un reconnaisseur de phonèmes universel pré-entraîné pour plus de 2000 langues.

    746+4Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets