text-to-audio
Dépôts open source suivis étiquetés text-to-audio, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de text-to-audio sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés text-to-audio.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Amphion est une boîte à outils pour la génération audio, musicale et vocale. Son objectif est de soutenir la recherche reproductible et d'aider les chercheurs et ingénieurs débutants à se lancer dans la recherche et le développement liés à la génération audio, musicale et vocale.
★ 10 276+1Évolution des étoiles sur les 7 derniers jours - #2
Générer des livres audio à partir d'EPUB, PDF et texte avec des sous-titres synchronisés.
★ 5 831+45Évolution des étoiles sur les 7 derniers jours - #3
[CVPR 2025] MMAudio : Maîtriser l'entraînement multimodal conjoint pour la synthèse vidéo-audio de haute qualité.
★ 2 264+0Évolution des étoiles sur les 7 derniers jours - #4
[NeurIPS 2025] Implémentation PyTorch de [ThinkSound], un framework unifié pour générer de l'audio à partir de n'importe quelle modalité, guidé par le raisonnement Chain-of-Thought (CoT).
★ 1 378+0Évolution des étoiles sur les 7 derniers jours - #5
StreamSpeech est un modèle tout-en-un fluide pour la reconnaissance vocale, la traduction et la synthèse vocale, en mode hors ligne et simultané.
★ 1 288+0Évolution des étoiles sur les 7 derniers jours - #6
Une interface web pour différents réseaux de neurones liés à l'audio
★ 1 246+0Évolution des étoiles sur les 7 derniers jours - #7★ 1 238-1Évolution des étoiles sur les 7 derniers jours
- #8
HunyuanVideo-Foley : diffusion multimodale avec alignement de représentation pour la génération audio Foley haute fidélité.
★ 1 056+4Évolution des étoiles sur les 7 derniers jours - #9
[ICLR 2026] TangoFlux : génération texte-vers-audio ultra-rapide et fidèle basée sur le Flow Matching.
★ 882+0Évolution des étoiles sur les 7 derniers jours - #10
Implémentation PyTorch de Make-An-Audio (ICML'23) avec un modèle génératif texte‑à‑audio
★ 668+0Évolution des étoiles sur les 7 derniers jours - #11★ 631+1Évolution des étoiles sur les 7 derniers jours
- #12
Une liste organisée d'articles sur la génération multimodale basée sur les LLM (image, vidéo, 3D et audio).
★ 552+0Évolution des étoiles sur les 7 derniers jours - #13
Un projet open source pour unifier le traitement et la génération audio
★ 512+3Évolution des étoiles sur les 7 derniers jours