audio-generation
audio-generation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
audio-generation と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、audio-generation がタグ付けされたリポジトリ。
- #1
画像、動画、音声、テキスト、クレジット、モデル探索のための Flatkey メディア生成 CLI
★ 634
- #1★ 48,749+135直近 7 日のスター増減
- #2★ 23,067+215直近 7 日のスター増減
- #3
Amphion (/æmˈfaɪən/) は、オーディオ、音楽、音声生成のためのツールキットです。再現性のある研究をサポートし、若手研究者やエンジニアがオーディオ、音楽、音声生成の研究開発分野を始めやすくすることを目的としています。
★ 10,275+17直近 7 日のスター増減 - #4★ 6,457+229直近 7 日のスター増減
- #5★ 6,408+14直近 7 日のスター増減
- #6
ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T、Barkに対応した拡張機能付きの単一Gradio + React WebUI!
★ 3,245+5直近 7 日のスター増減 - #7★ 2,908+2直近 7 日のスター増減
- #8★ 2,639+1直近 7 日のスター増減
- #9
2023 年以降の音声生成向け最新 AI モデルのタイムライン!
★ 1,904+0直近 7 日のスター増減 - #10
Google DeepMind による効率的な並列音声生成モデル SoundStorm の PyTorch による実装
★ 1,547+1直近 7 日のスター増減 - #11
強力なChatterbox TTSモデルをセルフホストします。ユーザーフレンドリーなWeb UI、柔軟なAPIエンドポイント(OpenAI互換を含む)、プリセット音声、音声クローン、大規模なオーディオブック規模のテキスト処理を提供します。NVIDIA (CUDA)、AMD (ROCm)、CPUで高速実行可能です。
★ 1,426+12直近 7 日のスター増減 - #12★ 1,238+0直近 7 日のスター増減
- #13★ 1,226+0直近 7 日のスター増減
- #14
ローカルでのマルチエンジン・多言語の音声合成(TTS)および音声変換を行うためのComfyUIカスタムノード統合。RVC、Echo-TTS、Qwen3-TTS、Cozy Voice 3、Step Audio EditX、IndexTTS-2、Chatterbox(クラシックおよび多言語)、F5-TTS、Higgs Audio 2、3、VibeVoiceをサポートし、無制限のテキスト長、SRTタイミング、キャラクターサポート、および多数のオーディオツールを備えています。
★ 1,184+9直近 7 日のスター増減 - #15★ 1,043+1直近 7 日のスター増減
- #16
SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。
★ 978+70直近 7 日のスター増減 - #17
音声、音楽、効果音を含むAI音声データセット (AI-ADS) 🎵。生成AI、AIGC、AIモデルのトレーニング、インテリジェントな音声ツールの開発、音声アプリケーションにトレーニングデータを提供します。
★ 961+0直近 7 日のスター増減 - #18
音声 AI 研究のハブ: 音声 LLM、音声認識、TTS、音楽・音声生成に関する論文、オープンモデル、ベンチマーク、データセット。
★ 950+0直近 7 日のスター増減 - #19
リアルタイム音声アシスタント — WebRTC ストリーミング、faster-whisper ASR、ローカル LLM、Vui Nano (300M) TTS。OpenAI Realtime API 互換。音声クローン、発話割り込み (barge-in)、RTX 4090 で約 9 倍のリアルタイム処理。Apache 2.0 ライセンス。
★ 748+0直近 7 日のスター増減 - #20
画像、動画、音声、テキスト、クレジット、モデル探索のための Flatkey メディア生成 CLI
★ 634+89直近 7 日のスター増減 - #21
Genblaze は、動画、音声、画像プロバイダーにわたる生成 AI メディアパイプラインをオーケストレーションするためのオープンソースの Python SDK であり、すべての出力に対して出所の追跡機能が組み込まれています。
★ 559-1直近 7 日のスター増減 - #22
音声処理と生成を統合するオープンソースプロジェクト
★ 510+3直近 7 日のスター増減