メインコンテンツへスキップ
buildradar
Sign in
トピック · audio-generation

audio-generation

audio-generation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
22
総スター数
118,649
平均スター数
5,393
シェア
0.01%

audio-generation と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、audio-generation がタグ付けされたリポジトリ。

  • flatkey-cli@flatkey-ai

    画像、動画、音声、テキスト、クレジット、モデル探索のための Flatkey メディア生成 CLI

    634
  • LocalAI@mudler

    LocalAIはオープンソースのAIエンジン。あらゆるハードウェアで、LLMs、ビジョン、音声、画像、動画など、あらゆるモデルを実行可能。GPUは不要。

    48,749+135直近 7 日のスター増減
  • CosyVoice@QwenAudio

    推論、学習、デプロイのフルスタック機能を備えた多言語大規模音声生成モデル

    23,067+215直近 7 日のスター増減
  • Amphion@open-mmlab

    Amphion (/æmˈfaɪən/) は、オーディオ、音楽、音声生成のためのツールキットです。再現性のある研究をサポートし、若手研究者やエンジニアがオーディオ、音楽、音声生成の研究開発分野を始めやすくすることを目的としています。

    10,275+17直近 7 日のスター増減
  • vllm-omni@vllm-project

    マルチモーダルモデルを用いた効率的なモデル推論のためのフレームワーク。

    6,457+229直近 7 日のスター増減
  • YuE@multimodal-art-projection

    YuE: Suno.aiに似たオープンなフルソング音楽生成基盤モデル

    6,408+14直近 7 日のスター増減
  • TTS-WebUI@rsxdalv

    ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T、Barkに対応した拡張機能付きの単一Gradio + React WebUI!

    3,245+5直近 7 日のスター増減
  • AudioLDM@haoheliu

    AudioLDM: テキストから音声、効果音、音楽などを生成

    2,908+2直近 7 日のスター増減
  • AudioLDM2@haoheliu

    テキストからの音声・音楽生成

    2,639+1直近 7 日のスター増減
  • 2023 年以降の音声生成向け最新 AI モデルのタイムライン!

    1,904+0直近 7 日のスター増減
  • soundstorm-pytorch@lucidrains

    Google DeepMind による効率的な並列音声生成モデル SoundStorm の PyTorch による実装

    1,547+1直近 7 日のスター増減
  • 強力なChatterbox TTSモデルをセルフホストします。ユーザーフレンドリーなWeb UI、柔軟なAPIエンドポイント(OpenAI互換を含む)、プリセット音声、音声クローン、大規模なオーディオブック規模のテキスト処理を提供します。NVIDIA (CUDA)、AMD (ROCm)、CPUで高速実行可能です。

    1,426+12直近 7 日のスター増減
  • tango@declare-lab

    テキストからオーディオを生成する拡散モデルのファミリ。

    1,238+0直近 7 日のスター増減
  • BigVGAN@NVIDIA

    BigVGAN の公式 PyTorch 実装 (ICLR 2023)

    1,226+0直近 7 日のスター増減
  • TTS-Audio-Suite@diodiogod

    ローカルでのマルチエンジン・多言語の音声合成(TTS)および音声変換を行うためのComfyUIカスタムノード統合。RVC、Echo-TTS、Qwen3-TTS、Cozy Voice 3、Step Audio EditX、IndexTTS-2、Chatterbox(クラシックおよび多言語)、F5-TTS、Higgs Audio 2、3、VibeVoiceをサポートし、無制限のテキスト長、SRTタイミング、キャラクターサポート、および多数のオーディオツールを備えています。

    1,184+9直近 7 日のスター増減
  • muapi-cli@SamurAIGPT

    muapi.ai の公式 CLI — ターミナルから画像、動画、音声を生成。MCP サーバー、14の AI モデル、npm と pip でインストール可能。

    1,043+1直近 7 日のスター増減
  • sglang-omni@sgl-project

    SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。

    978+70直近 7 日のスター増減
  • 音声、音楽、効果音を含むAI音声データセット (AI-ADS) 🎵。生成AI、AIGC、AIモデルのトレーニング、インテリジェントな音声ツールの開発、音声アプリケーションにトレーニングデータを提供します。

    961+0直近 7 日のスター増減
  • audio-ai-hub@BinWang28

    音声 AI 研究のハブ: 音声 LLM、音声認識、TTS、音楽・音声生成に関する論文、オープンモデル、ベンチマーク、データセット。

    950+0直近 7 日のスター増減
  • vui@fluxions-ai

    リアルタイム音声アシスタント — WebRTC ストリーミング、faster-whisper ASR、ローカル LLM、Vui Nano (300M) TTS。OpenAI Realtime API 互換。音声クローン、発話割り込み (barge-in)、RTX 4090 で約 9 倍のリアルタイム処理。Apache 2.0 ライセンス。

    748+0直近 7 日のスター増減
  • flatkey-cli@flatkey-ai

    画像、動画、音声、テキスト、クレジット、モデル探索のための Flatkey メディア生成 CLI

    634+89直近 7 日のスター増減
  • genblaze@backblaze-labs

    Genblaze は、動画、音声、画像プロバイダーにわたる生成 AI メディアパイプラインをオーケストレーションするためのオープンソースの Python SDK であり、すべての出力に対して出所の追跡機能が組み込まれています。

    559-1直近 7 日のスター増減
  • unified-audio@alibaba

    音声処理と生成を統合するオープンソースプロジェクト

    510+3直近 7 日のスター増減
← トピック一覧に戻る