text-to-speech
text-to-speech がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #31★ 5,831+0直近 7 日のスター増減
- #32
オープンソースの音声AIプラットフォーム。VapiやRetellのセルフホスト型代替品。Speech to SpeechまたはLLM/STT/TTSに対応したオンプレミス、BYOK環境。ビジュアルワークフロービルダー、MCPネイティブ、テレフォニーサポート付き。
★ 5,568+0直近 7 日のスター増減 - #33
オープンソースのAI動画ローカライゼーションツール:YouTube/Bilibili動画のダウンロード、字幕認識と翻訳、音声クローン吹き替え、音源ミキシング、字幕エンコードを自動実行。
★ 5,404+0直近 7 日のスター増減 - #34
Kokoro-82M テキスト読み上げのための Docker化された OpenAI互換ラッパー(マルチプラットフォーム対応の CPU、AMD、NVIDIA GPU PyTorchを使用;マルチスピーカー、ボイスミキシング、自動ステッチング、キャプションタイムスタンプ、SSML、リードアロングWeb UI付き)
★ 5,399+0直近 7 日のスター増減 - #35
DiffSinger: シャロー拡散メカニズムによる歌声合成 (SVS & TTS); AAAI 2022; 公式コード
★ 4,855+0直近 7 日のスター増減 - #36★ 4,624+0直近 7 日のスター増減
- #37
OpenAIのWhisperのほぼライブ実装。
★ 4,246+0直近 7 日のスター増減 - #38
人間的で表現力豊かなTTSのための基盤モデル。
★ 4,203+0直近 7 日のスター増減 - #39
MOSS‑TTSファミリーは、MOSI.AIとOpenMOSSチームによるオープンソースの音声・音響生成モデルファミリーです。高忠実度、高表現力、複雑な実世界シナリオ向けに設計されており、安定した長尺音声、マルチスピーカー対話、ボイス/キャラクターデザイン、環境音エフェクト、リアルタイムストリーミングTTSを網羅しています。
★ 4,058+0直近 7 日のスター増減 - #40
テキストをリアルタイムで音声に変換
★ 4,021+0直近 7 日のスター増減 - #41
:stuck_out_tongue_closed_eyes: TensorFlowTTS: TensorFlow 2向けのリアルタイム最先端音声合成(英語、フランス語、韓国語、中国語、ドイツ語に対応しており、他の言語への適応が容易)
★ 3,996+0直近 7 日のスター増減 - #42★ 3,674+0直近 7 日のスター増減
- #43
ACE-Step、OmniVoice、Kimi Audio、Piper TTS、GPT-SoVITS、CosyVoice、XTTSv2、DIA、Kokoro、OpenVoice、ParlerTTS、Stable Audio、MMS、StyleTTS2、MAGNet、AudioGen、MusicGen、Tortoise、RVC、Vocos、Demucs、SeamlessM4T、Barkに対応した拡張機能付きの単一Gradio + React WebUI!
★ 3,250+0直近 7 日のスター増減 - #44
ElevenLabs API の公式 Python SDK
★ 3,083+0直近 7 日のスター増減 - #45★ 3,061+0直近 7 日のスター増減
- #46★ 2,862+0直近 7 日のスター増減
- #47★ 2,818+0直近 7 日のスター増減
- #48★ 2,628+0直近 7 日のスター増減
- #49
🚀 ワンクリックデプロイ(オフライン統合パッケージを含む)!ChatTTS をベースにし、ストリーミング出力、音声ガチャ、長文音声生成、およびロール別朗読をサポート。シンプルで使いやすく、複雑なインストールは不要。
★ 2,593+0直近 7 日のスター増減 - #50★ 2,583+0直近 7 日のスター増減
- #51★ 2,530+0直近 7 日のスター増減
- #52
インスタント音声クローンを備えたベトナム語TTS • オンデバイス • リアルタイムCPU推論 • 24kHz音声品質 • ベトナム語音声合成
★ 2,468+0直近 7 日のスター増減 - #53
エージェントの対話、作業、存在感を維持するリアルタイム音声ランタイム。AI エージェント向けのリアルタイム音声ランタイム
★ 2,379+58直近 7 日のスター増減 - #54★ 2,367+0直近 7 日のスター増減
- #55★ 2,215+0直近 7 日のスター増減
- #56
ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。
★ 2,214+0直近 7 日のスター増減 - #57
7,000以上の言語に対応する、制御可能で高速なテキスト読み上げ(TTS)!
★ 2,207+0直近 7 日のスター増減 - #58
OpenAI、Azure、ElevenLabs の代替となる、無料かつ高品質なテキスト読み上げ(TTS)API エンドポイント
★ 2,075+0直近 7 日のスター増減 - #59★ 2,048+0直近 7 日のスター増減
- #60
Claude Code向けのAIネイティブな動画制作ツールキット
★ 2,036+0直近 7 日のスター増減