text-to-speech
text-to-speech がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
text-to-speech と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、text-to-speech がタグ付けされたリポジトリ。
- #1
エージェントの対話、作業、存在感を維持するリアルタイム音声ランタイム。AI エージェント向けのリアルタイム音声ランタイム
★ 2,362 - #2
ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。
★ 2,214 - #3
クリエイターとAIエージェントが同じリアルタイムラインを共同編集できる、オープンソースでローカルファーストな動画エディタ
★ 788 - #4
ROOT権限不要のオープンソースAndroid画面リアルタイム翻訳ツール。ゲーム、ビジュアルノベル、マンガに最適です。オンデバイスおよびクラウドOCR、オフラインLLM、多様な翻訳サービス、音声読み上げ(TTS)をサポートし、画面上に直接翻訳を表示できます。
★ 768 - #5
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541
- #1
AI大規模言語モデルと自動化ワークフローを活用し、トピックやキーワードからワンクリックでHDショート動画を生成。
★ 119,977+1,509直近 7 日のスター増減 - #2
Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUXなどを含むLLMおよび拡散モデルを実行・学習するためのローカルUI。
★ 75,515+337直近 7 日のスター増減 - #3
1分の音声データでも優れたTTSモデルのトレーニングに使用可能!(Few-shotボイスクローニング)
★ 61,476+138直近 7 日のスター増減 - #4
世界初のオープンソースのエージェンティック動画制作システム。12のプロダクションパイプライン、100以上のツール、700以上のエージェントスキルおよびプロダクション知識ファイル。AIコーディングアシスタントを完全な動画制作スタジオに変える。
★ 55,719+1,707直近 7 日のスター増減 - #5★ 45,985+18直近 7 日のスター増減
- #6★ 39,814+9直近 7 日のスター増減
- #7★ 37,419+61直近 7 日のスター増減
- #8
🚀5秒でボイスをクローンし、任意の音声をリアルタイムで生成。
★ 36,912+0直近 7 日のスター増減 - #9★ 36,595+345直近 7 日のスター増減
- #10★ 23,686+109直近 7 日のスター増減
- #11★ 23,426+359直近 7 日のスター増減
- #12★ 19,387+2直近 7 日のスター増減
- #13
動画をある言語から別の言語に翻訳し、ダビングと字幕を埋め込む。
★ 18,871+38直近 7 日のスター増減 - #14★ 17,476+1直近 7 日のスター増減
- #15
VoiceStudioは、完全にローカルで動作するオープンソースのElevenLabs代替ツールです。646言語で音声クローニング、音声デザイン、ビデオダビング、ディクテーション、文字起こし、オーディオブック作成に対応しています。
★ 14,835+2,880直近 7 日のスター増減 - #16
インターネット接続なしで、次世代Kaldiとonnxruntimeを使用した音声認識(Speech-to-text)、テキスト読み上げ(text-to-speech)、話者ダイアライゼーション、音声強調、ソース分離、VADを提供。組み込みシステム、Android、iOS、HarmonyOS、Raspberry Pi、RISC-V、RK NPU、Axera NPU、Ascend NPU、x86_64サーバー、websocketサーバー/クライアントをサポートし、12のプログラミング言語に対応。
★ 14,575+95直近 7 日のスター増減 - #17
超高速、オンデバイス、多言語対応のTTS — ONNX経由でネイティブ実行。
★ 13,757+20直近 7 日のスター増減 - #18
クリエイターと開発者のためのGradio WebUI。主要なTTS (Edge-TTS, kokoro) およびゼロショット音声クローニング (E2 & F5-TTS, CosyVoice) を特徴とし、Whisperオーディオ処理、YouTubeダウンロード、Demucsによるボーカル分離、多言語翻訳に対応。
★ 12,730+54直近 7 日のスター増減 - #19★ 11,847+29直近 7 日のスター増減
- #20
Amphion (/æmˈfaɪən/) は、オーディオ、音楽、音声生成のためのツールキットです。再現性のある研究をサポートし、若手研究者やエンジニアがオーディオ、音楽、音声生成の研究開発分野を始めやすくすることを目的としています。
★ 10,276+1直近 7 日のスター増減 - #21★ 9,949+3直近 7 日のスター増減
- #22
EmotiVoice 😊: マルチボイスおよびプロンプト制御型TTSエンジン
★ 8,522-1直近 7 日のスター増減 - #23
AppleのMLXフレームワーク上に構築された、テキスト読み上げ (TTS)、音声認識 (STT)、音声合成 (STS) のライブラリ。Apple Silicon上での効率的な音声分析を提供。
★ 7,826+23直近 7 日のスター増減 - #24
MyShell.aiによる高品質な多言語テキスト読み上げ(Text-to-Speech)ライブラリ。English、Spanish、French、Chinese、Japanese、Koreanに対応。
★ 7,616+7直近 7 日のスター増減 - #25★ 6,802+13直近 7 日のスター増減
- #26
Apple Silicon向けオンデバイス音声AI
★ 6,353+8直近 7 日のスター増減 - #27★ 6,342+3直近 7 日のスター増減
- #28
このリポジトリには、Generative Pre-trained Transformer (GPT)、ChatGPT、PaLMなどに焦点を当てた、手作業で厳選されたプロンプトエンジニアリングのリソースが含まれています。
★ 6,306+7直近 7 日のスター増減 - #29
Silero Models: 驚くほどシンプルな事前学習済みテキスト読み上げモデル
★ 6,084-1直近 7 日のスター増減 - #30★ 5,931+1,108直近 7 日のスター増減