speech
speech がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #31★ 2,818+1直近 7 日のスター増減
- #32★ 2,750-1直近 7 日のスター増減
- #33★ 2,628+0直近 7 日のスター増減
- #34★ 2,256+7直近 7 日のスター増減
- #35
7,000以上の言語に対応する、制御可能で高速なテキスト読み上げ(TTS)!
★ 2,207-1直近 7 日のスター増減 - #36★ 2,170+3直近 7 日のスター増減
- #37
OpenAI、Azure、ElevenLabs の代替となる、無料かつ高品質なテキスト読み上げ(TTS)API エンドポイント
★ 2,075+5直近 7 日のスター増減 - #38
Praat:コンピュータによる音声学の分析ツール
★ 1,970+1直近 7 日のスター増減 - #39★ 1,935+1直近 7 日のスター増減
- #40
音声および音楽技術分野のAIを活用するスタートアップ企業のコミュニティリスト
★ 1,769+1直近 7 日のスター増減 - #41★ 1,521+3直近 7 日のスター増減
- #42
汎用音声修復
★ 1,375+0直近 7 日のスター増減 - #43
制御可能な文字起こし。単語単位のタイムスタンプ付きで、逐語的(フィラー、ポーズ、言い淀み、発声を含む)または意図通り(話し手の意図を反映し、読みやすさを最適化)の出力が可能
★ 1,371+13直近 7 日のスター増減 - #44★ 1,333+1直近 7 日のスター増減
- #45
MToolsは、音声・動画処理、画像編集、テキスト操作、コーディングツールを統合し、AI拡張機能を内蔵した強力な多機能デスクトップアプリケーションです。ワークフローの簡素化と生産性の向上のために設計されています
★ 1,305+5直近 7 日のスター増減 - #46
StreamSpeech は、オフラインおよび同時音声認識、音声翻訳、音声合成のための「オールインワン」シームレスモデルです。
★ 1,288+0直近 7 日のスター増減 - #47
ディープラーニングを理解するための動画、ノート、実験
★ 1,198+0直近 7 日のスター増減 - #48★ 1,149-1直近 7 日のスター増減
- #49
[非公式] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) の PyTorch 実装
★ 1,132+1直近 7 日のスター増減 - #50★ 1,040+1直近 7 日のスター増減
- #51
オープンソースのLLMを活用した基盤TTSシステム
★ 921+2直近 7 日のスター増減 - #52
CNNベースの音声セグメンテーションツールキット。音声、音楽、ノイズ、話者の性別の検出が可能。性別ごとの発話時間に基づく大規模な男女平等調査向けに設計されています。
★ 910+1直近 7 日のスター増減 - #53★ 885+0直近 7 日のスター増減
- #54★ 882+0直近 7 日のスター増減
- #55
PaddlePaddleに基づくエンドツーエンドの中国語音声認識。入門から実践まで、非常にシンプルな入門ケースと実用的なエンタープライズプロジェクト。現在最も人気のDeepSpeech2、Conformer、Squeezeformerモデルをサポート
★ 870-1直近 7 日のスター増減 - #56
Voxtral ASR と TTS をネイティブおよびブラウザ上で実行。Burn ML フレームワークを使用した Mistral の Voxtral mini リアルタイム ASR / TTS の Rust 実装
★ 819+2直近 7 日のスター増減 - #57
LiveKit上に構築されたリアルタイム対話型Omni Avatar。オープンソースのAvatarコンポーネント(リアルタイムモデル、ビジュアル、音声、メモリ、検索など)とシームレスに統合可能。
★ 813+4直近 7 日のスター増減 - #58★ 771+0直近 7 日のスター増減
- #59★ 750+4直近 7 日のスター増減
- #60
Allosaurusは、2000以上の言語に対応する事前トレーニング済み汎用音声認識エンジンです
★ 745+3直近 7 日のスター増減