speech-to-text
speech-to-text がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #31
オープンソースの音声AIプラットフォーム。VapiやRetellのセルフホスト型代替品。Speech to SpeechまたはLLM/STT/TTSに対応したオンプレミス、BYOK環境。ビジュアルワークフロービルダー、MCPネイティブ、テレフォニーサポート付き。
★ 5,568+0直近 7 日のスター増減 - #32
オープンソースのAI動画ローカライゼーションツール:YouTube/Bilibili動画のダウンロード、字幕認識と翻訳、音声クローン吹き替え、音源ミキシング、字幕エンコードを自動実行。
★ 5,404+0直近 7 日のスター増減 - #33★ 4,780+0直近 7 日のスター増減
- #34
TPU上で最大70倍の高速化を実現する、OpenAIのWhisperモデルのJAX実装
★ 4,679+0直近 7 日のスター増減 - #35★ 4,624+0直近 7 日のスター増減
- #36★ 4,122+0直近 7 日のスター増減
- #37
Windows LiveCaptions をベースにした、軽量かつ強力なリアルタイム音声・スピーチ翻訳ツール
★ 3,637+0直近 7 日のスター増減 - #38★ 3,403+0直近 7 日のスター増減
- #39
OpenAI Whisper ASR Web サービス API
★ 3,328+0直近 7 日のスター増減 - #40
Python の導入を避けたい人のための Whisper および Faster-Whisper のスタンドアロン実行ファイル
★ 3,171+0直近 7 日のスター増減 - #41
LLaMA-Omni は、Llama-3.1-8B-Instruct を基に構築された低レイテンシかつ高品質なエンドツーエンドの音声インタラクションモデルで、GPT-4o レベルの音声機能の実現を目指しています。
★ 3,147+0直近 7 日のスター増減 - #42★ 3,101+0直近 7 日のスター増減
- #43★ 3,068+0直近 7 日のスター増減
- #44★ 2,864+0直近 7 日のスター増減
- #45
単語レベルのタイムスタンプと信頼度を備えた多言語自動音声認識
★ 2,842+0直近 7 日のスター増減 - #46
Google Meet、Microsoft Teams、Zoom向けのオープンソースの会議文字起こしAPI。ボットの自動参加、リアルタイムWebSocket文字起こし、AIエージェント向けMCPサーバーを搭載。セルフホストまたはSaaSを利用可能。
★ 2,741+0直近 7 日のスター増減 - #47
アプリ内で最先端の CoreML 音声モデルを利用可能に — テキスト読み上げ、音声認識、音声区間検出、話者ダイアライゼーション。Swift 製、SOTA のオープンソースを活用。
★ 2,723+0直近 7 日のスター増減 - #48
Cluely のオープンソース代替品 - 会議、面接、会話中に誰にも気づかれることなくシームレスに動作する、超高速でプライバシーファーストな AI アシスタント。Tauri製でネイティブのパフォーマンスを実現し、わずか 10MB。ビデオ通話、画面共有、録画でも完全に検出されません。
★ 2,619+0直近 7 日のスター増減 - #49★ 2,606+0直近 7 日のスター増減
- #50★ 2,537+0直近 7 日のスター増減
- #51
🔊 OpenAI が開発したオープンソースの AI 音声認識システム Whisper に関する素晴らしいリソースのまとめ
★ 2,375+0直近 7 日のスター増減 - #52
画面を録画してデモを公開。無料かつオープンソース、GPU アクセラレーション対応、ウォーターマークなし、サブスクリプションなし。Windows、macos、Linux に対応。アクティブにメンテナンス中。
★ 2,287+0直近 7 日のスター増減 - #53★ 2,278+0直近 7 日のスター増減
- #54
ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。
★ 2,214+0直近 7 日のスター増減 - #55
ASR/STT字幕ジェネレーター。Qwen3-ASR、ローカルLLM、Whisper、TEN-VADを使用。JAV向けにノイズ耐性を強化。
★ 2,196+0直近 7 日のスター増減 - #56
🎙 tensorflowディープラーニングフレームワークと、sequence-to-sequenceニューラルネットワークを使用した音声認識
★ 2,173+0直近 7 日のスター増減 - #57★ 2,170+0直近 7 日のスター増減
- #58★ 2,046+0直近 7 日のスター増減
- #59★ 1,892+0直近 7 日のスター増減
- #60
16以上のモデルファミリーに対応したggml音声認識(speech-to-text)推論
★ 1,872+0直近 7 日のスター増減