speech-recognition
speech-recognition がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #91
音声 AI 研究のハブ: 音声 LLM、音声認識、TTS、音楽・音声生成に関する論文、オープンモデル、ベンチマーク、データセット。
★ 953+3直近 7 日のスター増減 - #92
LLM による要約を備えた、すぐに使えるセルフホスト型オフライン文字起こしおよび話者分離サービス
★ 948+2直近 7 日のスター増減 - #93
Whisper.net。Whisperモデルを使用して音声認識をシンプルに実現
★ 941+1直近 7 日のスター増減 - #94★ 939+0直近 7 日のスター増減
- #95
システムレベルのコマンド実行、音声認識とテキスト読み上げの統合、非同期ユーザーインタラクションの処理が可能な、Pythonベースのデスクトップ音声アシスタント。
★ 919+13直近 7 日のスター増減 - #96
ストリーミングおよびオンデバイス利用向けに最適化されたWhisperモデル
★ 897+0直近 7 日のスター増減 - #97
インターネットを必要とせず、自分のコンピュータ上で動作する音声対話型LLM
★ 891+2直近 7 日のスター増減 - #98
:speech_balloon: SpeechPy - 音声処理および認識のためのライブラリ: http://speechpy.readthedocs.io/en/latest/
★ 883+0直近 7 日のスター増減 - #99
PaddlePaddleに基づくエンドツーエンドの中国語音声認識。入門から実践まで、非常にシンプルな入門ケースと実用的なエンタープライズプロジェクト。現在最も人気のDeepSpeech2、Conformer、Squeezeformerモデルをサポート
★ 870-1直近 7 日のスター増減 - #100
💬 Reactアプリ向けの音声認識
★ 842+1直近 7 日のスター増減 - #101
コネクショニスト時系列分類 (CTC) デコーディングアルゴリズム:ベストパス、ビームサーチ、辞書サーチ、プレフィックスサーチ、トークンパッシング。Python で実装されています。
★ 836-1直近 7 日のスター増減 - #102
OpenAI の Whisper を使用したリアルタイム speech2text Web アプリの構築 (https://openai.com/blog/whisper/)
★ 835+0直近 7 日のスター増減 - #103★ 823-1直近 7 日のスター増減
- #104★ 805+1直近 7 日のスター増減
- #105
Linux向けの無料、オープンソース、完全オフラインの音声ディクテーション。whisper.cpp、Whisper、VOSKエンジンを使用し、どこでも音声入力が可能。GPUアクセラレーション対応、X11およびWaylandで動作!
★ 802+17直近 7 日のスター増減 - #106
音声からテキスト、そして音声へ。現在再生中の楽曲。テキストをOSCメッセージとしてVRChatに送信し、アバター上に表示します。(STTTS) (Speech to TTS) (VRC STTシステム) (VTuber TTS)
★ 802+3直近 7 日のスター増減 - #107
whisper.cpp の React Native バインディング
★ 800-1直近 7 日のスター増減 - #108
OpenAI whisper でマイクを使用できるようにするプロジェクト
★ 787+0直近 7 日のスター増減 - #109★ 787+0直近 7 日のスター増減
- #110
🎤 Swift で最も簡単にオーディオを文字起こしする方法
★ 785-1直近 7 日のスター増減 - #111★ 783+14直近 7 日のスター増減
- #112
100% プライベートな AI 音声文字起こしアプリ。Whisper AI を使用し、Android と iOS 向けに Compose Multiplatform で構築されており、クラウドへのアップロードなしでデバイス上で処理が完結します。
★ 777+1直近 7 日のスター増減 - #113★ 766+0直近 7 日のスター増減
- #114★ 763+1直近 7 日のスター増減
- #115
PaddlePaddle をベースに実装された音声認識、中国語音声認識。プロジェクトは充実しており、認識精度も良好。Windows および Linux でのトレーニングと予測をサポートし、Nvidia Jetson 開発ボードでの予測もサポートします。
★ 762+0直近 7 日のスター増減 - #116★ 754+2直近 7 日のスター増減
- #117
ローカルマシンの Unity3d で音声認識モデル (whisper.cpp) を実行する。
★ 751+1直近 7 日のスター増減 - #118
Allosaurusは、2000以上の言語に対応する事前トレーニング済み汎用音声認識エンジンです
★ 745+3直近 7 日のスター増減 - #119
Android 向けのプライベートでオンデバイスな音声認識キーボードおよびサービス。
★ 744+5直近 7 日のスター増減 - #120
PyTorchで実装されたストリーミングおよび非ストリーミングの自動音声認識フレームワーク。オンラインおよびオフライン認識の両方に対応しており、現在Conformer、Squeezeformer、DeepSpeech2モデルをサポートし、多様なデータ拡張手法を備えています。
★ 727+0直近 7 日のスター増減