speech-recognition
speech-recognition がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #61
💎 ASR、TTS、その他の音声技術向けにアクセス可能な音声コーパスのリスト
★ 1,399+0直近 7 日のスター増減 - #62
Apple Silicon 搭載 Mac で LLM をファインチューニング。MLX 上でネイティブ動作する SFT、DPO、GRPO、Vision、TTS、STT、Embedding、OCR のファインチューニング対応。Unsloth 互換 API。
★ 1,398+9直近 7 日のスター増減 - #63
制御可能な文字起こし。単語単位のタイムスタンプ付きで、逐語的(フィラー、ポーズ、言い淀み、発声を含む)または意図通り(話し手の意図を反映し、読みやすさを最適化)の出力が可能
★ 1,371+21直近 7 日のスター増減 - #64
CTranslate2 をベースにした、オリジナルの OpenAI クライアントと互換性のある Whisper コマンドラインクライアント
★ 1,346+3直近 7 日のスター増減 - #65
Pythonライブラリを使用して構築されたパーソナルアシスタント。メール送信、OCR、API連携によるリアルタイムな動的ニュース配信、ToDoリストの生成、音声コマンドによるWebサイトのオープン、音楽再生、Wikipedia検索、自動スペルチェックなどのインテリジェント機能付き辞書、気温・風速・湿度などの天気予報など、ほぼ何でも実行できます。
★ 1,341+9直近 7 日のスター増減 - #66★ 1,338+80直近 7 日のスター増減
- #67
StreamSpeech は、オフラインおよび同時音声認識、音声翻訳、音声合成のための「オールインワン」シームレスモデルです。
★ 1,288+1直近 7 日のスター増減 - #68★ 1,274+2直近 7 日のスター増減
- #69
Vosk および Kaldi ライブラリに基づく WebSocket、gRPC、WebRTC 音声認識サーバー
★ 1,262+2直近 7 日のスター増減 - #70
Whisper音声認識モデルをファインチューニングし、タイムスタンプなし、タイムスタンプあり、音声なしデータのトレーニングをサポート。推論の高速化、およびWeb、Windowsデスクトップ、Androidへのデプロイをサポート
★ 1,222-1直近 7 日のスター増減 - #71★ 1,212-1直近 7 日のスター増減
- #72
自然言語処理向けのTransformersモデルに関する優れたリソース集。論文、動画、ブログ、公式リポジトリ、Colabノートブックが含まれています。
★ 1,179+0直近 7 日のスター増減 - #73
Apple の Foundation Models フレームワークを使用したアプリの構築、テスト、評価のための実践的なラボ。
★ 1,178+0直近 7 日のスター増減 - #74
パーソナルAIアシスタントのスタッフがいるプライベートなログブック。エージェントが記録を読み取り、次のアクションを提案し、ユーザーが変更を承認します。デバイス間のエンドツーエンド暗号化同期により、サーバー側からは暗号文のみが見えます。ローカルAIはオプションです。
★ 1,168+4直近 7 日のスター増減 - #75
Apple Silicon 向け AI 音声ツールキット — MLX と CoreML を活用した ASR、TTS、音声対音声、VAD、話者分離
★ 1,161+11直近 7 日のスター増減 - #76
オフライン動作対応のロシア語音声アシスタント「Ирина」。プラグインによるスキルをサポート。
★ 1,153+1直近 7 日のスター増減 - #77★ 1,149+0直近 7 日のスター増減
- #78
アプリのためのセルフコーディングシステム — Cordova 用 Alan AI SDK
★ 1,132+0直近 7 日のスター増減 - #79
[非公式] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) の PyTorch 実装
★ 1,132+1直近 7 日のスター増減 - #80
Youtube/Twitch 配信用の AI VTuber
★ 1,115-1直近 7 日のスター増減 - #81
SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。
★ 1,105+107直近 7 日のスター増減 - #82
💬📝 OpenAIのWhisper音声認識モデルを使用した小さなディクテーションアプリ。
★ 1,100+3直近 7 日のスター増減 - #83
モバイルデバイスで高品質な音声文字起こしをより身近にするオープンソースのiOSアプリ
★ 1,096+3直近 7 日のスター増減 - #84
Kaldi ツールキットと GStreamer フレームワークに基づく、リアルタイム全二重音声認識サーバー。
★ 1,094+0直近 7 日のスター増減 - #85
Voskライブラリを使用したAndroid向けのオフライン音声認識。
★ 1,056+0直近 7 日のスター増減 - #86★ 1,040+0直近 7 日のスター増減
- #87
:zap: TensorFlowASR: TensorFlow 2 によるほぼ最高水準の自動音声認識。文字またはサブワードを使用できる言語をサポート
★ 1,010+0直近 7 日のスター増減 - #88
AI を使用して文字起こし、コンテンツの理解、映像内のあらゆるものの検索を行う編集ツール。ChatGPT やその他の AI モデルと統合されています。
★ 1,009+2直近 7 日のスター増減 - #89★ 984+2直近 7 日のスター増減
- #90
Python/JS におけるセルフホスト型 Whisper と WebSocket を使用したほぼリアルタイムの文字起こし
★ 960+1直近 7 日のスター増減