asr
asr がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #31
インターネット接続なしで次世代Kaldiとncnnを使用したリアルタイム音声認識および音声区間検出(VAD)。iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4Aなどをサポート
★ 1,777-1直近 7 日のスター増減 - #32
百聆(Bailing)はGPT-4oに類似した音声対話ボットであり、ASR+LLM+TTSを通じて実現されています。DeepSeek R1などの優れた大規模モデルを統合し、openClawに接続した真の個人用音声アシスタントです。遅延は800msと低く、Macなどの低スペック環境でも動作し、割り込みをサポートしています。
★ 1,759+2直近 7 日のスター増減 - #33
Speech Note Linux アプリ。オフラインでの音声文字変換(Speech to Text)、音声合成(Text to Speech)、機械翻訳を使用したメモ作成、読み上げ、翻訳機能を提供します。
★ 1,622+8直近 7 日のスター増減 - #34
LLM、コンピュータビジョン、自動音声認識を使用した動画分析
★ 1,570+8直近 7 日のスター増減 - #35
🎙️ AIディクテーションアプリ - オープンソース&ローカルファースト ⚡ キーボードなしで3倍速く入力。🆓 オープンソースモデル搭載、オフライン動作、高速かつ高精度。
★ 1,520+8直近 7 日のスター増減 - #36
中国語、方言、アクセント、多言語音声に対応した、オープンソースの LLM ベース ASR モデルファミリ。FunASR、vLLM、ストリーミング、llama.cpp ランタイムをサポート。
★ 1,512+10直近 7 日のスター増減 - #37
🍦 Speech-AI-Forgeは、TTS生成モデルを中心に開発されたプロジェクトで、APIサーバーとGradioベースのWebUIを実装しています。
★ 1,418+0直近 7 日のスター増減 - #38
動画の同期翻訳。動画の吹き替え
★ 1,413+2直近 7 日のスター増減 - #39
制御可能な文字起こし。単語単位のタイムスタンプ付きで、逐語的(フィラー、ポーズ、言い淀み、発声を含む)または意図通り(話し手の意図を反映し、読みやすさを最適化)の出力が可能
★ 1,371+13直近 7 日のスター増減 - #40★ 1,347+6直近 7 日のスター増減
- #41★ 1,303-1直近 7 日のスター増減
- #42
StreamSpeech は、オフラインおよび同時音声認識、音声翻訳、音声合成のための「オールインワン」シームレスモデルです。
★ 1,288+0直近 7 日のスター増減 - #43
Vosk および Kaldi ライブラリに基づく WebSocket、gRPC、WebRTC 音声認識サーバー
★ 1,262+1直近 7 日のスター増減 - #44
Whisper音声認識モデルをファインチューニングし、タイムスタンプなし、タイムスタンプあり、音声なしデータのトレーニングをサポート。推論の高速化、およびWeb、Windowsデスクトップ、Androidへのデプロイをサポート
★ 1,222-1直近 7 日のスター増減 - #45
Apple Silicon 向け AI 音声ツールキット — MLX と CoreML を活用した ASR、TTS、音声対音声、VAD、話者分離
★ 1,161+4直近 7 日のスター増減 - #46
現実世界向けに構築された初の基礎 ASR:7つのアトミックな音響条件、54の複合シナリオ、260万件のサンプルを備え、他のモデルが機能しない環境でも SOTA と比較して最大約 30% の向上を実現。他のモデルが実環境で失敗した後に戻ってくるモデル。
★ 1,136+3直近 7 日のスター増減 - #47
[非公式] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) の PyTorch 実装
★ 1,132+1直近 7 日のスター増減 - #48
SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。
★ 1,118+130直近 7 日のスター増減 - #49★ 1,057+6直近 7 日のスター増減
- #50
Voskライブラリを使用したAndroid向けのオフライン音声認識。
★ 1,056+0直近 7 日のスター増減 - #51★ 1,053+13直近 7 日のスター増減
- #52★ 1,040+1直近 7 日のスター増減
- #53★ 984+4直近 7 日のスター増減
- #54★ 939+0直近 7 日のスター増減
- #55
VocoType は、ローカル環境で動作するプライバシーとセキュリティに配慮した音声入力ツールです。ショートカットキーで音声をリアルタイムにテキストへ変換し、現在のアプリケーションへ自動入力します。音声文字変換 MCP、AI によるテキスト最適化、カスタム置換辞書、音声・動画の文字起こしなどの機能をサポートし、音声入力をより効率的かつ安全にします。
★ 928+5直近 7 日のスター増減 - #56
ファインチューニングおよび処理済みのWhisper ASRモデルを使用して、音声文字起こしを行うユーザーレベルアクセス対応のAPIを提供するプロジェクト
★ 914+0直近 7 日のスター増減 - #57
🔥🔥🔥 Java の無料オフライン AI アルゴリズムツールボックス。顔認識、生体検知、表情認識、物体検出、インスタンスセグメンテーション、歩行者検出、OCR 文字認識、ナンバープレート認識、表認識、ASR+TTS、機械翻訳などの機能をサポートし、Maven 依存関係に追加するだけで使用できます。PyTorch、Tensorflow をサポートし、Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper などの主流モデルを統合済みです。
★ 908+3直近 7 日のスター増減 - #58
音声認識、文字起こし、変換などのための使いやすいツールキット
★ 873+0直近 7 日のスター増減 - #59
PaddlePaddleに基づくエンドツーエンドの中国語音声認識。入門から実践まで、非常にシンプルな入門ケースと実用的なエンタープライズプロジェクト。現在最も人気のDeepSpeech2、Conformer、Squeezeformerモデルをサポート
★ 870-1直近 7 日のスター増減 - #60★ 854+3直近 7 日のスター増減