asr
asr がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #61
Voxtral ASR と TTS をネイティブおよびブラウザ上で実行。Burn ML フレームワークを使用した Mistral の Voxtral mini リアルタイム ASR / TTS の Rust 実装
★ 819+2直近 7 日のスター増減 - #62
🎙️ 音声をきれいなテキスト、有用なアクション、構造化された知識に変換するインテリジェントな音声生産性アシスタント。アイデアの記録、自然なコミュニケーション、反復作業の自動化を支援し、さまざまなアプリやワークフローで生産性を維持します。
★ 804+3直近 7 日のスター増減 - #63
LLM、ASR、TTS、OCR、CVなどの技術を搭載し、ライブ配信を行ったりMinecraftを一緒にプレイしたりできるAI VTuber
★ 802+4直近 7 日のスター増減 - #64
BiBi Keyboard: Kotlin をベースにした Android プラットフォーム向けの LLM および ASR 音声入力キーボードアプリ
★ 768+17直近 7 日のスター増減 - #65★ 766+0直近 7 日のスター増減
- #66
PaddlePaddle をベースに実装された音声認識、中国語音声認識。プロジェクトは充実しており、認識精度も良好。Windows および Linux でのトレーニングと予測をサポートし、Nvidia Jetson 開発ボードでの予測もサポートします。
★ 762+0直近 7 日のスター増減 - #67
ローカルマシンの Unity3d で音声認識モデル (whisper.cpp) を実行する。
★ 751+1直近 7 日のスター増減 - #68
PyTorchで実装されたストリーミングおよび非ストリーミングの自動音声認識フレームワーク。オンラインおよびオフライン認識の両方に対応しており、現在Conformer、Squeezeformer、DeepSpeech2モデルをサポートし、多様なデータ拡張手法を備えています。
★ 727+0直近 7 日のスター増減 - #69
PyTorch-LightningとHydraを活用したエンドツーエンド音声認識のためのオープンソースツールキット。
★ 714+0直近 7 日のスター増減 - #70
OpenAI Whisper と TensorFlow Lite を使用した Android 向けオフライン音声認識
★ 688+0直近 7 日のスター増減 - #71
INTERSPEECH 2023-2024論文コレクション:INTERSPEECH 2023-24カンファレンスの影響力ある重要な研究論文の完全なまとめ。音声および言語処理の最新の進歩を探索できます。コード付き。音声技術の発展を支援するためにリポジトリにスターをお願いします!
★ 684+0直近 7 日のスター増減 - #72★ 677+0直近 7 日のスター増減
- #73★ 671+0直近 7 日のスター増減
- #74
ASR、VAD、LID、Punc モジュールを備えた SOTA の産業グレードオールインワン ASR システム。FireRedASR2 は中国語(標準語、20以上の方言/アクセント)、英語、コードスイッチング、音声および歌唱の ASR をサポートします。FireRedVAD は 100 以上の言語で音声/歌唱/音楽をサポートします。FireRedLID は 100 以上の言語と 20 以上の中国語方言をサポートします。FireRedPunc は中国語と英語をサポートします。
★ 669+12直近 7 日のスター増減 - #75
リアルタイム音声翻訳。システム音声とマイクをキャプチャし、ASR(Whisper/SenseVoice)を実行し、LLM API経由で翻訳してストリーミング表示します。VTuber、ライブ配信者、外国語コンテンツの視聴に最適です。
★ 621+34直近 7 日のスター増減 - #76
音声認識の理論、論文、PPT
★ 618+0直近 7 日のスター増減 - #77
🤗 Optimum Intel: Intelの最適化ツールで推論を加速する
★ 617+1直近 7 日のスター増減 - #78
📣 商用グレードのオープンソース自動音声認識ライブラリ。すぐに使え、全プラットフォームに対応し、中英混合認識をサポート。ONNXRuntime と FunASR に基づく ASR 推論のクロスプラットフォーム実装。ASR モデルを呼び出すためのより簡単な API セットを提供します。
★ 611+0直近 7 日のスター増減 - #79
オープンソースの音声エージェントプラットフォーム
★ 591+1直近 7 日のスター増減 - #80
クロスプラットフォーム対応のリアルタイム字幕表示ソフトウェア
★ 578+4直近 7 日のスター増減 - #81
複数の推論エンジンをサポートする、Whisperモデル向けの最適化されたSpeech-to-Textパイプライン
★ 578+1直近 7 日のスター増減 - #82
SpeechIO Leaderboard: 自動音声認識のための大規模で堅牢かつ包括的なベンチマークプラットフォーム。
★ 553+3直近 7 日のスター増減 - #83
Vosk の WebAssembly ビルドによりブラウザ上で動作する音声認識ライブラリ
★ 529+1直近 7 日のスター増減 - #84
ICASSP 2023-2024 論文集:ICASSP 2023-24 カンファレンスにおける影響力のある興味深い研究論文の完全なコレクション。音響、音声、信号処理の最新の進歩を探索できます。コード付き。音声および信号処理の発展を支援するためにリポジトリにスターをつけてください!
★ 526+1直近 7 日のスター増減 - #85
RPi Zero 2 W / 5 を使用して構築されたポケットサイズの AI チャットボット
★ 512+8直近 7 日のスター増減 - #86
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501+7直近 7 日のスター増減