asr
asr がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
asr と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、asr がタグ付けされたリポジトリ。
- #1
ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。
★ 2,128 - #2
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 494 - #3
早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
★ 317
- #1★ 23,803+117直近 7 日のスター増減
- #2
トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット
★ 20,072+108直近 7 日のスター増減 - #3
大規模言語モデル、マルチモーダル、および音声AI(自動音声認識とText-to-Speech)に取り組む研究者や開発者のために構築されたスケーラブルな生成AIフレームワーク
★ 18,358+155直近 7 日のスター増減 - #4★ 15,084+17直近 7 日のスター増減
- #5
インターネット接続なしで、次世代Kaldiとonnxruntimeを使用した音声認識(Speech-to-text)、テキスト読み上げ(text-to-speech)、話者ダイアライゼーション、音声強調、ソース分離、VADを提供。組み込みシステム、Android、iOS、HarmonyOS、Raspberry Pi、RISC-V、RK NPU、Axera NPU、Ascend NPU、x86_64サーバー、websocketサーバー/クライアントをサポートし、12のプログラミング言語に対応。
★ 14,480+169直近 7 日のスター増減 - #6
自己教師あり学習モデル、句読点付きSOTA/ストリーミングASR、テキストフロントエンド付きストリーミングTTS、話者認証システム、エンドツーエンド音声翻訳、キーワードスポッティングを含む使いやすい音声ツールキット。NAACL2022最優秀デモ賞を受賞。
★ 12,671+6直近 7 日のスター増減 - #7
PyTorchベースの音声ツールキット
★ 11,792+22直近 7 日のスター増減 - #8
Mandarin、Cantonese、English、Japanese、Korean向けのオープンソースのSenseVoiceSmallモデル。ASR、言語ID、感情認識、音声イベント検出に対応。
★ 9,172+51直近 7 日のスター増減 - #9
特定のYouTube動画のトランスクリプト/字幕を取得できるPython API。自動生成字幕にも対応し、他のSeleniumベースのソリューションのようにAPIキーやヘッドレスブラウザは不要です。
★ 8,129+41直近 7 日のスター増減 - #10
🤖 wukong-robot は、シンプルで柔軟かつエレガントな中国語音声対話ロボット/スマートスピーカープロジェクトであり、ChatGPTのマルチターン対話能力をサポートしています。また、ブレイン・コンピューター・インターフェース(BCI)をサポートする初のオープンソーススマートスピーカープロジェクトである可能性があります。
★ 7,124-1直近 7 日のスター増減 - #11★ 6,197+25直近 7 日のスター増減
- #12
OpenAI Whisperに基づく話者ダイアライゼーション付き自動音声認識
★ 5,633+7直近 7 日のスター増減 - #13
HTML5 JS録音(mp3, wav, ogg, webm, amr, g711a, g711u形式)をサポート。PC、Android、iOSの一部Webブラウザ、Hybrid App(Android/iOSアプリソースコード提供)、WeChatに対応。ASR音声認識による文字起こし、H5版の音声通話/チャットサンプル、DTMFの符号化/復号化機能を提供。
★ 5,628+0直近 7 日のスター増減 - #14★ 5,228+4直近 7 日のスター増減
- #15★ 4,058+20直近 7 日のスター増減
- #16
Streamer-Sales 銷冠 —— 販売ホストLLM大規模モデル🛒🎁。指定された商品の特徴に基づき、ユーザーの購買意欲を刺激する視点から商品解説を行う販売ホストLLM。🚀⭐詳細なデータ生成プロセスを含む❗ 📦さらに、LMDeployによる推論高速化🚀、RAG検索拡張生成 📚、TTS音声合成🔊、デジタルヒューマン生成 🦸、Agentによるネットワーク検索でのリアルタイム情報取得🌐、ASR音声文字起こし🎙️、Vueエコシステムによるフロントエンド構築🍍、FastAPIによるバックエンド構築🗝️、Docker-composeによるパッケージ化・デプロイ🐋
★ 3,763+7直近 7 日のスター増減 - #17★ 3,359+164直近 7 日のスター増減
- #18
OpenAI Whisper ASR Web サービス API
★ 3,326+2直近 7 日のスター増減 - #19
Python の導入を避けたい人のための Whisper および Faster-Whisper のスタンドアロン実行ファイル
★ 3,169+9直近 7 日のスター増減 - #20
PySide6 を使用した faster_whisper GUI
★ 2,991+4直近 7 日のスター増減 - #21★ 2,897+305直近 7 日のスター増減
- #22★ 2,864+0直近 7 日のスター増減
- #23
単語レベルのタイムスタンプと信頼度を備えた多言語自動音声認識
★ 2,841+2直近 7 日のスター増減 - #24
アプリ内で最先端の CoreML 音声モデルを利用可能に — テキスト読み上げ、音声認識、音声区間検出、話者ダイアライゼーション。Swift 製、SOTA のオープンソースを活用。
★ 2,710+40直近 7 日のスター増減 - #25★ 2,605+1直近 7 日のスター増減
- #26
音声や動画のコンテンツを素早く抽出し、構造化されたMarkdownノートに整理する
★ 2,477+39直近 7 日のスター増減 - #27
ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。
★ 2,128+178直近 7 日のスター増減 - #28
中国語、方言、英語をサポートするオープンソースの産業グレード ASR モデル。パブリックな中国語 ASR ベンチマークで新たな SOTA を達成し、優れた歌声の歌詞認識能力も提供します。
★ 1,974+9直近 7 日のスター増減 - #29
16以上のモデルファミリーに対応したggml音声認識(speech-to-text)推論
★ 1,860+33直近 7 日のスター増減 - #30★ 1,812+12直近 7 日のスター増減