メインコンテンツへスキップ
buildradar
Sign in
トピック · speech-recognition

speech-recognition

speech-recognition がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

155 件のリポジトリ
  • adapt@MycroftAI

    Adapt Intent Parser

    719+0直近 7 日のスター増減
  • curses@mmpneo

    OBS、VRChat、Twitchチャット、Discord向けの音声認識(Speech to Text)およびKB入力字幕

    718+0直近 7 日のスター増減
  • openspeech@openspeech-team

    PyTorch-LightningとHydraを活用したエンドツーエンド音声認識のためのオープンソースツールキット。

    714-1直近 7 日のスター増減
  • rhino@Picovoice

    ディープラーニングを活用したオンデバイス Speech-to-Intent エンジン

    711+1直近 7 日のスター増減
  • speech-demo@Baidu-AIP

    音声APIのサンプル

    708+0直近 7 日のスター増減
  • 音声認識(Speech-to-Text)のベンチマークフレームワーク

    697+0直近 7 日のスター増減
  • OpenAI Whisper と TensorFlow Lite を使用した Android 向けオフライン音声認識

    688-1直近 7 日のスター増減
  • INTERSPEECH 2023-2024論文コレクション:INTERSPEECH 2023-24カンファレンスの影響力ある重要な研究論文の完全なまとめ。音声および言語処理の最新の進歩を探索できます。コード付き。音声技術の発展を支援するためにリポジトリにスターをお願いします!

    684-1直近 7 日のスター増減
  • 音声数字の無料オーディオデータセット。MNIST のオーディオ版。

    678+0直近 7 日のスター増減
  • React Native Expoプロジェクト向けの音声認識

    676+6直近 7 日のスター増減
  • cheetah@Picovoice

    ディープラーニングを活用した、デバイス上のストリーミング音声認識エンジン

    671+0直近 7 日のスター増減
  • FireRedASR2S@FireRedTeam

    ASR、VAD、LID、Punc モジュールを備えた SOTA の産業グレードオールインワン ASR システム。FireRedASR2 は中国語(標準語、20以上の方言/アクセント)、英語、コードスイッチング、音声および歌唱の ASR をサポートします。FireRedVAD は 100 以上の言語で音声/歌唱/音楽をサポートします。FireRedLID は 100 以上の言語と 20 以上の中国語方言をサポートします。FireRedPunc は中国語と英語をサポートします。

    669+10直近 7 日のスター増減
  • hear@sveinbjornt

    macOS の内蔵音声認識および文字起こし機能のためのコマンドラインインターフェース

    669-1直近 7 日のスター増減
  • gpt-home@judahpaul16

    自宅のChatGPT!LiteLLMとLangGraphを使用し、Raspberry Pi上で構築された商用スマートホームアシスタントの優れた代替品

    648+0直近 7 日のスター増減
  • sonus@evancohen

    :speech_balloon: /so.nus/ オフラインホットワード検知機能を備えたNode向けSTT(音声認識)

    638+0直近 7 日のスター増減
  • whisperIME@woheller69

    Whisper をベースにした Android 入力メソッドエディタ(IME)

    630+5直近 7 日のスター増減
  • LiveTranslate@TheDeathDragon

    リアルタイム音声翻訳。システム音声とマイクをキャプチャし、ASR(Whisper/SenseVoice)を実行し、LLM API経由で翻訳してストリーミング表示します。VTuber、ライブ配信者、外国語コンテンツの視聴に最適です。

    621+18直近 7 日のスター増減
  • speech-to-text@reriiasu

    faster-whisperを使用したリアルタイム文字起こし

    614+0直近 7 日のスター増減
  • CrispASR@CrispStrobe

    多言語 ASR および TTS モデル(Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2 など)向けの C++ 製 ggml ランタイムハブ。汎用フォースドアライメント機能なども搭載

    610+14直近 7 日のスター増減
  • CTCWordBeamSearch@githubharald

    辞書と言語モデルを備えた Connectionist Temporal Classification (CTC) デコーダー

    580+1直近 7 日のスター増減
  • WhisperS2T@shashikg

    複数の推論エンジンをサポートする、Whisperモデル向けの最適化されたSpeech-to-Textパイプライン

    578+1直近 7 日のスター増減
  • アプリのためのセルフコーディングシステム — React Native 向け Alan AI SDK

    575+0直近 7 日のスター増減
  • VRCOSC@VolcanicArts

    VRChat向けに作られたモジュール式のノードプログラミング言語、プログラムクリエイター、アニメーションシステム、ツールキット、ルーター、デバッガー

    563-1直近 7 日のスター増減
  • 🗣 カスタマイズ可能な UI でユーザーの音声許可を取得し、音声をテキストとして入力するオーバーレイ

    557+0直近 7 日のスター増減
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: 自動音声認識のための大規模で堅牢かつ包括的なベンチマークプラットフォーム。

    553+3直近 7 日のスター増減
  • 韓国語音声認識 STT API リストと各パフォーマンスベンチマーク。

    547+1直近 7 日のスター増減
  • CleanS2S@opendilab

    単一ファイルで実装された、高品質かつストリーミング対応のSpeech-to-Speech対話型エージェント。

    541+0直近 7 日のスター増減
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    533+16直近 7 日のスター増減
  • vosk-browser@ccoreilly

    Vosk の WebAssembly ビルドによりブラウザ上で動作する音声認識ライブラリ

    529+0直近 7 日のスター増減
  • parrots@shibing624

    自動音声認識(ASR)およびテキスト読み上げ(TTS)エンジン。中英バイリンガル音声認識、マルチロール音声合成、多言語対応、高精度

    528+0直近 7 日のスター増減
← トピック一覧に戻る