メインコンテンツへスキップ
buildradar
Sign in
トピック · asr

asr

asr がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

86 件のリポジトリ
  • sherpa-ncnn@k2-fsa

    インターネット接続なしで次世代Kaldiとncnnを使用したリアルタイム音声認識および音声区間検出(VAD)。iOS、Android、Linux、macOS、Windows、Raspberry Pi、VisionFive2、LicheePi4Aなどをサポート

    1,777-1直近 7 日のスター増減
  • bailing@wwbin2017

    百聆(Bailing)はGPT-4oに類似した音声対話ボットであり、ASR+LLM+TTSを通じて実現されています。DeepSeek R1などの優れた大規模モデルを統合し、openClawに接続した真の個人用音声アシスタントです。遅延は800msと低く、Macなどの低スペック環境でも動作し、割り込みをサポートしています。

    1,759+2直近 7 日のスター増減
  • dsnote@mkiol

    Speech Note Linux アプリ。オフラインでの音声文字変換(Speech to Text)、音声合成(Text to Speech)、機械翻訳を使用したメモ作成、読み上げ、翻訳機能を提供します。

    1,622+8直近 7 日のスター増減
  • video-analyzer@byjlw

    LLM、コンピュータビジョン、自動音声認識を使用した動画分析

    1,570+8直近 7 日のスター増減
  • amical@amicalhq

    🎙️ AIディクテーションアプリ - オープンソース&ローカルファースト ⚡ キーボードなしで3倍速く入力。🆓 オープンソースモデル搭載、オフライン動作、高速かつ高精度。

    1,520+8直近 7 日のスター増減
  • Fun-ASR@QwenAudio

    中国語、方言、アクセント、多言語音声に対応した、オープンソースの LLM ベース ASR モデルファミリ。FunASR、vLLM、ストリーミング、llama.cpp ランタイムをサポート。

    1,512+10直近 7 日のスター増減
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forgeは、TTS生成モデルを中心に開発されたプロジェクトで、APIサーバーとGradioベースのWebUIを実装しています。

    1,418+0直近 7 日のスター増減
  • SoniTranslate@R3gm

    動画の同期翻訳。動画の吹き替え

    1,413+2直近 7 日のスター増減
  • CrisperWhisper@nyrahealth

    制御可能な文字起こし。単語単位のタイムスタンプ付きで、逐語的(フィラー、ポーズ、言い淀み、発声を含む)または意図通り(話し手の意図を反映し、読みやすさを最適化)の出力が可能

    1,371+13直近 7 日のスター増減
  • voicemode@mbailey

    Claude Code を使用した自然な音声会話

    1,347+6直近 7 日のスター増減
  • VideoChat@Henry-23

    リアルタイム音声対話型デジタルヒューマン。外見や音声のカスタマイズ、音声クローンに対応し、初期応答遅延は 3 秒未満。

    1,303-1直近 7 日のスター増減
  • StreamSpeech@ictnlp

    StreamSpeech は、オフラインおよび同時音声認識、音声翻訳、音声合成のための「オールインワン」シームレスモデルです。

    1,288+0直近 7 日のスター増減
  • vosk-server@alphacep

    Vosk および Kaldi ライブラリに基づく WebSocket、gRPC、WebRTC 音声認識サーバー

    1,262+1直近 7 日のスター増減
  • Whisper-Finetune@yeyupiaoling

    Whisper音声認識モデルをファインチューニングし、タイムスタンプなし、タイムスタンプあり、音声なしデータのトレーニングをサポート。推論の高速化、およびWeb、Windowsデスクトップ、Androidへのデプロイをサポート

    1,222-1直近 7 日のスター増減
  • speech-swift@soniqo

    Apple Silicon 向け AI 音声ツールキット — MLX と CoreML を活用した ASR、TTS、音声対音声、VAD、話者分離

    1,161+4直近 7 日のスター増減
  • Mega-ASR@xzf-thu

    現実世界向けに構築された初の基礎 ASR:7つのアトミックな音響条件、54の複合シナリオ、260万件のサンプルを備え、他のモデルが機能しない環境でも SOTA と比較して最大約 30% の向上を実現。他のモデルが実環境で失敗した後に戻ってくるモデル。

    1,136+3直近 7 日のスター増減
  • conformer@sooftware

    [非公式] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) の PyTorch 実装

    1,132+1直近 7 日のスター増減
  • sglang-omni@sgl-project

    SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。

    1,118+130直近 7 日のスター増減
  • violin@shang-zhu

    オープンソースの動画翻訳スキル

    1,057+6直近 7 日のスター増減
  • Voskライブラリを使用したAndroid向けのオフライン音声認識。

    1,056+0直近 7 日のスター増減
  • murmure@Kieirra

    LLMによる後処理を備えた、完全ローカルかつプライベートなクロスプラットフォーム音声認識(Speech-to-Text)

    1,053+13直近 7 日のスター増減
  • pykaldi@pykaldi

    Kaldi用のPythonラッパー

    1,040+1直近 7 日のスター増減
  • sherpa@k2-fsa

    次世代 Kaldi を使用した音声認識サーバーフレームワーク

    984+4直近 7 日のスター増減
  • espresso@freewym

    Espresso: 高速なエンドツーエンドのニューラル音声認識ツールキット

    939+0直近 7 日のスター増減
  • vocotype-cli@233stone

    VocoType は、ローカル環境で動作するプライバシーとセキュリティに配慮した音声入力ツールです。ショートカットキーで音声をリアルタイムにテキストへ変換し、現在のアプリケーションへ自動入力します。音声文字変換 MCP、AI によるテキスト最適化、カスタム置換辞書、音声・動画の文字起こしなどの機能をサポートし、音声入力をより効率的かつ安全にします。

    928+5直近 7 日のスター増減
  • whisper.api@innovatorved

    ファインチューニングおよび処理済みのWhisper ASRモデルを使用して、音声文字起こしを行うユーザーレベルアクセス対応のAPIを提供するプロジェクト

    914+0直近 7 日のスター増減
  • SmartJavaAI@geekwenjie

    🔥🔥🔥 Java の無料オフライン AI アルゴリズムツールボックス。顔認識、生体検知、表情認識、物体検出、インスタンスセグメンテーション、歩行者検出、OCR 文字認識、ナンバープレート認識、表認識、ASR+TTS、機械翻訳などの機能をサポートし、Maven 依存関係に追加するだけで使用できます。PyTorch、Tensorflow をサポートし、Mtcnn、InsightFace、SeetaFace6、YOLOv8~v12、PaddleOCR(PPOCRv5)、Whisper などの主流モデルを統合済みです。

    908+3直近 7 日のスター増減
  • Easy-Voice-Toolkit@Spr-Aachen

    音声認識、文字起こし、変換などのための使いやすいツールキット

    873+0直近 7 日のスター増減
  • PPASR@yeyupiaoling

    PaddlePaddleに基づくエンドツーエンドの中国語音声認識。入門から実践まで、非常にシンプルな入門ケースと実用的なエンタープライズプロジェクト。現在最も人気のDeepSpeech2、Conformer、Squeezeformerモデルをサポート

    870-1直近 7 日のスター増減
  • GLM-ASR@zai-org

    GLM-ASR-Nano: 15億パラメータを持つ堅牢なオープンソース音声認識モデル

    854+3直近 7 日のスター増減
← トピック一覧に戻る