メインコンテンツへスキップ
buildradar
Sign in
トピック · speech-recognition

speech-recognition

speech-recognition がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

155 件のリポジトリ
  • 💎 ASR、TTS、その他の音声技術向けにアクセス可能な音声コーパスのリスト

    1,399+0直近 7 日のスター増減
  • mlx-tune@ARahim3

    Apple Silicon 搭載 Mac で LLM をファインチューニング。MLX 上でネイティブ動作する SFT、DPO、GRPO、Vision、TTS、STT、Embedding、OCR のファインチューニング対応。Unsloth 互換 API。

    1,398+9直近 7 日のスター増減
  • CrisperWhisper@nyrahealth

    制御可能な文字起こし。単語単位のタイムスタンプ付きで、逐語的(フィラー、ポーズ、言い淀み、発声を含む)または意図通り(話し手の意図を反映し、読みやすさを最適化)の出力が可能

    1,371+21直近 7 日のスター増減
  • whisper-ctranslate2@Softcatala

    CTranslate2 をベースにした、オリジナルの OpenAI クライアントと互換性のある Whisper コマンドラインクライアント

    1,346+3直近 7 日のスター増減
  • J.A.R.V.I.S@GauravSingh9356

    Pythonライブラリを使用して構築されたパーソナルアシスタント。メール送信、OCR、API連携によるリアルタイムな動的ニュース配信、ToDoリストの生成、音声コマンドによるWebサイトのオープン、音楽再生、Wikipedia検索、自動スペルチェックなどのインテリジェント機能付き辞書、気温・風速・湿度などの天気予報など、ほぼ何でも実行できます。

    1,341+9直近 7 日のスター増減
  • voxtype@peteonrails

    Wayland コンポジター向けのプッシュトトーク対応音声テキスト変換。

    1,338+80直近 7 日のスター増減
  • StreamSpeech@ictnlp

    StreamSpeech は、オフラインおよび同時音声認識、音声翻訳、音声合成のための「オールインワン」シームレスモデルです。

    1,288+1直近 7 日のスター増減
  • pruna@PrunaAI

    Prunaは開発者向けに構築されたモデル最適化フレームワークであり、最小限のオーバーヘッドでより高速かつ効率的なモデルを提供できるようにします。

    1,274+2直近 7 日のスター増減
  • vosk-server@alphacep

    Vosk および Kaldi ライブラリに基づく WebSocket、gRPC、WebRTC 音声認識サーバー

    1,262+2直近 7 日のスター増減
  • Whisper-Finetune@yeyupiaoling

    Whisper音声認識モデルをファインチューニングし、タイムスタンプなし、タイムスタンプあり、音声なしデータのトレーニングをサポート。推論の高速化、およびWeb、Windowsデスクトップ、Androidへのデプロイをサポート

    1,222-1直近 7 日のスター増減
  • quillman@modal-labs

    音声チャットアプリ

    1,212-1直近 7 日のスター増減
  • Treasure-of-Transformers@ashishpatel26

    自然言語処理向けのTransformersモデルに関する優れたリソース集。論文、動画、ブログ、公式リポジトリ、Colabノートブックが含まれています。

    1,179+0直近 7 日のスター増減
  • Apple の Foundation Models フレームワークを使用したアプリの構築、テスト、評価のための実践的なラボ。

    1,178+0直近 7 日のスター増減
  • lotti@matthiasn

    パーソナルAIアシスタントのスタッフがいるプライベートなログブック。エージェントが記録を読み取り、次のアクションを提案し、ユーザーが変更を承認します。デバイス間のエンドツーエンド暗号化同期により、サーバー側からは暗号文のみが見えます。ローカルAIはオプションです。

    1,168+4直近 7 日のスター増減
  • speech-swift@soniqo

    Apple Silicon 向け AI 音声ツールキット — MLX と CoreML を活用した ASR、TTS、音声対音声、VAD、話者分離

    1,161+11直近 7 日のスター増減
  • オフライン動作対応のロシア語音声アシスタント「Ирина」。プラグインによるスキルをサポート。

    1,153+1直近 7 日のスター増減
  • lhotse@lhotse-speech

    機械学習プロジェクトにおけるマルチモーダルデータを処理するためのツール

    1,149+0直近 7 日のスター増減
  • アプリのためのセルフコーディングシステム — Cordova 用 Alan AI SDK

    1,132+0直近 7 日のスター増減
  • conformer@sooftware

    [非公式] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) の PyTorch 実装

    1,132+1直近 7 日のスター増減
  • AI-Waifu-Vtuber@ardha27

    Youtube/Twitch 配信用の AI VTuber

    1,115-1直近 7 日のスター増減
  • sglang-omni@sgl-project

    SGLang-Omni は、TTS、ASR、音声、およびオムニモデルの高性能なサービングを実現します。

    1,105+107直近 7 日のスター増減
  • whisper-writer@savbell

    💬📝 OpenAIのWhisper音声認識モデルを使用した小さなディクテーションアプリ。

    1,100+3直近 7 日のスター増減
  • Whisperboard@Saik0s

    モバイルデバイスで高品質な音声文字起こしをより身近にするオープンソースのiOSアプリ

    1,096+3直近 7 日のスター増減
  • Kaldi ツールキットと GStreamer フレームワークに基づく、リアルタイム全二重音声認識サーバー。

    1,094+0直近 7 日のスター増減
  • Voskライブラリを使用したAndroid向けのオフライン音声認識。

    1,056+0直近 7 日のスター増減
  • pykaldi@pykaldi

    Kaldi用のPythonラッパー

    1,040+0直近 7 日のスター増減
  • TensorFlowASR@TensorSpeech

    :zap: TensorFlowASR: TensorFlow 2 によるほぼ最高水準の自動音声認識。文字またはサブワードを使用できる言語をサポート

    1,010+0直近 7 日のスター増減
  • StoryToolkitAI@octimot

    AI を使用して文字起こし、コンテンツの理解、映像内のあらゆるものの検索を行う編集ツール。ChatGPT やその他の AI モデルと統合されています。

    1,009+2直近 7 日のスター増減
  • sherpa@k2-fsa

    次世代 Kaldi を使用した音声認識サーバーフレームワーク

    984+2直近 7 日のスター増減
  • VoiceStreamAI@alesaccoia

    Python/JS におけるセルフホスト型 Whisper と WebSocket を使用したほぼリアルタイムの文字起こし

    960+1直近 7 日のスター増減
← トピック一覧に戻る