メインコンテンツへスキップ
buildradar
Sign in
トピック · asr

asr

asr がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
85
総スター数
260,867
平均スター数
3,069
シェア
0.01%

asr と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、asr がタグ付けされたリポジトリ。

  • audio.cpp@0xShug0

    ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。

    2,128
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    494
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    317
  • whisperX@m-bain

    WhisperX:単語レベルのタイムスタンプ(および話者分離)を備えた自動音声認識

    23,803+117直近 7 日のスター増減
  • FunASR@modelscope

    トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット

    20,072+108直近 7 日のスター増減
  • Speech@NVIDIA-NeMo

    大規模言語モデル、マルチモーダル、および音声AI(自動音声認識とText-to-Speech)に取り組む研究者や開発者のために構築されたスケーラブルな生成AIフレームワーク

    18,358+155直近 7 日のスター増減
  • vosk-api@alphacep

    Python、Java、C#、Nodeに対応した、Android、iOS、Raspberry Piおよびサーバー向けのオフライン音声認識API

    15,084+17直近 7 日のスター増減
  • sherpa-onnx@k2-fsa

    インターネット接続なしで、次世代Kaldiとonnxruntimeを使用した音声認識(Speech-to-text)、テキスト読み上げ(text-to-speech)、話者ダイアライゼーション、音声強調、ソース分離、VADを提供。組み込みシステム、Android、iOS、HarmonyOS、Raspberry Pi、RISC-V、RK NPU、Axera NPU、Ascend NPU、x86_64サーバー、websocketサーバー/クライアントをサポートし、12のプログラミング言語に対応。

    14,480+169直近 7 日のスター増減
  • PaddleSpeech@PaddlePaddle

    自己教師あり学習モデル、句読点付きSOTA/ストリーミングASR、テキストフロントエンド付きストリーミングTTS、話者認証システム、エンドツーエンド音声翻訳、キーワードスポッティングを含む使いやすい音声ツールキット。NAACL2022最優秀デモ賞を受賞。

    12,671+6直近 7 日のスター増減
  • speechbrain@speechbrain

    PyTorchベースの音声ツールキット

    11,792+22直近 7 日のスター増減
  • SenseVoice@QwenAudio

    Mandarin、Cantonese、English、Japanese、Korean向けのオープンソースのSenseVoiceSmallモデル。ASR、言語ID、感情認識、音声イベント検出に対応。

    9,172+51直近 7 日のスター増減
  • 特定のYouTube動画のトランスクリプト/字幕を取得できるPython API。自動生成字幕にも対応し、他のSeleniumベースのソリューションのようにAPIキーやヘッドレスブラウザは不要です。

    8,129+41直近 7 日のスター増減
  • wukong-robot@wzpan

    🤖 wukong-robot は、シンプルで柔軟かつエレガントな中国語音声対話ロボット/スマートスピーカープロジェクトであり、ChatGPTのマルチターン対話能力をサポートしています。また、ブレイン・コンピューター・インターフェース(BCI)をサポートする初のオープンソーススマートスピーカープロジェクトである可能性があります。

    7,124-1直近 7 日のスター増減
  • FunClip@modelscope

    FunASRを搭載した動画文字起こし、字幕生成、LLM支援型クリッピングツール(ローカルGradio UI付き)

    6,197+25直近 7 日のスター増減
  • whisper-diarization@MahmoudAshraf97

    OpenAI Whisperに基づく話者ダイアライゼーション付き自動音声認識

    5,633+7直近 7 日のスター増減
  • Recorder@xiangyuecn

    HTML5 JS録音(mp3, wav, ogg, webm, amr, g711a, g711u形式)をサポート。PC、Android、iOSの一部Webブラウザ、Hybrid App(Android/iOSアプリソースコード提供)、WeChatに対応。ASR音声認識による文字起こし、H5版の音声通話/チャットサンプル、DTMFの符号化/復号化機能を提供。

    5,628+0直近 7 日のスター増減
  • wenet@wenet-e2e

    プロダクションファーストで本番環境対応のエンドツーエンド音声認識ツールキット。

    5,228+4直近 7 日のスター増減
  • LLPlayer@umlx5h

    デュアル字幕、AI生成字幕、リアルタイム翻訳などを備えた語学学習用メディアプレイヤー!

    4,058+20直近 7 日のスター増減
  • Streamer-Sales@PeterH0323

    Streamer-Sales 銷冠 —— 販売ホストLLM大規模モデル🛒🎁。指定された商品の特徴に基づき、ユーザーの購買意欲を刺激する視点から商品解説を行う販売ホストLLM。🚀⭐詳細なデータ生成プロセスを含む❗ 📦さらに、LMDeployによる推論高速化🚀、RAG検索拡張生成 📚、TTS音声合成🔊、デジタルヒューマン生成 🦸、Agentによるネットワーク検索でのリアルタイム情報取得🌐、ASR音声文字起こし🎙️、Vueエコシステムによるフロントエンド構築🍍、FastAPIによるバックエンド構築🗝️、Docker-composeによるパッケージ化・デプロイ🐋

    3,763+7直近 7 日のスター増減
  • openless@Open-Less

    キーを押しながら話して放すと、AI が洗練したテキストがどのアプリでもカーソル位置に入力されます。macOS & Windows 向けのオープンソース音声入力。

    3,359+164直近 7 日のスター増減
  • OpenAI Whisper ASR Web サービス API

    3,326+2直近 7 日のスター増減
  • Python の導入を避けたい人のための Whisper および Faster-Whisper のスタンドアロン実行ファイル

    3,169+9直近 7 日のスター増減
  • faster-whisper-GUI@CheshireCC

    PySide6 を使用した faster_whisper GUI

    2,991+4直近 7 日のスター増減
  • GPA@AutoArk

    [AutoArk] GPA (General Purpose Audio) は、1つの小型モデルで ASR、TTS、および音声変換を実行可能!

    2,897+305直近 7 日のスター増減
  • lingvo@tensorflow

    Lingvo

    2,864+0直近 7 日のスター増減
  • whisper-timestamped@linto-ai

    単語レベルのタイムスタンプと信頼度を備えた多言語自動音声認識

    2,841+2直近 7 日のスター増減
  • FluidAudio@FluidInference

    アプリ内で最先端の CoreML 音声モデルを利用可能に — テキスト読み上げ、音声認識、音声区間検出、話者ダイアライゼーション。Swift 製、SOTA のオープンソースを活用。

    2,710+40直近 7 日のスター増減
  • STT@coqui-ai

    🐸STT - 音声認識(Speech-to-Text)のためのディープラーニングツールキット。STT モデルのトレーニングとデプロイがかつてないほど簡単になりました。

    2,605+1直近 7 日のスター増減
  • AudioNotes@harry0703

    音声や動画のコンテンツを素早く抽出し、構造化されたMarkdownノートに整理する

    2,477+39直近 7 日のスター増減
  • audio.cpp@0xShug0

    ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。

    2,128+178直近 7 日のスター増減
  • FireRedASR@FireRedTeam

    中国語、方言、英語をサポートするオープンソースの産業グレード ASR モデル。パブリックな中国語 ASR ベンチマークで新たな SOTA を達成し、優れた歌声の歌詞認識能力も提供します。

    1,974+9直近 7 日のスター増減
  • transcribe.cpp@handy-computer

    16以上のモデルファミリーに対応したggml音声認識(speech-to-text)推論

    1,860+33直近 7 日のスター増減
  • 次世代 AI+IoT フレームワーク(T2/T3/T5AI/ESP32など対応)— 高速な IoT と AI Agent のハードウェア統合

    1,812+12直近 7 日のスター増減
← トピック一覧に戻る