メインコンテンツへスキップ
buildradar
Sign in
トピック · speech-to-text

speech-to-text

speech-to-text がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
152
総スター数
640,857
平均スター数
4,216
シェア
0.03%

speech-to-text と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、speech-to-text がタグ付けされたリポジトリ。

  • audio.cpp@0xShug0

    ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。

    2,214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    970
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    541
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    541
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • whisper.cpp@ggml-org

    OpenAIのWhisperモデルのC/C++ポート

    53,389+103直近 7 日のスター増減
  • Handy@cjpais

    完全オフラインで動作する、無料のオープンソースで拡張可能な音声認識(speech-to-text)アプリケーション。

    30,916+280直近 7 日のスター増減
  • meetily@Zackriya-Solutions

    プライバシー優先のAI会議アシスタント。Rustベースで、Parakeet/Whisperのライブ文字起こし、話者ダイアライゼーション、Ollama要約を4倍高速化。100%ローカル処理。クラウド不要。Meetily (Meetly Ai - https://meetily.ai) はmacOSおよびWindows向けのNo.1セルフホスト型オープンソースAI会議ノートテイカー。議事録の書き方を知る

    30,252+195直近 7 日のスター増減
  • llamafile@mozilla-ai

    単一ファイルでLLMを配布・実行

    25,859+113直近 7 日のスター増減
  • faster-whisper@SYSTRAN

    CTranslate2による高速なWhisper文字起こし

    25,206+71直近 7 日のスター増減
  • whisperX@m-bain

    WhisperX:単語レベルのタイムスタンプ(および話者分離)を備えた自動音声認識

    23,864+61直近 7 日のスター増減
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | 画面をローカルで継続的に記録し、エージェント(Claude, Codex, Openclaw, Hermes, Runner...)にコンテキストを提供

    21,376+80直近 7 日のスター増減
  • FunASR@modelscope

    トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット

    20,136+64直近 7 日のスター増減
  • pyvideotrans@jianchang512

    動画をある言語から別の言語に翻訳し、ダビングと字幕を埋め込む。

    18,871+38直近 7 日のスター増減
  • leon@leon-ai

    🧠 Leonはあなたのオープンソースのパーソナルアシスタントです。

    17,476+1直近 7 日のスター増減
  • kaldi@kaldi-asr

    kaldi-asr/kaldiはKaldiプロジェクトの公式リポジトリです。

    15,474+3直近 7 日のスター増減
  • vosk-api@alphacep

    Python、Java、C#、Nodeに対応した、Android、iOS、Raspberry Piおよびサーバー向けのオフライン音声認識API

    15,101+17直近 7 日のスター増減
  • VoiceStudio@debpalash

    VoiceStudioは、完全にローカルで動作するオープンソースのElevenLabs代替ツールです。646言語で音声クローニング、音声デザイン、ビデオダビング、ディクテーション、文字起こし、オーディオブック作成に対応しています。

    14,835+2,880直近 7 日のスター増減
  • sherpa-onnx@k2-fsa

    インターネット接続なしで、次世代Kaldiとonnxruntimeを使用した音声認識(Speech-to-text)、テキスト読み上げ(text-to-speech)、話者ダイアライゼーション、音声強調、ソース分離、VADを提供。組み込みシステム、Android、iOS、HarmonyOS、Raspberry Pi、RISC-V、RK NPU、Axera NPU、Ascend NPU、x86_64サーバー、websocketサーバー/クライアントをサポートし、12のプログラミング言語に対応。

    14,575+95直近 7 日のスター増減
  • speech-to-speech@huggingface

    オープンソースモデルでボイスエージェントを構築

    13,015+82直近 7 日のスター増減
  • voice-pro@abus-aikorea

    クリエイターと開発者のためのGradio WebUI。主要なTTS (Edge-TTS, kokoro) およびゼロショット音声クローニング (E2 & F5-TTS, CosyVoice) を特徴とし、Whisperオーディオ処理、YouTubeダウンロード、Demucsによるボーカル分離、多言語翻訳に対応。

    12,730+54直近 7 日のスター増減
  • speechbrain@speechbrain

    PyTorchベースの音声ツールキット

    11,802+10直近 7 日のスター増減
  • WhisperLiveKit@QuentinFuxa

    ストリーミングASR、話者ダイアライゼーション、翻訳、およびOpenAI/Deepgram互換APIを備えたリアルタイムローカル音声認識

    10,990+16直近 7 日のスター増減
  • RealtimeSTT@KoljaB

    高度な音声アクティビティ検出、ウェイクワード起動、即時文字起こしを備えた、堅牢で効率的、低遅延の音声認識ライブラリ。

    10,108+18直近 7 日のスター増減
  • SenseVoice@QwenAudio

    Mandarin、Cantonese、English、Japanese、Korean向けのオープンソースのSenseVoiceSmallモデル。ASR、言語ID、感情認識、音声イベント検出に対応。

    9,209+37直近 7 日のスター増減
  • Python用の音声認識モジュール。複数のエンジンとAPIをサポートし、オンラインおよびオフラインに対応。

    8,987+0直近 7 日のスター増減
  • 深層学習ベースの中国語音声認識システム (Deep-Learning-Based Chinese Speech Recognition System)

    8,386+0直近 7 日のスター増減
  • mlx-audio@Blaizzy

    AppleのMLXフレームワーク上に構築された、テキスト読み上げ (TTS)、音声認識 (STT)、音声合成 (STS) のライブラリ。Apple Silicon上での効率的な音声分析を提供。

    7,826+23直近 7 日のスター増減
  • annyang@TalAter

    💬 あなたのサイト用の音声認識

    6,815-1直近 7 日のスター増減
  • argmax-oss-swift@argmaxinc

    Apple Silicon向けオンデバイス音声AI

    6,353+8直近 7 日のスター増減
  • FunClip@modelscope

    FunASRを搭載した動画文字起こし、字幕生成、LLM支援型クリッピングツール(ローカルGradio UI付き)

    6,210+13直近 7 日のスター増減
  • openwhispr@OpenWhispr

    ローカル(Nvidia Parakeet/Whisper)およびクラウドモデル(BYOK)を備えた音声入力(Voice-to-text)辞書アプリ。プライバシー優先でクロスプラットフォーム対応。

    6,133+305直近 7 日のスター増減
  • silero-models@snakers4

    Silero Models: 驚くほどシンプルな事前学習済みテキスト読み上げモデル

    6,084-1直近 7 日のスター増減
  • ODS@Osmantic

    PC、Mac、またはLinuxマシンをAIサーバーに変えましょう。LLM推論、チャットUI、音声、エージェント、ワークフロー、RAG、画像生成に対応。

    5,931+1,108直近 7 日のスター増減
  • whisper-diarization@MahmoudAshraf97

    OpenAI Whisperに基づく話者ダイアライゼーション付き自動音声認識

    5,634+1直近 7 日のスター増減
← トピック一覧に戻る