メインコンテンツへスキップ
buildradar
Sign in
トピック · speech

speech

speech がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

74 件のリポジトリ
  • MARS5-TTS@Camb-ai

    CAMB.AI の MARS5 音声モデル (TTS)

    2,818+1直近 7 日のスター増減
  • speechgpt@hahahumble

    💬 SpeechGPT は、ChatGPT と会話できるようにする Web アプリケーションです。

    2,750-1直近 7 日のスター増減
  • gTTS@pndurette

    Google 翻訳のテキスト読み上げ API と連携するための Python ライブラリおよび CLI ツール

    2,628+0直近 7 日のスター増減
  • ten-vad@TEN-framework

    音声活動検出 (VAD) : 低レイテンシ、高性能、軽量

    2,256+7直近 7 日のスター増減
  • IMS-Toucan@DigitalPhonetics

    7,000以上の言語に対応する、制御可能で高速なテキスト読み上げ(TTS)!

    2,207-1直近 7 日のスター増減
  • soloud@jarikomppa

    ゲーム向けの、無料で使いやすく、ポータブルなオーディオエンジン。

    2,170+3直近 7 日のスター増減
  • openai-edge-tts@travisvn

    OpenAI、Azure、ElevenLabs の代替となる、無料かつ高品質なテキスト読み上げ(TTS)API エンドポイント

    2,075+5直近 7 日のスター増減
  • Praat:コンピュータによる音声学の分析ツール

    1,970+1直近 7 日のスター増減
  • julius@julius-speech

    オープンソースの大語彙連続音声認識エンジン

    1,935+1直近 7 日のスター増減
  • 音声および音楽技術分野のAIを活用するスタートアップ企業のコミュニティリスト

    1,769+1直近 7 日のスター増減
  • SALMONN@bytedance

    SALMONN ファミリー:高度なマルチモーダル LLM のスイート

    1,521+3直近 7 日のスター増減
  • voicefixer@haoheliu

    汎用音声修復

    1,375+0直近 7 日のスター増減
  • CrisperWhisper@nyrahealth

    制御可能な文字起こし。単語単位のタイムスタンプ付きで、逐語的(フィラー、ポーズ、言い淀み、発声を含む)または意図通り(話し手の意図を反映し、読みやすさを最適化)の出力が可能

    1,371+13直近 7 日のスター増減
  • nlp-paper@DengBoCong

    自然言語処理分野の関連論文(読書ノート付き)、モデルの再現、データ処理など(TensorFlowとPyTorchの両方のバージョンのコードを含む)

    1,333+1直近 7 日のスター増減
  • MTools@HG-ha

    MToolsは、音声・動画処理、画像編集、テキスト操作、コーディングツールを統合し、AI拡張機能を内蔵した強力な多機能デスクトップアプリケーションです。ワークフローの簡素化と生産性の向上のために設計されています

    1,305+5直近 7 日のスター増減
  • StreamSpeech@ictnlp

    StreamSpeech は、オフラインおよび同時音声認識、音声翻訳、音声合成のための「オールインワン」シームレスモデルです。

    1,288+0直近 7 日のスター増減
  • Deep-Learning-Experiments@roatienza

    ディープラーニングを理解するための動画、ノート、実験

    1,198+0直近 7 日のスター増減
  • lhotse@lhotse-speech

    機械学習プロジェクトにおけるマルチモーダルデータを処理するためのツール

    1,149-1直近 7 日のスター増減
  • conformer@sooftware

    [非公式] 「Conformer: Convolution-augmented Transformer for Speech Recognition」(INTERSPEECH 2020) の PyTorch 実装

    1,132+1直近 7 日のスター増減
  • pykaldi@pykaldi

    Kaldi用のPythonラッパー

    1,040+1直近 7 日のスター増減
  • FireRedTTS@FireRedTeam

    オープンソースのLLMを活用した基盤TTSシステム

    921+2直近 7 日のスター増減
  • inaSpeechSegmenter@ina-foss

    CNNベースの音声セグメンテーションツールキット。音声、音楽、ノイズ、話者の性別の検出が可能。性別ごとの発話時間に基づく大規模な男女平等調査向けに設計されています。

    910+1直近 7 日のスター増減
  • diffwave@lmnt-com

    DiffWave は、高速で高品質なニューラルボコーダーおよび波形シンセサイザーです。

    885+0直近 7 日のスター増減
  • AnyGPT@OpenMOSS

    「AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling」のコード

    882+0直近 7 日のスター増減
  • PPASR@yeyupiaoling

    PaddlePaddleに基づくエンドツーエンドの中国語音声認識。入門から実践まで、非常にシンプルな入門ケースと実用的なエンタープライズプロジェクト。現在最も人気のDeepSpeech2、Conformer、Squeezeformerモデルをサポート

    870-1直近 7 日のスター増減
  • Voxtral ASR と TTS をネイティブおよびブラウザ上で実行。Burn ML フレームワークを使用した Mistral の Voxtral mini リアルタイム ASR / TTS の Rust 実装

    819+2直近 7 日のスター増減
  • AlphaAvatar@AlphaAvatar

    LiveKit上に構築されたリアルタイム対話型Omni Avatar。オープンソースのAvatarコンポーネント(リアルタイムモデル、ビジュアル、音声、メモリ、検索など)とシームレスに統合可能。

    813+4直近 7 日のスター増減
  • XR3Player@goxr3plus

    🎧 🎼 最も高度なJavaFXメディアプレイヤー

    771+0直近 7 日のスター増減
  • cboard@cboard-org

    ブラウザ向けのテキスト読み上げ機能付き拡大・代替コミュニケーション(AAC)システム

    750+4直近 7 日のスター増減
  • allosaurus@xinjli

    Allosaurusは、2000以上の言語に対応する事前トレーニング済み汎用音声認識エンジンです

    745+3直近 7 日のスター増減
← トピック一覧に戻る