본문으로 건너뛰기
buildradar
Sign in
토픽 · speech

speech

speech 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 74개
  • MARS5-TTS@Camb-ai

    CAMB.AI의 MARS5 음성 모델 (TTS)

    2,818+1최근 7일 스타 변화
  • speechgpt@hahahumble

    💬 SpeechGPT는 ChatGPT와 대화할 수 있게 해주는 웹 애플리케이션입니다.

    2,750-1최근 7일 스타 변화
  • gTTS@pndurette

    Google Translate 텍스트 음성 변환 API와 연동하기 위한 Python 라이브러리 및 CLI 도구

    2,628+0최근 7일 스타 변화
  • ten-vad@TEN-framework

    음성 활동 감지기(VAD): 저지연, 고성능, 경량화

    2,256+7최근 7일 스타 변화
  • IMS-Toucan@DigitalPhonetics

    7000개 이상의 언어를 지원하는 제어 가능하고 빠른 텍스트 음성 변환(TTS)!

    2,207-1최근 7일 스타 변화
  • soloud@jarikomppa

    게임용 무료, 간편 및 휴대용 오디오 엔진

    2,170+3최근 7일 스타 변화
  • openai-edge-tts@travisvn

    OpenAI, Azure, ElevenLabs를 대체할 수 있는 무료 고품질 텍스트 음성 변환 API 엔드포인트

    2,075+5최근 7일 스타 변화
  • Praat: 컴퓨터를 이용한 음성학 연구

    1,970+1최근 7일 스타 변화
  • julius@julius-speech

    오픈소스 대용량 어휘 연속 음성 인식 엔진

    1,935+1최근 7일 스타 변화
  • 오디오 및 음악 기술 분야에서 AI를 다루는 스타트업 커뮤니티 목록

    1,769+1최근 7일 스타 변화
  • SALMONN@bytedance

    SALMONN 제품군: 고급 멀티모달 LLM 모음

    1,521+3최근 7일 스타 변화
  • voicefixer@haoheliu

    일반 음성 복원

    1,375+0최근 7일 스타 변화
  • CrisperWhisper@nyrahealth

    제어 가능한 전사(Transcription) 기능. 단어 수준의 타임스탬프와 함께 축어적(모든 단어, 추임새, 일시 정지, 말더듬, 음성 소리) 또는 의도적(화자가 말하고자 한 내용, 가독성 최적화) 방식으로 제공.

    1,371+13최근 7일 스타 변화
  • nlp-paper@DengBoCong

    자연어 처리 분야 관련 논문(독서 노트 포함), 모델 구현 및 데이터 처리 등 (코드에 TensorFlow 및 PyTorch 두 버전 포함)

    1,333+1최근 7일 스타 변화
  • MTools@HG-ha

    MTools는 오디오/비디오 처리, 이미지 편집, 텍스트 조작 및 코딩 도구가 통합된 강력한 다기능 데스크톱 애플리케이션으로, AI 강화 기능이 내장되어 있습니다. 작업 흐름을 단순화하고 생산성을 향상시키도록 설계되었습니다.

    1,305+5최근 7일 스타 변화
  • StreamSpeech@ictnlp

    StreamSpeech는 오프라인 및 동시 음성 인식, 음성 번역, 음성 합성을 위한 "All in One" 심리스 모델입니다.

    1,288+0최근 7일 스타 변화
  • Deep-Learning-Experiments@roatienza

    딥러닝을 이해하기 위한 비디오, 노트 및 실험

    1,198+0최근 7일 스타 변화
  • lhotse@lhotse-speech

    머신러닝 프로젝트에서 멀티모달 데이터를 처리하기 위한 도구입니다.

    1,149-1최근 7일 스타 변화
  • conformer@sooftware

    "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) 논문의 비공식 PyTorch 구현체

    1,132+1최근 7일 스타 변화
  • pykaldi@pykaldi

    Kaldi용 Python 래퍼

    1,040+1최근 7일 스타 변화
  • FireRedTTS@FireRedTeam

    오픈 소스 LLM 기반 Foundation TTS 시스템

    920+1최근 7일 스타 변화
  • inaSpeechSegmenter@ina-foss

    CNN 기반 오디오 분할 툴킷입니다. 음성, 음악, 소음 및 화자의 성별을 감지할 수 있습니다. 성별별 발화 시간을 기반으로 하는 대규모 성평등 연구를 위해 설계되었습니다.

    910+1최근 7일 스타 변화
  • diffwave@lmnt-com

    DiffWave는 빠르고 고품질인 뉴럴 보코더 및 파형 신시사이저입니다.

    885+0최근 7일 스타 변화
  • AnyGPT@OpenMOSS

    "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling" 논문 코드

    881-1최근 7일 스타 변화
  • PPASR@yeyupiaoling

    PaddlePaddle 기반의 엔드투엔드 중국어 음성 인식 구현. 입문부터 실전까지, 초보자를 위한 간단한 사례와 실용적인 기업 프로젝트 포함. DeepSpeech2, Conformer, Squeezeformer 모델 지원

    870-1최근 7일 스타 변화
  • 네이티브 및 브라우저에서 실행되는 Voxtral ASR & TTS. Burn ML 프레임워크를 사용하여 Mistral의 Voxtral mini 실시간 ASR/TTS를 Rust로 구현

    819+2최근 7일 스타 변화
  • AlphaAvatar@AlphaAvatar

    LiveKit 기반의 실시간 대화형 Omni Avatar로, 오픈소스 아바타 컴포넌트(실시간 모델, 시각, 음성, 메모리, 검색 등)와 원활하게 통합할 수 있습니다.

    813+4최근 7일 스타 변화
  • XR3Player@goxr3plus

    🎧 🎼 가장 진보된 JavaFX 미디어 플레이어

    771+0최근 7일 스타 변화
  • cboard@cboard-org

    브라우저용 텍스트 음성 변환(TTS) 기능이 포함된 보완 대체 의사소통(AAC) 시스템

    755+9최근 7일 스타 변화
  • allosaurus@xinjli

    Allosaurus는 2000개 이상의 언어를 지원하는 사전 학습된 범용 음소 인식기

    746+4최근 7일 스타 변화
← 토픽 목록으로