본문으로 건너뛰기
buildradar
Sign in
토픽 · asr

asr

asr 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 86개
  • sherpa-ncnn@k2-fsa

    인터넷 연결 없이 ncnn을 사용하는 차세대 Kaldi 기반 실시간 음성 인식 및 음성 활동 감지(VAD). iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A 등 지원

    1,777-1최근 7일 스타 변화
  • bailing@wwbin2017

    백령(Bailing)은 ASR+LLM+TTS를 통해 구현된 GPT-4o 유사 음성 대화 봇으로, DeepSeek R1 등 우수한 대형 모델을 통합하고 openClaw를 연동한 진정한 개인용 음성 비서입니다. 지연 시간이 800ms에 불과하며 Mac 등 저사양 환경에서도 실행 가능하고 인터럽트를 지원합니다.

    1,759+2최근 7일 스타 변화
  • dsnote@mkiol

    Speech Note Linux 앱. 오프라인 음성 인식(STT), 음성 합성(TTS) 및 기계 번역을 통한 메모 작성, 읽기 및 번역.

    1,622+8최근 7일 스타 변화
  • video-analyzer@byjlw

    LLM, 컴퓨터 비전 및 자동 음성 인식을 사용하여 비디오를 분석합니다.

    1,570+8최근 7일 스타 변화
  • amical@amicalhq

    🎙️ AI 받아쓰기 앱 - 오픈소스 및 로컬 퍼스트 ⚡ 키보드 없이 3배 더 빠르게 타이핑하세요. 🆓 오픈소스 모델 기반, 오프라인 작동, 빠르고 정확합니다.

    1,520+8최근 7일 스타 변화
  • Fun-ASR@QwenAudio

    FunASR, vLLM, 스트리밍, llama.cpp 런타임을 지원하는 중국어, 방언, 사투리 및 다국어 음성을 위한 오픈소스 LLM 기반 ASR 모델 패밀리

    1,512+10최근 7일 스타 변화
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge는 TTS 생성 모델을 중심으로 개발된 프로젝트로, API 서버 및 Gradio 기반 WebUI를 구현합니다.

    1,418+0최근 7일 스타 변화
  • SoniTranslate@R3gm

    비디오 동기화 번역. 비디오 더빙

    1,413+2최근 7일 스타 변화
  • CrisperWhisper@nyrahealth

    제어 가능한 전사(Transcription) 기능. 단어 수준의 타임스탬프와 함께 축어적(모든 단어, 추임새, 일시 정지, 말더듬, 음성 소리) 또는 의도적(화자가 말하고자 한 내용, 가독성 최적화) 방식으로 제공.

    1,371+13최근 7일 스타 변화
  • voicemode@mbailey

    Claude Code와의 자연스러운 음성 대화

    1,347+6최근 7일 스타 변화
  • VideoChat@Henry-23

    외형과 음성을 맞춤 설정할 수 있고 음성 복제를 지원하며 대화 지연 시간이 3초에 불과한 실시간 음성 대화형 디지털 휴먼.

    1,303-1최근 7일 스타 변화
  • StreamSpeech@ictnlp

    StreamSpeech는 오프라인 및 동시 음성 인식, 음성 번역, 음성 합성을 위한 "All in One" 심리스 모델입니다.

    1,288+0최근 7일 스타 변화
  • vosk-server@alphacep

    Vosk 및 Kaldi 라이브러리 기반의 WebSocket, gRPC, WebRTC 음성 인식 서버

    1,262+1최근 7일 스타 변화
  • Whisper-Finetune@yeyupiaoling

    타임스탬프 데이터 없는 학습, 타임스탬프 데이터가 있는 학습, 음성 데이터 없는 학습을 지원하도록 Whisper 음성 인식 모델을 파인튜닝합니다. 추론을 가속화하고 Web 배포, Windows 데스크톱 배포 및 Android 배포를 지원합니다.

    1,222-1최근 7일 스타 변화
  • speech-swift@soniqo

    Apple Silicon용 AI 음성 toolkit — MLX 및 CoreML 기반 ASR, TTS, 음성 대 음성, VAD 및 화자 분할

    1,161+4최근 7일 스타 변화
  • Mega-ASR@xzf-thu

    실환경을 위해 구축된 최초의 파운데이션 ASR - 7가지 원자적 음향 조건, 54가지 복합 시나리오, 260만 개의 샘플을 포함하며, 기존 모델이 실패하는 환경에서 SOTA 대비 최대 30% 성능 향상

    1,136+3최근 7일 스타 변화
  • conformer@sooftware

    "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020) 논문의 비공식 PyTorch 구현체

    1,132+1최근 7일 스타 변화
  • sglang-omni@sgl-project

    SGLang-Omni는 TTS, ASR, 음성 및 옴니 모델을 위한 고성능 서빙을 지원합니다.

    1,118+143최근 7일 스타 변화
  • violin@shang-zhu

    오픈소스 비디오 번역 스킬

    1,057+8최근 7일 스타 변화
  • Vosk 라이브러리를 사용한 Android용 오프라인 음성 인식

    1,056+0최근 7일 스타 변화
  • murmure@Kieirra

    LLM 후처리가 포함된 완전 로컬, 프라이빗 및 크로스 플랫폼 음성 텍스트 변환(Speech-to-Text)

    1,053+15최근 7일 스타 변화
  • pykaldi@pykaldi

    Kaldi용 Python 래퍼

    1,040+1최근 7일 스타 변화
  • sherpa@k2-fsa

    차세대 Kaldi 기반 음성 인식(STT) 서버 프레임워크

    984+4최근 7일 스타 변화
  • espresso@freewym

    Espresso: 빠르고 통합된 엔드투엔드 신경망 음성 인식 툴킷

    939+0최근 7일 스타 변화
  • vocotype-cli@233stone

    로컬 기기에서 실행되는 프라이버시 중심의 안전한 음성 입력 도구 VocoType. 단축키로 음성을 실시간 텍스트로 변환하여 현재 애플리케이션에 자동으로 입력합니다. 음성-텍스트 MCP, AI 텍스트 최적화, 사용자 정의 대체 사전, 녹음/비디오-텍스트 변환 등의 기능을 지원하여 음성 입력을 더욱 효율적이고 안전하게 만듭니다.

    928+9최근 7일 스타 변화
  • whisper.api@innovatorved

    이 프로젝트는 미세조정 및 처리된 Whisper ASR 모델을 사용하여 음성을 텍스트로 변환하는 사용자 수준 액세스 지원 API를 제공합니다.

    914+0최근 7일 스타 변화
  • SmartJavaAI@geekwenjie

    🔥🔥🔥 자바 무료 오프라인 AI 알고리즘 툴박스. 얼굴 인식, 라이브니스 감지, 표정 인식, 객체 검출, 인스턴스 분할, 보행자 검출, OCR 문자 인식, 번호판 인식, 표 인식, ASR+TTS, 기계 번역 등 기능 지원, Maven 의존성 추가로 사용 가능. PyTorch, Tensorflow 지원, Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5), Whisper 등 주류 모델 통합 완료

    908+3최근 7일 스타 변화
  • Easy-Voice-Toolkit@Spr-Aachen

    음성 인식, 전사, 변환 등을 위한 사용자 친화적인 툴킷 | 간편하게 사용할 수 있는 음성 도구 상자

    873+0최근 7일 스타 변화
  • PPASR@yeyupiaoling

    PaddlePaddle 기반의 엔드투엔드 중국어 음성 인식 구현. 입문부터 실전까지, 초보자를 위한 간단한 사례와 실용적인 기업 프로젝트 포함. DeepSpeech2, Conformer, Squeezeformer 모델 지원

    870-1최근 7일 스타 변화
  • GLM-ASR@zai-org

    GLM-ASR-Nano: 15억 개의 파라미터를 가진 강력한 오픈 소스 음성 인식 모델

    854+3최근 7일 스타 변화
← 토픽 목록으로