Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · speech

speech

Các kho mã nguồn mở đang theo dõi được gắn thẻ speech, sắp xếp theo số sao.

74 kho mã
  • MARS5-TTS@Camb-ai

    Mô hình giọng nói MARS5 (TTS) từ CAMB.AI

    2.818+1Thay đổi số sao trong 7 ngày qua
  • speechgpt@hahahumble

    💬 SpeechGPT là một ứng dụng web cho phép bạn trò chuyện với ChatGPT.

    2.750-1Thay đổi số sao trong 7 ngày qua
  • gTTS@pndurette

    Thư viện Python và công cụ CLI để giao tiếp với API chuyển đổi văn bản thành giọng nói của Google Translate

    2.628+0Thay đổi số sao trong 7 ngày qua
  • ten-vad@TEN-framework

    Trình phát hiện hoạt động giọng nói (VAD): độ trễ thấp, hiệu suất cao và nhẹ

    2.256+7Thay đổi số sao trong 7 ngày qua
  • IMS-Toucan@DigitalPhonetics

    Chuyển văn bản thành giọng nói có thể kiểm soát và nhanh chóng cho hơn 7000 ngôn ngữ!

    2.207-1Thay đổi số sao trong 7 ngày qua
  • soloud@jarikomppa

    Côngengine âm thanh miễn phí, dễ sử dụng và di động cho trò chơi

    2.170+3Thay đổi số sao trong 7 ngày qua
  • openai-edge-tts@travisvn

    Endpoint API chuyển văn bản thành giọng nói miễn phí, chất lượng cao để thay thế OpenAI, Azure hoặc ElevenLabs

    2.075+5Thay đổi số sao trong 7 ngày qua
  • Praat: Phân tích ngữ âm bằng máy tính

    1.970+1Thay đổi số sao trong 7 ngày qua
  • julius@julius-speech

    Công cụ nhận dạng giọng nói liên tục từ vựng lớn mã nguồn mở

    1.935+1Thay đổi số sao trong 7 ngày qua
  • Danh sách cộng đồng các startup hoạt động trong lĩnh vực công nghệ âm thanh và AI âm nhạc

    1.769+1Thay đổi số sao trong 7 ngày qua
  • SALMONN@bytedance

    Dòng SALMONN: Bộ LLM đa phương thức tiên tiến

    1.521+3Thay đổi số sao trong 7 ngày qua
  • voicefixer@haoheliu

    Khôi phục giọng nói chung

    1.375+0Thay đổi số sao trong 7 ngày qua
  • CrisperWhisper@nyrahealth

    Bản ghi âm có thể điều khiển. Nguyên văn (mọi từ đệm, khoảng dừng, lắp bắp, âm thanh phát ra), hoặc theo ý định (ý người nói muốn diễn đạt, được tối ưu hóa cho khả năng đọc) với dấu thời gian ở cấp độ từ.

    1.371+13Thay đổi số sao trong 7 ngày qua
  • nlp-paper@DengBoCong

    Các bài báo liên quan trong lĩnh vực xử lý ngôn ngữ tự nhiên (kèm ghi chú đọc), tái hiện mô hình và xử lý dữ liệu (mã nguồn có cả hai phiên bản TensorFlow và PyTorch)

    1.333+1Thay đổi số sao trong 7 ngày qua
  • MTools@HG-ha

    MTools là một ứng dụng máyδ để bàn đa chức năng mạnh mẽ, tích hợp các công cụ xử lý âm thanh/video, chỉnh sửa hình ảnh, thao tác văn bản và mã hóa, với các tính năng nâng cao bằng AI tích hợp. Được thiết kế để đơn giản hóa quy trình làm việc và nâng cao năng suất của bạn.

    1.305+5Thay đổi số sao trong 7 ngày qua
  • StreamSpeech@ictnlp

    StreamSpeech là một mô hình liền mạch "tất cả trong một" dành cho nhận dạng giọng nói ngoại tuyến và đồng thời, dịch giọng nói và tổng hợp giọng nói.

    1.288+0Thay đổi số sao trong 7 ngày qua
  • Deep-Learning-Experiments@roatienza

    Video, ghi chú và các thí nghiệm để tìm hiểu về deep learning

    1.198+0Thay đổi số sao trong 7 ngày qua
  • lhotse@lhotse-speech

    Các công cụ để xử lý dữ liệu đa phương thức trong các dự án học máy.

    1.149-1Thay đổi số sao trong 7 ngày qua
  • conformer@sooftware

    [Không chính thức] Triển khai bằng PyTorch của "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

    1.132+1Thay đổi số sao trong 7 ngày qua
  • pykaldi@pykaldi

    Một trình bao bọc Python cho Kaldi

    1.040+1Thay đổi số sao trong 7 ngày qua
  • FireRedTTS@FireRedTeam

    Hệ thống TTS nền tảng mã nguồn mở được hỗ trợ bởi LLM

    920+1Thay đổi số sao trong 7 ngày qua
  • inaSpeechSegmenter@ina-foss

    Bộ công cụ phân đoạn âm thanh dựa trên CNN. Cho phép phát hiện giọng nói, âm nhạc, tiếng ồn và giới tính người nói. Được thiết kế cho các nghiên cứu bình đẳng giới quy mô lớn dựa trên thời gian nói theo giới tính.

    910+1Thay đổi số sao trong 7 ngày qua
  • diffwave@lmnt-com

    DiffWave là một bộ tổng hợp dạng sóng và bộ tạo giọng nói neural nhanh chóng, chất lượng cao.

    885+0Thay đổi số sao trong 7 ngày qua
  • AnyGPT@OpenMOSS

    Mã nguồn cho "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling"

    881-1Thay đổi số sao trong 7 ngày qua
  • PPASR@yeyupiaoling

    Triển khai nhận dạng giọng nói tiếng Trung đầu cuối dựa trên PaddlePaddle, từ cơ bản đến thực tế, với các ví dụ nhập môn đơn giản và dự án doanh nghiệp thiết thực. Hỗ trợ các mô hình phổ biến hiện nay như DeepSpeech2, Conformer và Squeezeformer.

    870-1Thay đổi số sao trong 7 ngày qua
  • Voxtral ASR & TTS chạy nguyên bản và trên trình duyệt. Một triển khai Rust của Voxtral mini realtime ASR/TTS từ Mistral sử dụng framework Burn ML.

    819+2Thay đổi số sao trong 7 ngày qua
  • AlphaAvatar@AlphaAvatar

    Omni Avatar tương tác thời gian thực được xây dựng trên LiveKit, cho phép tích hợp liền mạch với bất kỳ thành phần Avatar mã nguồn mở nào (mô hình thời gian thực, hình ảnh, giọng nói, bộ nhớ, tìm kiếm, v.v.).

    813+4Thay đổi số sao trong 7 ngày qua
  • XR3Player@goxr3plus

    Trình phát đa phương tiện JavaFX TIÊN TIẾN NHẤT.

    771+0Thay đổi số sao trong 7 ngày qua
  • cboard@cboard-org

    Hệ thống giao tiếp tăng cường và thay thế (AAC) với tính năng chuyển văn bản thành giọng nói trên trình duyệt.

    755+9Thay đổi số sao trong 7 ngày qua
  • allosaurus@xinjli

    Allosaurus là bộ nhận diện âm vị phổ quát được huấn luyện trước cho hơn 2000 ngôn ngữ.

    746+4Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề