inference-engine
Các kho mã nguồn mở đang theo dõi được gắn thẻ inference-engine, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng inference-engine trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ inference-engine.
- #1
Mô hình Kimi K3 với 2,78 nghìn tỷ tham số chạy suy luận trên một CPU duy nhất với 8,24 GB RAM. C99 di động: không BLAS, không framework, không GPU.
★ 6.884 - #2
Giải mã LLM nhanh hơn tới 4 lần trên Apple Silicon, không mất dữ liệu. Bản port MLX gốc của DSpark từ DeepSeek và DFlash từ z-lab cho giải mã suy đoán — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624 - #3
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 552
- #1
✍🏻 Phân tích mã nguồn sâu, Thiết kế hệ thống & Blog Kỹ thuật | Halfrost-Field: Ghi chú phân tích mã nguồn, thiết kế hệ thống và thực hành kỹ thuật
★ 13.220+3Thay đổi số sao trong 7 ngày qua - #2
Mô hình Kimi K3 với 2,78 nghìn tỷ tham số chạy suy luận trên một CPU duy nhất với 8,24 GB RAM. C99 di động: không BLAS, không framework, không GPU.
★ 6.884+485Thay đổi số sao trong 7 ngày qua - #3
FEDML - Thư viện ML thống nhất và có khả năng mở rộng cho việc huấn luyện phân tán quy mô lớn, phục vụ mô hình và học liên hợp. FEDML Launch, một bộ lập lịch đa đám mây, hỗ trợ chạy bất kỳ tác vụ AI nào trên bất kỳ đám mây GPU hoặc cụm máy chủ nội bộ nào. Được xây dựng trên thư viện này, TensorOpera AI (https://TensorOpera.ai) là nền tảng AI tạo sinh quy mô lớn của bạn.
★ 4.061-1Thay đổi số sao trong 7 ngày qua - #4
Dự án tốt cho tuyển dụng trường, thu đông, xuân và thực tập! Hướng dẫn bạn tự tay triển khai thư viện suy luận deep learning hiệu suất cao từ con số không, hỗ trợ suy luận các mô hình lớn như llama2, Unet, Yolov5, Resnet, v.v.
★ 3.497+1Thay đổi số sao trong 7 ngày qua - #5
Triển khai côngengine quy tắc bằng Golang
★ 2.522+0Thay đổi số sao trong 7 ngày qua - #6★ 1.964+1Thay đổi số sao trong 7 ngày qua
- #7★ 1.844+2Thay đổi số sao trong 7 ngày qua
- #8
Tốc độ nhanh hơn 3x trên MLX | Qwen 3.8 27B | Giải mã dự đoán MTP gốc trên Apple Silicon mà không cần trình nháp ngoài.
★ 1.805+235Thay đổi số sao trong 7 ngày qua - #9
Một công cụ suy luận hiệu năng cao cho các mô hình LLM, VLM, DiT và REC, được tối ưu hóa cho nhiều bộ tăng tốc AI khác nhau. Được lưu trữ tại OpenAtom Foundation.
★ 1.541+12Thay đổi số sao trong 7 ngày qua - #10
Qualcomm® AI Hub Models là bộ sưu tập các mô hình học máy tiên tiến được tối ưu hóa về hiệu suất (độ trễ, bộ nhớ, v.v.) và sẵn sàng triển khai trên các thiết bị Qualcomm®.
★ 1.194+3Thay đổi số sao trong 7 ngày qua - #11★ 1.145+5Thay đổi số sao trong 7 ngày qua
- #12
Paddle.js là một dự án web dành cho Baidu PaddlePaddle, một framework học sâu mã nguồn mở chạy trong trình duyệt. Paddle.js có thể tải mô hình đã được huấn luyện trước hoặc chuyển đổi mô hình từ paddle-hub bằng các công cụ chuyển đổi mô hình do Paddle.js cung cấp. Nó có thể chạy trên mọi trình duyệt hỗ trợ WebGL/WebGPU/WebAssembly, cũng như chạy trong Baidu Smartprogram và tiểu chương trình WeChat.
★ 1.103+0Thay đổi số sao trong 7 ngày qua - #13
NobodyWho là một công cụ suy luận cho phép bạn chạy LLMs cục bộ và hiệu quả trên mọi thiết bị.
★ 1.081+11Thay đổi số sao trong 7 ngày qua - #14
MLX Studio - Nơi của JANG_Q - Tạo/Chỉnh sửa Ảnh + Trò chuyện/Mã nguồn Tất cả trong một - + OpenClaw (Anthropic API)
★ 960+11Thay đổi số sao trong 7 ngày qua - #15
Một công cụ tăng tốc suy luận LLM được tối ưu hóa cao cho Llama và các biến thể của nó.
★ 908+0Thay đổi số sao trong 7 ngày qua - #16
Khung làm việc về thị giác máy tính và phân tích video bằng Python với đầy đủ tính năng tích hợp
★ 849+1Thay đổi số sao trong 7 ngày qua - #17
Công cụ suy luận LLM bằng Rust thuần + CUDA — không cần PyTorch, tương thích với OpenAI, hỗ trợ từ Qwen3 đến Kimi-K2.
★ 660+4Thay đổi số sao trong 7 ngày qua - #18
Giải mã LLM nhanh hơn tới 4 lần trên Apple Silicon, không mất dữ liệu. Bản port MLX gốc của DSpark từ DeepSeek và DFlash từ z-lab cho giải mã suy đoán — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 624+98Thay đổi số sao trong 7 ngày qua - #19
Yet Another Language Model: Suy luận LLM bằng C++/CUDA, không sử dụng thư viện ngoại trừ I/O.
★ 597+1Thay đổi số sao trong 7 ngày qua - #20★ 582+1Thay đổi số sao trong 7 ngày qua
- #21
Dự án thực hành cho sinh viên, hướng dẫn tự xây dựng khung suy luận mô hình lớn hỗ trợ LLama2/3 và Qwen2.5 từ con số không.
★ 572+9Thay đổi số sao trong 7 ngày qua - #22
Từ mô hình giáo viên đến mô hình tối ưu — engine chưng cất & phục vụ LLM từ đầu: các kernel Triton/CUDA tùy chỉnh, chưng cất FSDP, phân trang KV batching liên tục, giải mã suy đoán, gateway Rust, oracle JAX và công cụ diễn giải.
★ 552+35Thay đổi số sao trong 7 ngày qua - #23
Krasis là một runtime LLM lai tập trung vào việc chạy hiệu quả các mô hình lớn trên phần cứng tiêu dùng bị giới hạn VRAM
★ 516+3Thay đổi số sao trong 7 ngày qua - #24
Công cụ suy luận cho các thiết bị Intel. Phục vụ các mô hình LLM, VLM, Whisper, Kokoro-TTS, Embedding và Rerank thông qua các điểm cuối OpenAI.
★ 513+4Thay đổi số sao trong 7 ngày qua