llm-inference
Các kho mã nguồn mở đang theo dõi được gắn thẻ llm-inference, sắp xếp theo số sao.
- #61
Suy luận Llama 3+ bằng Java thuần.
★ 816+0Thay đổi số sao trong 7 ngày qua - #62★ 810+8Thay đổi số sao trong 7 ngày qua
- #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: Khai phá tiềm năng của LLM thông qua các hướng dẫn được tuyển chọn, phương pháp thực hành tốt nhất và mã nguồn sẵn sàng sử dụng cho việc huấn luyện và suy luận tùy chỉnh.
★ 731+0Thay đổi số sao trong 7 ngày qua - #64★ 707+0Thay đổi số sao trong 7 ngày qua
- #65
USP: Unified (hay còn gọi là Hybrid, 2D) Sequence Parallel Attention cho việc huấn luyện và suy luận mô hình Transformers ngữ cảnh dài
★ 692+3Thay đổi số sao trong 7 ngày qua - #66
Công cụ suy luận LLM bằng Rust thuần + CUDA — không cần PyTorch, tương thích với OpenAI, hỗ trợ từ Qwen3 đến Kimi-K2.
★ 678+17Thay đổi số sao trong 7 ngày qua - #67★ 677+4Thay đổi số sao trong 7 ngày qua
- #68
Giải mã LLM nhanh hơn tới 4 lần trên Apple Silicon, không mất dữ liệu. Bản port MLX gốc của DSpark từ DeepSeek và DFlash từ z-lab cho giải mã suy đoán — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
★ 645+30Thay đổi số sao trong 7 ngày qua - #69
Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。
★ 627—Thay đổi số sao trong 7 ngày qua - #70★ 613+46Thay đổi số sao trong 7 ngày qua
- #71
Giải pháp thay thế Ollama cho Rockchip NPU: Giải pháp hiệu quả để chạy các mô hình AI và Deep learning trên thiết bị Rockchip với hỗ trợ NPU tối ưu (rkllm)
★ 602+5Thay đổi số sao trong 7 ngày qua - #72
Yet Another Language Model: Suy luận LLM bằng C++/CUDA, không sử dụng thư viện ngoại trừ I/O.
★ 596-1Thay đổi số sao trong 7 ngày qua - #73
SDK AI cục bộ mã nguồn mở - chạy AI trên thiết bị mà không cần đám mây, không cần khóa API. Hỗ trợ GGUF, RAG, tạo hình ảnh, âm nhạc, video, chuyển đổi giọng nói thành văn bản, suy luận P2P và nhiều tính năng khác. Đa nền tảng: Linux, macOS, Windows, Android, iOS.
★ 594+35Thay đổi số sao trong 7 ngày qua - #74
Nền tảng tìm kiếm web tối giản với trợ lý AI chạy trực tiếp từ trình duyệt của bạn. Bản demo: https://felladrin-minisearch.hf.space
★ 585+0Thay đổi số sao trong 7 ngày qua - #75★ 582+0Thay đổi số sao trong 7 ngày qua
- #76★ 580+9Thay đổi số sao trong 7 ngày qua
- #77
Tinh chỉnh (Fine-Tuning) mô hình ngôn ngữ lớn (LLM).
★ 579+1Thay đổi số sao trong 7 ngày qua - #78
Dự án thực hành cho sinh viên, hướng dẫn tự xây dựng khung suy luận mô hình lớn hỗ trợ LLama2/3 và Qwen2.5 từ con số không.
★ 573+1Thay đổi số sao trong 7 ngày qua - #79★ 559+0Thay đổi số sao trong 7 ngày qua
- #80
Công cụ phục vụ LLM với độ trễ thấp và thông lượng cao
★ 521+0Thay đổi số sao trong 7 ngày qua - #81
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 521+17Thay đổi số sao trong 7 ngày qua - #82
Krasis là một runtime LLM lai tập trung vào việc chạy hiệu quả các mô hình lớn trên phần cứng tiêu dùng bị giới hạn VRAM
★ 519+3Thay đổi số sao trong 7 ngày qua - #83
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—Thay đổi số sao trong 7 ngày qua - #84★ 505-1Thay đổi số sao trong 7 ngày qua