Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · llm-inference

llm-inference

Các kho mã nguồn mở đang theo dõi được gắn thẻ llm-inference, sắp xếp theo số sao.

84 kho mã
  • llama3.java@mukel

    Suy luận Llama 3+ bằng Java thuần.

    816+0Thay đổi số sao trong 7 ngày qua
  • lws@kubernetes-sigs

    LeaderWorkerSet: Một API để triển khai nhóm các pod như một đơn vị sao chép

    810+8Thay đổi số sao trong 7 ngày qua
  • LLM-PowerHouse: Khai phá tiềm năng của LLM thông qua các hướng dẫn được tuyển chọn, phương pháp thực hành tốt nhất và mã nguồn sẵn sàng sử dụng cho việc huấn luyện và suy luận tùy chỉnh.

    731+0Thay đổi số sao trong 7 ngày qua
  • llmflows@stoyan-stoyanov

    LLMFlows - Ứng dụng LLM đơn giản, rõ ràng và minh bạch

    707+0Thay đổi số sao trong 7 ngày qua
  • long-context-attention@feifeibear

    USP: Unified (hay còn gọi là Hybrid, 2D) Sequence Parallel Attention cho việc huấn luyện và suy luận mô hình Transformers ngữ cảnh dài

    692+3Thay đổi số sao trong 7 ngày qua
  • pegainfer@pegainfer-project

    Công cụ suy luận LLM bằng Rust thuần + CUDA — không cần PyTorch, tương thích với OpenAI, hỗ trợ từ Qwen3 đến Kimi-K2.

    678+17Thay đổi số sao trong 7 ngày qua
  • atlas@Avarok-Cybersecurity

    Công cụ suy luận (Inference Engine) viết bằng Rust thuần

    677+4Thay đổi số sao trong 7 ngày qua
  • mlx-dspark@ARahim3

    Giải mã LLM nhanh hơn tới 4 lần trên Apple Silicon, không mất dữ liệu. Bản port MLX gốc của DSpark từ DeepSeek và DFlash từ z-lab cho giải mã suy đoán — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

    645+30Thay đổi số sao trong 7 ngày qua
  • zero-to-sglang@datawhalechina

    Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。

    627Thay đổi số sao trong 7 ngày qua
  • hipfire@warpfront

    Công cụ suy luận LLM hỗ trợ RDNA gốc viết bằng Rust

    613+46Thay đổi số sao trong 7 ngày qua
  • rkllama@NotPunchnox

    Giải pháp thay thế Ollama cho Rockchip NPU: Giải pháp hiệu quả để chạy các mô hình AI và Deep learning trên thiết bị Rockchip với hỗ trợ NPU tối ưu (rkllm)

    602+5Thay đổi số sao trong 7 ngày qua
  • yalm@andrewkchan

    Yet Another Language Model: Suy luận LLM bằng C++/CUDA, không sử dụng thư viện ngoại trừ I/O.

    596-1Thay đổi số sao trong 7 ngày qua
  • qvac@tetherto

    SDK AI cục bộ mã nguồn mở - chạy AI trên thiết bị mà không cần đám mây, không cần khóa API. Hỗ trợ GGUF, RAG, tạo hình ảnh, âm nhạc, video, chuyển đổi giọng nói thành văn bản, suy luận P2P và nhiều tính năng khác. Đa nền tảng: Linux, macOS, Windows, Android, iOS.

    594+35Thay đổi số sao trong 7 ngày qua
  • MiniSearch@felladrin

    Nền tảng tìm kiếm web tối giản với trợ lý AI chạy trực tiếp từ trình duyệt của bạn. Bản demo: https://felladrin-minisearch.hf.space

    585+0Thay đổi số sao trong 7 ngày qua
  • uzi@devflowinc

    CLI để chạy số lượng lớn các tác tử lập trình song song với git worktrees

    582+0Thay đổi số sao trong 7 ngày qua
  • LLM-Hub@timmyy123

    Trợ lý AI cục bộ

    580+9Thay đổi số sao trong 7 ngày qua
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    Tinh chỉnh (Fine-Tuning) mô hình ngôn ngữ lớn (LLM).

    579+1Thay đổi số sao trong 7 ngày qua
  • KuiperLLama@zjhellofss

    Dự án thực hành cho sinh viên, hướng dẫn tự xây dựng khung suy luận mô hình lớn hỗ trợ LLama2/3 và Qwen2.5 từ con số không.

    573+1Thay đổi số sao trong 7 ngày qua
  • qwen600@yassa9

    Công cụ suy luận mini qwen3-0.6B tĩnh, chạy trên CUDA, không cần phụ thuộc

    559+0Thay đổi số sao trong 7 ngày qua
  • sarathi-serve@microsoft

    Công cụ phục vụ LLM với độ trễ thấp và thông lượng cao

    521+0Thay đổi số sao trong 7 ngày qua
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    521+17Thay đổi số sao trong 7 ngày qua
  • krasis@brontoguana

    Krasis là một runtime LLM lai tập trung vào việc chạy hiệu quả các mô hình lớn trên phần cứng tiêu dùng bị giới hạn VRAM

    519+3Thay đổi số sao trong 7 ngày qua
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    507Thay đổi số sao trong 7 ngày qua
  • vllm-cli@Chen-zexi

    Công cụ giao diện dòng lệnh để phục vụ LLM sử dụng vLLM

    505-1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề