llm-inference
llm-inference 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #61
순수 Java로 구현한 Llama 3+ 추론 엔진
★ 816+0최근 7일 스타 변화 - #62★ 809+7최근 7일 스타 변화
- #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: 엄선된 튜토리얼, 모범 사례, 커스텀 학습 및 추론을 위한 즉시 사용 가능한 코드를 통해 LLM의 잠재력을 극대화합니다.
★ 731+0최근 7일 스타 변화 - #64★ 707+0최근 7일 스타 변화
- #65
USP: 긴 컨텍스트 Transformer 모델 학습 및 추론을 위한 통합(하이브리드, 2D) 시퀀스 병렬 어텐션
★ 691+3최근 7일 스타 변화 - #66
Pure Rust + CUDA LLM 추론 엔진 — PyTorch 미사용, OpenAI 호환, Qwen3에서 Kimi-K2까지 서비스 제공
★ 676+18최근 7일 스타 변화 - #67★ 676+3최근 7일 스타 변화
- #68
Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.
★ 645+25최근 7일 스타 변화 - #69★ 609+45최근 7일 스타 변화
- #70
Rockchip NPU용 Ollama 대안: 최적화된 NPU 지원(rkllm)을 통해 Rockchip 기기에서 AI 및 딥러닝 모델을 실행하는 효율적인 솔루션
★ 601+4최근 7일 스타 변화 - #71★ 596-1최근 7일 스타 변화
- #72
오픈소스 로컬 AI SDK - 클라우드나 API 키 없이 기기 내에서 AI를 실행합니다. GGUF, RAG, 이미지·음악·동영상 생성, 음성 인식, P2P 추론 등을 지원합니다. 크로스 플랫폼 지원: Linux, macOS, Windows, Android, iOS.
★ 591+33최근 7일 스타 변화 - #73
브라우저에서 직접 실행되는 AI 어시스턴트가 포함된 미니멀리즘 웹 검색 플랫폼.
★ 585+0최근 7일 스타 변화 - #74★ 582+0최근 7일 스타 변화
- #75
LLM(대규모 언어 모델) 파인튜닝
★ 579+1최근 7일 스타 변화 - #76★ 578+8최근 7일 스타 변화
- #77
신입 채용 및 인턴십을 위한 프로젝트로, LLama2/3 및 Qwen2.5를 지원하는 대규모 언어 모델 추론 프레임워크를 처음부터 직접 구현합니다.
★ 573+1최근 7일 스타 변화 - #78★ 559+0최근 7일 스타 변화
- #79
面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用
★ 542—최근 7일 스타 변화 - #80
LLM을 위한 저지연 및 고처리량 서빙 엔진
★ 520+0최근 7일 스타 변화 - #81
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 519+14최근 7일 스타 변화 - #82★ 519+2최근 7일 스타 변화
- #83
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—최근 7일 스타 변화 - #84★ 505-1최근 7일 스타 변화