본문으로 건너뛰기
buildradar
Sign in
토픽 · llm-inference

llm-inference

llm-inference 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 84개
  • llama3.java@mukel

    순수 Java로 구현한 Llama 3+ 추론 엔진

    816+0최근 7일 스타 변화
  • lws@kubernetes-sigs

    LeaderWorkerSet: 복제 단위로 파드 그룹을 배포하기 위한 API입니다.

    809+7최근 7일 스타 변화
  • LLM-PowerHouse: 엄선된 튜토리얼, 모범 사례, 커스텀 학습 및 추론을 위한 즉시 사용 가능한 코드를 통해 LLM의 잠재력을 극대화합니다.

    731+0최근 7일 스타 변화
  • llmflows@stoyan-stoyanov

    LLMFlows - 간단하고 명시적이며 투명한 LLM 앱

    707+0최근 7일 스타 변화
  • long-context-attention@feifeibear

    USP: 긴 컨텍스트 Transformer 모델 학습 및 추론을 위한 통합(하이브리드, 2D) 시퀀스 병렬 어텐션

    691+3최근 7일 스타 변화
  • pegainfer@pegainfer-project

    Pure Rust + CUDA LLM 추론 엔진 — PyTorch 미사용, OpenAI 호환, Qwen3에서 Kimi-K2까지 서비스 제공

    676+18최근 7일 스타 변화
  • atlas@Avarok-Cybersecurity

    순수 Rust로 작성된 추론 엔진.

    676+3최근 7일 스타 변화
  • mlx-dspark@ARahim3

    Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.

    645+25최근 7일 스타 변화
  • hipfire@warpfront

    Rust로 작성된 RDNA 네이티브 LLM 추론 엔진

    609+45최근 7일 스타 변화
  • rkllama@NotPunchnox

    Rockchip NPU용 Ollama 대안: 최적화된 NPU 지원(rkllm)을 통해 Rockchip 기기에서 AI 및 딥러닝 모델을 실행하는 효율적인 솔루션

    601+4최근 7일 스타 변화
  • yalm@andrewkchan

    Yet Another Language Model: I/O를 제외한 라이브러리 의존성 없이 C++/CUDA로 구현한 LLM 추론 엔진

    596-1최근 7일 스타 변화
  • qvac@tetherto

    오픈소스 로컬 AI SDK - 클라우드나 API 키 없이 기기 내에서 AI를 실행합니다. GGUF, RAG, 이미지·음악·동영상 생성, 음성 인식, P2P 추론 등을 지원합니다. 크로스 플랫폼 지원: Linux, macOS, Windows, Android, iOS.

    591+33최근 7일 스타 변화
  • MiniSearch@felladrin

    브라우저에서 직접 실행되는 AI 어시스턴트가 포함된 미니멀리즘 웹 검색 플랫폼.

    585+0최근 7일 스타 변화
  • uzi@devflowinc

    git worktree를 사용하여 다수의 코딩 에이전트를 병렬로 실행하기 위한 CLI

    582+0최근 7일 스타 변화
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    LLM(대규모 언어 모델) 파인튜닝

    579+1최근 7일 스타 변화
  • LLM-Hub@timmyy123

    로컬 AI 어시스턴트

    578+8최근 7일 스타 변화
  • KuiperLLama@zjhellofss

    신입 채용 및 인턴십을 위한 프로젝트로, LLama2/3 및 Qwen2.5를 지원하는 대규모 언어 모델 추론 프레임워크를 처음부터 직접 구현합니다.

    573+1최근 7일 스타 변화
  • qwen600@yassa9

    정적 suckless 단일 배치 CUDA 전용 qwen3-0.6B 미니 추론 엔진

    559+0최근 7일 스타 변화
  • zero-to-sglang@datawhalechina

    面向大模型开发者的 SGLang 系统化开源教程:从推理基础与环境搭建开始,逐步学习模型部署、结构化生成、服务开发和性能优化, 结合实战案例带你从 0 到 1 掌握 SGLang,构建高性能 LLM 推理应用

    542최근 7일 스타 변화
  • sarathi-serve@microsoft

    LLM을 위한 저지연 및 고처리량 서빙 엔진

    520+0최근 7일 스타 변화
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    519+14최근 7일 스타 변화
  • krasis@brontoguana

    Krasis는 소비자용 VRAM 제한 하드웨어에서 대형 모델을 효율적으로 실행하는 데 중점을 둔 하이브리드 LLM 런타임입니다.

    519+2최근 7일 스타 변화
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    507최근 7일 스타 변화
  • vllm-cli@Chen-zexi

    vLLM을 사용하여 LLM을 서빙하기 위한 명령줄 인터페이스 도구

    505-1최근 7일 스타 변화
← 토픽 목록으로