llm-inference
llm-inference 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 llm-inference 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 llm-inference 태그가 달린 리포지토리예요.
- #1
단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.
★ 6,871 - #2
모든 M시리즈 MacBook에서 약 2GB의 RAM으로 Gemma 4 26B-A4B 추론 수행
★ 6,516 - #3
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #4
LLM 추론 서빙 및 최적화를 위한 10주간, 하루 30분 로드맵. vLLM, SGLang, 양자화, 투기적 디코딩, 벤치마킹.
★ 808 - #5
Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.
★ 624
- #1★ 77,396-4최근 7일 스타 변화
- #2★ 43,647+70최근 7일 스타 변화
- #3★ 29,008+115최근 7일 스타 변화
- #4
본 프로젝트는 대형 모델 관련 기술 원리 및 실전 경험(대형 모델 엔지니어링, 대형 모델 애플리케이션 구현)을 공유하는 것을 목표로 합니다.
★ 24,974+46최근 7일 스타 변화 - #5★ 13,636+17최근 7일 스타 변화
- #6★ 12,523+19최근 7일 스타 변화
- #7★ 10,763+72최근 7일 스타 변화
- #8
로컬 배포를 위한 고속 대형 언어 모델 서빙
★ 9,758+31최근 7일 스타 변화 - #9★ 8,813+18최근 7일 스타 변화
- #10★ 8,033+20최근 7일 스타 변화
- #11★ 7,908+86최근 7일 스타 변화
- #12
AlphaEvolve의 오픈소스 구현체
★ 7,285+36최근 7일 스타 변화 - #13
Plano는 에이전틱 앱을 위한 AI 네이티브 프록시 서버이자 데이터 플레인입니다. 스마트 LLM 라우팅, 관측 가능성, 에이전트 오케스트레이션, 가드레일을 제공하여 에이전트의 핵심 로직에 집중할 수 있도록 지원합니다.
★ 7,022+9최근 7일 스타 변화 - #14
단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.
★ 6,871+485최근 7일 스타 변화 - #15
모든 M시리즈 MacBook에서 약 2GB의 RAM으로 Gemma 4 26B-A4B 추론 수행
★ 6,516+228최근 7일 스타 변화 - #16
FlashInfer: LLM 서빙을 위한 커널 라이브러리
★ 6,283+76최근 7일 스타 변화 - #17★ 5,955+71최근 7일 스타 변화
- #18★ 5,840+25최근 7일 스타 변화
- #19
⚡ 순수 Rust WebGPU 추론 엔진 — OpenAI API 호환, GGUF 네이티브, 모든 GPU에서 실행. Python 없음. llama.cpp 없음. 단일 바이너리.
★ 5,810+35최근 7일 스타 변화 - #20★ 5,572+37최근 7일 스타 변화
- #21
Lemonade는 사용자의 GPU와 NPU에서 직접 최적화된 LLM을 구동하여 로컬 AI 앱을 발견하고 실행할 수 있도록 돕습니다. 디스코드 참여: https://discord.gg/5xXzkMu8Zk
★ 5,530+95최근 7일 스타 변화 - #22
📚 코드와 함께 제공되는 엄선된 Awesome LLM/VLM 추론 논문 목록: Flash-Attention, Paged-Attention, WINT8/4, 병렬화 등 🎉
★ 5,479+8최근 7일 스타 변화 - #23
Superduper: 맞춤형 AI 애플리케이션 및 에이전트 구축을 위한 엔드투엔드 프레임워크
★ 5,317+4최근 7일 스타 변화 - #24★ 4,952+0최근 7일 스타 변화
- #25★ 4,467+27최근 7일 스타 변화
- #26★ 4,257+8최근 7일 스타 변화
- #27
가속화된 인프라 및 마이크로서비스 아키텍처에 최적화된 생성형 AI 레퍼런스 워크플로입니다.
★ 4,165+10최근 7일 스타 변화 - #28★ 3,826-2최근 7일 스타 변화
- #29
스토리와 모델을 구축하기 위한 과학적 방법, 프로세스, 알고리즘 및 시스템 모음입니다.
★ 3,674+2최근 7일 스타 변화 - #30
운영 데이터베이스에 실시간 분석 노드를 추가하세요. Spice는 데이터 기반 AI 애플리케이션 및 에이전트를 위한 Rust 기반의 휴대용 가속 SQL 쿼리, 검색 및 LLM 추론 엔진입니다.
★ 3,074+5최근 7일 스타 변화