본문으로 건너뛰기
buildradar
Sign in
토픽 · llm-inference

llm-inference

llm-inference 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
81
총 스타
404,768
평균 스타
4,997
비중
0.02%

같은 리포지토리에 llm-inference 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 llm-inference 태그가 달린 리포지토리예요.

  • kimi-k3-in-c@FareedKhan-dev

    단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.

    6,871
  • turbo-fieldfare@drumih

    모든 M시리즈 MacBook에서 약 2GB의 RAM으로 Gemma 4 26B-A4B 추론 수행

    6,516
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • LLM 추론 서빙 및 최적화를 위한 10주간, 하루 30분 로드맵. vLLM, SGLang, 양자화, 투기적 디코딩, 벤치마킹.

    808
  • mlx-dspark@ARahim3

    Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.

    624
  • gpt4all@nomic-ai

    GPT4All: 모든 기기에서 로컬 LLM을 실행하세요. 오픈소스이며 상업적 이용이 가능합니다.

    77,396-4최근 7일 스타 변화
  • ray@ray-project

    Ray는 AI 연산 엔진입니다. 코어 분산 런타임과 ML 워크로드를 가속화하는 AI 라이브러리 세트로 구성되어 있습니다.

    43,647+70최근 7일 스타 변화
  • gitleaks@gitleaks

    Gitleaks로 시크릿 정보 탐색 🔑

    29,008+115최근 7일 스타 변화
  • llm-action@liguodongiot

    본 프로젝트는 대형 모델 관련 기술 원리 및 실전 경험(대형 모델 엔지니어링, 대형 모델 애플리케이션 구현)을 공유하는 것을 목표로 합니다.

    24,974+46최근 7일 스타 변화
  • litgpt@Lightning-AI

    대규모 사전 학습, 파인튜닝, 배포를 위한 레시피가 포함된 20개 이상의 고성능 LLM.

    13,636+17최근 7일 스타 변화
  • OpenLLM@bentoml

    DeepSeek 및 Llama 같은 오픈소스 LLM을 클라우드에서 OpenAI 호환 API 엔드포인트로 실행하세요.

    12,523+19최근 7일 스타 변화
  • openvino@openvinotoolkit

    OpenVINO™는 AI 추론 최적화 및 배포를 위한 오픈 소스 툴킷입니다

    10,763+72최근 7일 스타 변화
  • PowerInfer@Tiiny-AI

    로컬 배포를 위한 고속 대형 언어 모델 서빙

    9,758+31최근 7일 스타 변화
  • BentoML@bentoml

    AI 앱과 모델을 서빙하는 가장 쉬운 방법 - 모델 추론 API, 작업 큐, LLM 앱, 멀티 모델 파이프라인 등을 구축하세요!

    8,813+18최근 7일 스타 변화
  • lmdeploy@InternLM

    LMDeploy는 LLM 압축, 배포 및 서빙을 위한 툴킷입니다.

    8,033+20최근 7일 스타 변화
  • dynamo@ai-dynamo

    데이터센터 규모의 분산 추론 서빙 프레임워크

    7,908+86최근 7일 스타 변화
  • openevolve@algorithmicsuperintelligence

    AlphaEvolve의 오픈소스 구현체

    7,285+36최근 7일 스타 변화
  • plano@katanemo

    Plano는 에이전틱 앱을 위한 AI 네이티브 프록시 서버이자 데이터 플레인입니다. 스마트 LLM 라우팅, 관측 가능성, 에이전트 오케스트레이션, 가드레일을 제공하여 에이전트의 핵심 로직에 집중할 수 있도록 지원합니다.

    7,022+9최근 7일 스타 변화
  • kimi-k3-in-c@FareedKhan-dev

    단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.

    6,871+485최근 7일 스타 변화
  • turbo-fieldfare@drumih

    모든 M시리즈 MacBook에서 약 2GB의 RAM으로 Gemma 4 26B-A4B 추론 수행

    6,516+228최근 7일 스타 변화
  • flashinfer@flashinfer-ai

    FlashInfer: LLM 서빙을 위한 커널 라이브러리

    6,283+76최근 7일 스타 변화
  • cactus@cactus-compute

    모바일, 웨어러블, 스마트 홈, 로봇을 위한 양자화, 커널, 런타임 및 추론 엔진

    5,955+71최근 7일 스타 변화
  • kserve@kserve

    Kubernetes에서의 확장 가능한 멀티 프레임워크 배포를 위한 표준화된 분산 생성형 및 예측형 AI 추론 플랫폼

    5,840+25최근 7일 스타 변화
  • shimmy@Michael-A-Kuykendall

    ⚡ 순수 Rust WebGPU 추론 엔진 — OpenAI API 호환, GGUF 네이티브, 모든 GPU에서 실행. Python 없음. llama.cpp 없음. 단일 바이너리.

    5,810+35최근 7일 스타 변화
  • gpustack@gpustack

    고성능 AI 모델 서빙(vLLM, SGLang) 및 온디맨드 SSH 접근 가능 GPU 인스턴스를 위한 GPU 클러스터 관리자

    5,572+37최근 7일 스타 변화
  • lemonade@lemonade-sdk

    Lemonade는 사용자의 GPU와 NPU에서 직접 최적화된 LLM을 구동하여 로컬 AI 앱을 발견하고 실행할 수 있도록 돕습니다. 디스코드 참여: https://discord.gg/5xXzkMu8Zk

    5,530+95최근 7일 스타 변화
  • Awesome-LLM-Inference@xlite-dev

    📚 코드와 함께 제공되는 엄선된 Awesome LLM/VLM 추론 논문 목록: Flash-Attention, Paged-Attention, WINT8/4, 병렬화 등 🎉

    5,479+8최근 7일 스타 변화
  • superduper@superduper-io

    Superduper: 맞춤형 AI 애플리케이션 및 에이전트 구축을 위한 엔드투엔드 프레임워크

    5,317+4최근 7일 스타 변화
  • eko@FellouAI

    Eko (Eko Keeps Operating) - 자연어로 프로덕션준비된 Agentic Workflow 구축 - eko.fellou.ai

    4,952+0최근 7일 스타 변화
  • RuVector@ruvnet

    RuVector는 Rust로 구축된 고성능 실시간 자기 학습 AI, 벡터 GNN, 메모리 DB입니다.

    4,467+27최근 7일 스타 변화
  • optillm@algorithmicsuperintelligence

    LLM을 위한 추론 프록시 최적화

    4,257+8최근 7일 스타 변화
  • GenerativeAIExamples@NVIDIA

    가속화된 인프라 및 마이크로서비스 아키텍처에 최적화된 생성형 AI 레퍼런스 워크플로입니다.

    4,165+10최근 7일 스타 변화
  • lorax@predibase

    수천 개의 파인튜닝된 LLM으로 확장 가능한 멀티 LoRA 추론 서버

    3,826-2최근 7일 스타 변화
  • AI-Engineer-Headquarters@hemansnation

    스토리와 모델을 구축하기 위한 과학적 방법, 프로세스, 알고리즘 및 시스템 모음입니다.

    3,674+2최근 7일 스타 변화
  • spiceai@spiceai

    운영 데이터베이스에 실시간 분석 노드를 추가하세요. Spice는 데이터 기반 AI 애플리케이션 및 에이전트를 위한 Rust 기반의 휴대용 가속 SQL 쿼리, 검색 및 LLM 추론 엔진입니다.

    3,074+5최근 7일 스타 변화
← 토픽 목록으로