inference-engine
inference-engine 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 inference-engine 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 inference-engine 태그가 달린 리포지토리예요.
- #1
단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.
★ 6,871 - #2
Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.
★ 624 - #3
교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.
★ 552
- #1
✍🏻 소스코드 심층 분석, 시스템 디자인 및 엔지니어링 블로그 | Halfrost-Field 冰霜之地: 소스 분석, 시스템 디자인 및 엔지니어링 실습 노트
★ 13,220+3최근 7일 스타 변화 - #2
단일 CPU와 8.24 GB RAM에서 2조 7,800억 개의 파라미터를 가진 Kimi K3 추론 실행. 포터블 C99: BLAS, 프레임워크, GPU 없음.
★ 6,871+485최근 7일 스타 변화 - #3
대규모 분산 학습, 모델 서빙, 연합 학습을 위한 통합 및 확장 가능한 ML 라이브러리인 FEDML. 크로스 클라우드 스케줄러인 FEDML Launch를 통해 모든 GPU 클라우드나 온프레미스 클러스터에서 AI 작업을 실행할 수 있습니다. 이 라이브러리를 기반으로 구축된 TensorOpera AI(https://TensorOpera.ai)는 대규모 생성형 AI 플랫폼입니다.
★ 4,061-1최근 7일 스타 변화 - #4
공채, 인턴을 위한 훌륭한 프로젝트! llama2, Unet, Yolov5, Resnet 등 대형 모델의 추론을 지원하는 고성능 딥러닝 추론 라이브러리를 제로부터 단계별로 구현합니다.
★ 3,497+1최근 7일 스타 변화 - #5
Golang으로 구현된 룰 엔진
★ 2,522+0최근 7일 스타 변화 - #6★ 1,964+1최근 7일 스타 변화
- #7★ 1,844+2최근 7일 스타 변화
- #8★ 1,805+235최근 7일 스타 변화
- #9★ 1,541+12최근 7일 스타 변화
- #10
성능(지연 시간, 메모리 등)에 최적화되고 Qualcomm® 기기에 바로 배포할 수 있는 최신 머신러닝 모델 모음인 Qualcomm® AI Hub Models입니다.
★ 1,194+3최근 7일 스타 변화 - #11★ 1,145+5최근 7일 스타 변화
- #12
Paddle.js는 브라우저에서 실행되는 오픈 소스 딥러닝 프레임워크인 Baidu PaddlePaddle을 위한 웹 프로젝트입니다. Paddle.js는 사전 학습된 모델을 로드하거나 제공된 도구를 사용하여 paddle-hub 모델을 변환할 수 있으며, WebGL/WebGPU/WebAssembly를 지원하는 모든 브라우저와 Baidu Smartprogram 및 WX 미니프로그램에서 실행 가능합니다.
★ 1,103+0최근 7일 스타 변화 - #13★ 1,081+11최근 7일 스타 변화
- #14★ 960+11최근 7일 스타 변화
- #15★ 908+0최근 7일 스타 변화
- #16★ 849+1최근 7일 스타 변화
- #17
Pure Rust + CUDA LLM 추론 엔진 — PyTorch 미사용, OpenAI 호환, Qwen3에서 Kimi-K2까지 서비스 제공
★ 660+4최근 7일 스타 변화 - #18
Apple Silicon에서 최대 4배 빨라진 무손실 LLM 디코딩. DeepSeek의 DSpark 및 z-lab의 DFlash 추정 디코딩(speculative decoding)의 네이티브 MLX 포팅 — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, 3진(ternary) Bonsai-27B 지원.
★ 624+98최근 7일 스타 변화 - #19★ 597+1최근 7일 스타 변화
- #20★ 582+1최근 7일 스타 변화
- #21
신입 채용 및 인턴십을 위한 프로젝트로, LLama2/3 및 Qwen2.5를 지원하는 대규모 언어 모델 추론 프레임워크를 처음부터 직접 구현합니다.
★ 572+9최근 7일 스타 변화 - #22
교사 모델에서 타일 모델까지 — 처음부터 구현한 LLM 증류 및 서빙 엔진: 커스텀 Triton/CUDA 커널, FSDP 증류, 페이징된 KV 연속 배치, 추측 디코딩, Rust 게이트웨이, JAX 오라클, 해석 가능성 도구를 포함합니다.
★ 552+35최근 7일 스타 변화 - #23★ 516+3최근 7일 스타 변화
- #24
Intel 장치용 추론 엔진. OpenAI 엔드포인트를 통해 LLM, VLM, Whisper, Kokoro-TTS, 임베딩 및 리랭크 모델을 서비스합니다.
★ 513+4최근 7일 스타 변화