SigmanticAI/apex-inference-chip
@SigmanticAIThiết kế chip suy luận chạy LLM thực tế (Qwen2.5-0.5B) trên FPGA — một lớp giải mã transformer bằng RTL, mọi bit giá trị silicon đều khớp chính xác với mô hình chuẩn. Đạt tốc độ 0.56 tok/s, tăng 140 lần, kèm theo bằng chứng đầy đủ.
Sao
615
Fork
11
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
3 tuần trước
Intel liên quan (0)
Chưa có intel liên quan
Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.