Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · rl

rl

Các kho mã nguồn mở đang theo dõi được gắn thẻ rl, sắp xếp theo số sao.

Kho mã
45
Tổng số sao
111.909
Số sao trung bình
2.487
Tỷ trọng
0,01%

Những chủ đề thường xuất hiện cùng rl trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ rl.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • Llama-Chinese@LlamaChinese

    Cộng đồng Llama tiếng Trung, tổng hợp thời gian thực tài liệu học tập Llama mới nhất, xây dựng hệ sinh thái mã nguồn mở mô hình lớn Llama tiếng Trung tốt nhất, hoàn toàn mã nguồn mở và có thể thương mại hóa

    14.740+1Thay đổi số sao trong 7 ngày qua
  • tianshou@thu-ml

    Một thư viện học tăng cường sâu PyTorch trang nhã.

    10.945+11Thay đổi số sao trong 7 ngày qua
  • dopamine@google

    Dopamine là một framework nghiên cứu để tạo mẫu nhanh các thuật toán học tăng cường.

    10.901+4Thay đổi số sao trong 7 ngày qua
  • ART@OpenPipe

    Agent Reinforcement Trainer: huấn luyện các agent nhiều bước cho các tác vụ thực tế bằng GRPO. Cung cấp đào tạo tại chỗ cho các agent của bạn. Học tăng cường (Reinforcement learning) cho Qwen3.6, GPT-OSS, Llama và nhiều mô hình khác!

    10.679+57Thay đổi số sao trong 7 ngày qua
  • AReaL@areal-project

    Cầu nối RL cho các ứng dụng tác nhân dựa trên LLM. Đơn giản & Linh hoạt.

    5.703+19Thay đổi số sao trong 7 ngày qua
  • EasyR1@hiyouga

    EasyR1: Khung huấn luyện RL đa phương thức hiệu quả, có thể mở rộng dựa trên veRL

    5.136+10Thay đổi số sao trong 7 ngày qua
  • hands-on-modern-rl@walkinglabs

    🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.

    4.145+94Thay đổi số sao trong 7 ngày qua
  • agent-sandbox@kubernetes-sigs

    agent-sandbox cho phép quản lý dễ dàng các workload cô lập, có trạng thái (stateful) và singleton, lý tưởng cho các trường hợp sử dụng như runtime của AI agent và học tăng cường (RL).

    3.678+92Thay đổi số sao trong 7 ngày qua
  • AlphaZero_Gomoku@junxiaosong

    Bản cài đặt thuật toán AlphaZero cho trò chơi cờ caro (Gomoku hoặc Gobang)

    3.625+2Thay đổi số sao trong 7 ngày qua
  • rl@pytorch

    Một thư viện PyTorch mô-đun, hướng nguyên thủy và hướng Python dành cho Học tăng cường (Reinforcement Learning).

    3.540+12Thay đổi số sao trong 7 ngày qua
  • Khung huấn luyện cho các agent học tăng cường Stable Baselines3, bao gồm tối ưu hóa siêu tham số và các agent được huấn luyện sẵn.

    2.872+3Thay đổi số sao trong 7 ngày qua
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Triển khai các tài liệu nghiên cứu trong 100 dòng mã.

    2.867+8Thay đổi số sao trong 7 ngày qua
  • muzero-general@werner-duvaud

    MuZero

    2.863+4Thay đổi số sao trong 7 ngày qua
  • Awesome-RL-for-LRMs@TsinghuaC3I

    Khảo sát về Học tăng cường cho các Mô hình Suy luận Lớn

    2.481+2Thay đổi số sao trong 7 ngày qua
  • all-rl-algorithms@FareedKhan-dev

    Cài đặt tất cả các thuật toán RL theo cách đơn giản hơn

    1.922+7Thay đổi số sao trong 7 ngày qua
  • PRIME@PRIME-RL

    Giải pháp RL có khả năng mở rộng cho lập luận nâng cao của các mô hình ngôn ngữ

    1.872+3Thay đổi số sao trong 7 ngày qua
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL: Tăng tỷ lệ huấn luyện VLA thông qua Học tăng cường

    1.839+9Thay đổi số sao trong 7 ngày qua
  • Những Tiến Bộ Mới Nhất về Suy Luận Hệ Thống-2

    1.353+1Thay đổi số sao trong 7 ngày qua
  • understand-r1-zero@sail-sg

    Hiểu về quá trình huấn luyện kiểu R1-Zero: Góc nhìn phản biện

    1.274+1Thay đổi số sao trong 7 ngày qua
  • diy-llm@datawhalechina

    🎓 Khóa học xây dựng Large Language Model có hệ thống |🛠️ Bao gồm kỹ thuật dữ liệu tiền huấn luyện, Tokenizer, Transformer, MoE, lập trình GPU (CUDA/Triton), huấn luyện phân tán, Scaling Laws, tối ưu hóa suy luận và căn chỉnh (SFT/RLHF/GRPO) |🚀 6 bài tập lũy tiến + hướng dẫn bằng mã nguồn, xây dựng hệ thống nhận thức toàn diện về LLM

    1.260+22Thay đổi số sao trong 7 ngày qua
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Học tăng cường trong thời gian thử nghiệm

    1.121+5Thay đổi số sao trong 7 ngày qua
  • ARPO@RUC-NLPIR

    [ICLR 2026] Tối ưu hóa chính sách tăng cường dựa trên tác nhân (ARPO)

    1.111+3Thay đổi số sao trong 7 ngày qua
  • SDPO@lasgroup

    Học tăng cường thông qua tự chưng cất (SDPO)

    1.080+8Thay đổi số sao trong 7 ngày qua
  • judgeval@JudgmentLabs

    Stack cải tiến liên tục dành cho Agent. Dữ liệu môi trường và các bài đánh giá của chúng tôi hỗ trợ cải thiện và giám sát agent.

    1.058+1Thay đổi số sao trong 7 ngày qua
  • tensorlake@tensorlakeai

    Tensorlake là một runtime không máy chủ (serverless) dành cho sandbox và triển khai các ứng dụng agentic nền

    995+1Thay đổi số sao trong 7 ngày qua
  • OpenDerisk@derisk-ai

    Hệ thống tình báo rủi ro gốc AI, OpenDeRisk — Trình quản lý thông minh rủi ro hệ thống ứng dụng của bạn cung cấp sự bảo vệ toàn diện và sâu sắc 24/7.

    968+3Thay đổi số sao trong 7 ngày qua
  • mushroom-rl@MushroomRL

    Thư viện Python cho Học tăng cường.

    944+1Thay đổi số sao trong 7 ngày qua
  • AI-Compass@tingaicompass

    “AI-Compass” sẽ định hướng cho cộng đồng khi điều hướng trong đại dương công nghệ AI, dù bạn là người mới bắt đầu hay nhà phát triển nâng cao, bạn đều có thể tìm thấy con đường dẫn đến các hướng đi lớn của AI tại đây. Nhằm giúp nhà phát triển hiểu một cách có hệ thống các khái niệm cốt lõi, công nghệ chủ đạo, xu hướng biên giới của AI, và nắm vững toàn bộ quá trình từ lý thuyết đến thực tiễn thông qua thực hành.

    926+12Thay đổi số sao trong 7 ngày qua
  • zeroth-bot@zeroth-robotics

    Nền tảng robot hình người mã nguồn mở in 3D cho sim-to-real và RL

    820+1Thay đổi số sao trong 7 ngày qua
  • mobilegym@Purewhiter

    MobileGym: Nền tảng mô phỏng có thể kiểm chứng và song song hóa cao cho nghiên cứu tác nhân GUI di động · Trình mô phỏng Android chạy trên trình duyệt · Đánh giá có thể kiểm chứng · Đào tạo RL trực tuyến có khả năng mở rộng

    777+10Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề