Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · reinforcement-learning

reinforcement-learning

Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.

304 kho mã
  • awesome-mlss@awesome-mlss

    🤖 Hướng dẫn Trường hè Học máy

    3.033+3Thay đổi số sao trong 7 ngày qua
  • agents@tensorflow

    TF-Agents: Một thư viện TensorFlow đáng tin cậy, có khả năng mở rộng và dễ sử dụng cho Contextual Bandits và Học tăng cường.

    3.026+0Thay đổi số sao trong 7 ngày qua
  • Các bài báo nghiên cứu về Học sâu và Học tăng cường sâu kèm theo một số mã nguồn

    3.026+2Thay đổi số sao trong 7 ngày qua
  • mjlab@mujocolab

    Isaac Lab API, được hỗ trợ bởi MuJoCo-Warp, dành cho nghiên cứu học tăng cường và robot

    2.960+82Thay đổi số sao trong 7 ngày qua
  • openarm@enactic

    Một cánh tay robot hình người mã nguồn mở hoàn toàn dành cho nghiên cứu AI vật lý và triển khai trong môi trường giàu tiếp xúc.

    2.919+23Thay đổi số sao trong 7 ngày qua
  • Khung huấn luyện cho các agent học tăng cường Stable Baselines3, bao gồm tối ưu hóa siêu tham số và các agent được huấn luyện sẵn.

    2.873+1Thay đổi số sao trong 7 ngày qua
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Triển khai các tài liệu nghiên cứu trong 100 dòng mã.

    2.870+3Thay đổi số sao trong 7 ngày qua
  • muzero-general@werner-duvaud

    MuZero

    2.865+2Thay đổi số sao trong 7 ngày qua
  • easy-tensorflow@easy-tensorflow

    Hướng dẫn đơn giản và toàn diện về TensorFlow

    2.841+0Thay đổi số sao trong 7 ngày qua
  • YC-Killer@sahibzada-allahyar

    Một thư viện các AI agent cấp doanh nghiệp được thiết kế để dân chủ hóa trí tuệ nhân tạo và cung cấp các lựa chọn thay thế mã nguồn mở, miễn phí cho các công ty khởi nghiệp Y Combinator được định giá quá cao.

    2.806+7Thay đổi số sao trong 7 ngày qua
  • RAGEN@mll-lab-nu

    Khung Agent RL cho các tác nhân LLM: học tăng cường nhiều lượt với StarPO và chẩn đoán sụt giảm lý luận

    2.786+6Thay đổi số sao trong 7 ngày qua
  • mctx@google-deepmind

    Tìm kiếm cây Monte Carlo trong JAX

    2.657+3Thay đổi số sao trong 7 ngày qua
  • PPOxFamily@opendilab

    Khóa học PPO x Family DRL (Khóa học công khai nhập môn Trí tuệ Quyết định: 8 bài học giúp bạn hiểu rõ lý thuyết thuật toán, làm sạch logic mã nguồn và làm chủ ứng dụng AI quyết định)

    2.616+2Thay đổi số sao trong 7 ngày qua
  • Các bài báo Deep Learning tuyệt vời cho Tìm kiếm, Gợi ý và Quảng cáo trong công nghiệp. Tập trung vào Embedding, Matching, Pre-Ranking, Ranking, Post Ranking, Relevance, LLM và RL. Vui lòng trích dẫn bài báo của chúng tôi "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026).

    2.589+0Thay đổi số sao trong 7 ngày qua
  • robosuite@ARISE-Initiative

    robosuite: Một framework mô phỏng và benchmark dạng mô-đun dành cho học máy robot

    2.586+4Thay đổi số sao trong 7 ngày qua
  • Hướng dẫn/Khảo sát/Tài liệu về Reasoning LLM tuyệt vời

    2.533+6Thay đổi số sao trong 7 ngày qua
  • Lời giải cho Reinforcement Learning, An Introduction

    2.433+3Thay đổi số sao trong 7 ngày qua
  • RL4LMs@allenai

    Một thư viện RL dạng mô-đun để tinh chỉnh các mô hình ngôn ngữ theo sở thích của con người

    2.395+1Thay đổi số sao trong 7 ngày qua
  • gym-anytrading@AminHP

    Môi trường giao dịch OpenAI Gym đơn giản, linh hoạt và toàn diện nhất (Được phê duyệt bởi OpenAI Gym)

    2.387+0Thay đổi số sao trong 7 ngày qua
  • PPO-PyTorch@nikhilbarhate99

    Bản cài đặt tối giản của thuật toán Proximal Policy Optimization (PPO) với hàm mục tiêu bị cắt xén trong PyTorch

    2.381+6Thay đổi số sao trong 7 ngày qua
  • ProtoMotions@NVlabs

    ProtoMotions là một framework mô phỏng và học tập tăng tốc bằng GPU để đào tạo con người ảo và robot hình người mô phỏng vật lý.

    2.359+10Thay đổi số sao trong 7 ngày qua
  • ICCV2019 - Học vẽ với Học tăng cường sâu dựa trên mô hình

    2.308+2Thay đổi số sao trong 7 ngày qua
  • drl-zh@alessiodm

    Học tăng cường sâu: Từ con số không đến chuyên gia!

    2.293+0Thay đổi số sao trong 7 ngày qua
  • MimicKit@xbpeng

    Một bộ công cụ nhẹ gồm các phương pháp mô phỏng chuyển động để huấn luyện các bộ điều khiển.

    2.280+15Thay đổi số sao trong 7 ngày qua
  • verl-agent@langfengQ

    verl-agent là một phần mở rộng của veRL, được thiết kế để huấn luyện các LLM/VLM agent thông qua RL. verl-agent cũng là mã nguồn chính thức cho bài báo "Group-in-Group Policy Optimization for LLM Agent Training"

    2.274+17Thay đổi số sao trong 7 ngày qua
  • RecSysPapers@tangxyw

    Bộ sưu tập các bài báo kinh điển trong ngành và tiên tiến nhất trong lĩnh vực khuyến nghị/quảng cáo/tìm kiếm.

    2.188-1Thay đổi số sao trong 7 ngày qua
  • gym-pybullet-drones@learnsyslab

    Môi trường PyBullet Gymnasium cho học tăng cường đơn và đa tác nhân để điều khiển quadcopter

    2.119-2Thay đổi số sao trong 7 ngày qua
  • ASAP@LeCAR-Lab

    [RSS 2025] "ASAP: Đồng bộ mô phỏng và vật lý thực tế để học kỹ năng toàn thân linh hoạt cho robot hình người"

    2.107+3Thay đổi số sao trong 7 ngày qua
  • diamond@eloialonso

    DIAMOND (DIffusion As a Model Of eNvironment Dreams) là một tác nhân học tăng cường được huấn luyện dựa trên mô hình thế giới khuếch tán. NeurIPS 2024 Spotlight.

    2.100+1Thay đổi số sao trong 7 ngày qua
  • ViZDoom@Farama-Foundation

    Môi trường Học tăng cường dựa trên trò chơi Doom năm 1993 :godmode:

    2.065+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề