ppo
Các kho mã nguồn mở đang theo dõi được gắn thẻ ppo, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng ppo trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ ppo.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Hướng dẫn học tăng cường bằng tiếng Trung (Sách Nấm 🍄), địa chỉ đọc trực tuyến: https://datawhalechina.github.io/easy-rl/
★ 14.592+28Thay đổi số sao trong 7 ngày qua - #2★ 10.945+11Thay đổi số sao trong 7 ngày qua
- #3
Triển khai tệp đơn chất lượng cao cho các thuật toán Deep Reinforcement Learning với các tính năng thân thiện với nghiên cứu (PPO, DQN, C51, DDPG, TD3, SAC, PPG)
★ 10.339+36Thay đổi số sao trong 7 ngày qua - #4
Hướng dẫn học tăng cường đơn giản, tài liệu giảng dạy AI tiếng Trung của MoFan Python
★ 9.510+7Thay đổi số sao trong 7 ngày qua - #5
Kho lưu trữ cho chương trình Deep Reinforcement Learning Nanodegree
★ 5.176+0Thay đổi số sao trong 7 ngày qua - #6★ 4.357+1Thay đổi số sao trong 7 ngày qua
- #7
🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.
★ 4.145+94Thay đổi số sao trong 7 ngày qua - #8
FinRL-X: Cơ sở hạ tầng mô-đun gốc AI dành cho giao dịch định lượng
★ 3.607+25Thay đổi số sao trong 7 ngày qua - #9★ 3.449+2Thay đổi số sao trong 7 ngày qua
- #10
Triển khai PyTorch sạch sẽ, mạnh mẽ và thống nhất của các thuật toán Deep Reinforcement Learning (DRL) phổ biến (Q-learning, Duel DDQN, PER, C51, Noisy DQN, PPO, DDPG, TD3, SAC, ASL)
★ 3.437+4Thay đổi số sao trong 7 ngày qua - #11
Bản cài đặt tối giản của thuật toán Proximal Policy Optimization (PPO) với hàm mục tiêu bị cắt xén trong PyTorch
★ 2.376+0Thay đổi số sao trong 7 ngày qua - #12★ 2.087+2Thay đổi số sao trong 7 ngày qua
- #13
Framework Deep Reinforcement Learning mô-đun trong PyTorch. Thư viện đi kèm của cuốn sách "Foundations of Deep Reinforcement Learning".
★ 1.362-1Thay đổi số sao trong 7 ngày qua - #14
Một bản cài đặt PPO đơn giản và có phong cách. Dựa trên chuỗi bài viết trên Medium của tôi: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1.268+3Thay đổi số sao trong 7 ngày qua - #15
Đào tạo robot hình người di chuyển bằng Học tăng cường
★ 1.207+1Thay đổi số sao trong 7 ngày qua - #16★ 1.100+2Thay đổi số sao trong 7 ngày qua
- #17★ 1.081+1Thay đổi số sao trong 7 ngày qua
- #18
Thư viện cung cấp các cài đặt mở rộng cho DPO, KTO, PPO, ORPO và các hàm mất mát nhận thức con người (HALOs) khác.
★ 910+0Thay đổi số sao trong 7 ngày qua - #19
Các tệp khởi đầu RL giúp huấn luyện, trực quan hóa và đánh giá agent ngay lập tức mà không cần viết mã
★ 728+1Thay đổi số sao trong 7 ngày qua - #20
Kho lưu trữ này chứa hầu hết các triển khai PyTorch dựa trên các thuật toán học tăng cường sâu cổ điển, bao gồm - DQN, DDQN, Dueling Network, DDPG, SAC, A2C, PPO, TRPO. (Các thuật toán khác vẫn đang được phát triển)
★ 696+0Thay đổi số sao trong 7 ngày qua - #21
🌾 OAT: Khung nghiên cứu thân thiện cho việc căn chỉnh trực tuyến LLM, bao gồm học tăng cường, học ưu tiên, v.v.
★ 670-1Thay đổi số sao trong 7 ngày qua - #22
Thư viện PyTorch để xây dựng các tác nhân học tăng cường sâu
★ 657+1Thay đổi số sao trong 7 ngày qua - #23
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL mã nguồn mở cho LLM và các kịch bản tác nhân.
★ 625+1Thay đổi số sao trong 7 ngày qua - #24
Tinh chỉnh LLM dễ dàng và hiệu quả (Hỗ trợ LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)
★ 621+0Thay đổi số sao trong 7 ngày qua - #25
Danh sách các bài báo nghiên cứu về học tăng cường cho tạo video
★ 590+2Thay đổi số sao trong 7 ngày qua - #26
Học tăng cường sâu (PPO) trong lái xe tự động (Carla) [từ đầu]
★ 564+1Thay đổi số sao trong 7 ngày qua