Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · rl

rl

Các kho mã nguồn mở đang theo dõi được gắn thẻ rl, sắp xếp theo số sao.

46 kho mã
  • mobilegym@Purewhiter

    MobileGym: Nền tảng mô phỏng có thể kiểm chứng và song song hóa cao cho nghiên cứu tác nhân GUI di động · Trình mô phỏng Android chạy trên trình duyệt · Đánh giá có thể kiểm chứng · Đào tạo RL trực tuyến có khả năng mở rộng

    786+10Thay đổi số sao trong 7 ngày qua
  • stable-baselines3-contrib@Stable-Baselines-Team

    Gói đóng góp cho Stable-Baselines3 - Mã học tăng cường (RL) thử nghiệm

    736+5Thay đổi số sao trong 7 ngày qua
  • Danh sách các bài báo nghiên cứu về tìm kiếm cây Monte Carlo kèm theo các bản triển khai

    715+1Thay đổi số sao trong 7 ngày qua
  • Matterport3DSimulator@peteanderson80

    Nền tảng nghiên cứu AI cho học tăng cường từ hình ảnh toàn cảnh thực tế.

    713+1Thay đổi số sao trong 7 ngày qua
  • dr-tulu@rlresearch

    Kho lưu trữ chính thức cho DR Tulu: Học tăng cường với các Rubric tiến hóa cho Nghiên cứu chuyên sâu.

    704+4Thay đổi số sao trong 7 ngày qua
  • irl-imitation@yrlu

    Triển khai các thuật toán Học tăng cường nghịch đảo (IRL) trong Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL

    681+2Thay đổi số sao trong 7 ngày qua
  • RosettaStone@utilForever

    Trình mô phỏng Hearthstone sử dụng C++ kết hợp học tăng cường

    680+1Thay đổi số sao trong 7 ngày qua
  • BenchMARL@facebookresearch

    BenchMARL là một thư viện để đánh giá hiệu năng Học tăng cường đa tác nhân (MARL). BenchMARL cho phép so sánh nhanh các thuật toán, tác vụ và mô hình MARL khác nhau dựa trên hai nguyên tắc cốt lõi: khả năng tái lập và tiêu chuẩn hóa.

    656+2Thay đổi số sao trong 7 ngày qua
  • Những tiến bộ mới nhất về suy luận chuỗi tư duy dài (Long Chain-of-Thought).

    647-1Thay đổi số sao trong 7 ngày qua
  • WebShop@princeton-nlp

    [NeurIPS 2022] 🛒WebShop: Hướng tới tương tác web thực tế có thể mở rộng với các Grounded Language Agent

    589+3Thay đổi số sao trong 7 ngày qua
  • Triển khai ROS2-Control cho robot bốn chân, bao gồm sim2real

    567+4Thay đổi số sao trong 7 ngày qua
  • Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.

    551+4Thay đổi số sao trong 7 ngày qua
  • morl-baselines@LucasAlegre

    Triển khai các thuật toán học tăng cường đa mục tiêu.

    533+1Thay đổi số sao trong 7 ngày qua
  • DeepThinkVLA@OpenBMB

    DeepThinkVLA: Nâng cao khả năng suy luận của các mô hình Vision-Language-Action

    528+0Thay đổi số sao trong 7 ngày qua
  • gem@axon-rl

    Một môi trường Gym dành cho các Agentic LLM

    506+1Thay đổi số sao trong 7 ngày qua
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề