Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · reinforcement-learning

reinforcement-learning

Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.

305 kho mã
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit là một hệ thống machine learning đẩy lùi ranh giới của machine learning với các kỹ thuật như trực tuyến, băm, allreduce, reductions, learning2search, học chủ động và học tương tác.

    8.708+2Thay đổi số sao trong 7 ngày qua
  • pysc2@google-deepmind

    Môi trường học tập StarCraft II

    8.309+2Thay đổi số sao trong 7 ngày qua
  • PaLM-rlhf-pytorch@lucidrains

    Triển khai RLHF (Học tăng cường từ phản hồi của con người) trên kiến trúc PaLM. Về cơ bản là ChatGPT nhưng sử dụng PaLM

    7.866-1Thay đổi số sao trong 7 ngày qua
  • maths-cs-ai-compendium@HenryNdubuaku

    Trở thành một nhà nghiên cứu/kỹ sư AI/ML xuất sắc với cuốn sách giáo khoa phi truyền thống này bao gồm toán học, điện toán và ML bằng trực giác.

    7.400+21Thay đổi số sao trong 7 ngày qua
  • Danh sách tài liệu đọc cho các chủ đề nghiên cứu về học máy đa phương thức

    6.926+1Thay đổi số sao trong 7 ngày qua
  • Bộ sưu tập các bài báo, blog và dự án LLM, tập trung vào OpenAI o1 🍓 và các kỹ thuật suy luận.

    6.902+3Thay đổi số sao trong 7 ngày qua
  • Practical_RL@yandexdataschool

    Khóa học về học tăng cường (reinforcement learning) trong thực tế

    6.566+0Thay đổi số sao trong 7 ngày qua
  • 🔬 Danh sách tổng hợp các LLM tuyệt vời cùng các chiến lược và công cụ học sâu trong thị trường tài chính.

    6.475+23Thay đổi số sao trong 7 ngày qua
  • Mooncake@kvcache-ai

    Mooncake là nền tảng phục vụ cho Kimi, một dịch vụ LLM hàng đầu được cung cấp bởi Moonshot AI.

    6.470+40Thay đổi số sao trong 7 ngày qua
  • Danh sách tổng hợp các phương pháp tự giám sát tuyệt vời

    6.414+1Thay đổi số sao trong 7 ngày qua
  • PufferLib@PufferAI

    Tăng cường học tăng cường

    6.321+8Thay đổi số sao trong 7 ngày qua
  • VLM-R1@om-ai-lab

    Giải quyết bài toán Hiểu biết Trực quan bằng các VLM có tăng cường

    6.018+4Thay đổi số sao trong 7 ngày qua
  • rllm@rllm-org

    Phổ biến hóa Học tăng cường cho các LLM.

    5.813+5Thay đổi số sao trong 7 ngày qua
  • AReaL@areal-project

    Cầu nối RL cho các ứng dụng tác nhân dựa trên LLM. Đơn giản & Linh hoạt.

    5.712+9Thay đổi số sao trong 7 ngày qua
  • open_spiel@google-deepmind

    OpenSpiel là tập hợp các môi trường và thuật toán dùng cho nghiên cứu về học tăng cường tổng quát và tìm kiếm/lập kế hoạch trong trò chơi.

    5.452+8Thay đổi số sao trong 7 ngày qua
  • Một framework robot thú cưng bốn chân mã nguồn mở để phát triển robot bốn chân kiểu Boston Dynamics, hoàn hảo cho giáo dục STEM, lập trình & robotics, ứng dụng robot IoT, dịch vụ ứng dụng robot tăng cường AI, nghiên cứu và phát triển bộ kit robot DIY.

    5.246+15Thay đổi số sao trong 7 ngày qua
  • xtuner@InternLM

    Công cụ huấn luyện thế hệ mới được xây dựng cho các mô hình MoE siêu lớn

    5.188+3Thay đổi số sao trong 7 ngày qua
  • deep-reinforcement-learning@udacity

    Kho lưu trữ cho chương trình Deep Reinforcement Learning Nanodegree

    5.176+0Thay đổi số sao trong 7 ngày qua
  • EasyR1@hiyouga

    EasyR1: Khung huấn luyện RL đa phương thức hiệu quả, có thể mở rộng dựa trên veRL

    5.141+5Thay đổi số sao trong 7 ngày qua
  • reasoning-from-scratch@rasbt

    Triển khai một LLM suy luận bằng PyTorch từ đầu, từng bước một.

    5.138+49Thay đổi số sao trong 7 ngày qua
  • deep-rl-class@huggingface

    Kho lưu trữ này chứa Khóa học Deep Reinforcement Learning của Hugging Face.

    5.006+10Thay đổi số sao trong 7 ngày qua
  • LLM-RL-Visualized@changyeyu

    🌟 Hơn 100 sơ đồ nguyên lý LLM / RL gốc 📚, tác giả của cuốn "Đại mô hình thuật toán" đặc biệt đóng góp! 💥 (100+ LLM/RL Algorithm Maps)

    4.838+12Thay đổi số sao trong 7 ngày qua
  • trlx@CarperAI

    Kho lưu trữ dùng để huấn luyện phân tán các mô hình ngôn ngữ bằng Học tăng cường từ phản hồi của con người (RLHF)

    4.754-1Thay đổi số sao trong 7 ngày qua
  • RLinf@RLinf

    RLinf: Cơ sở hạ tầng học tăng cường cho AI thể hiện và tác nhân (Embodied and Agentic AI)

    4.705+31Thay đổi số sao trong 7 ngày qua
  • dm_control@google-deepmind

    Ngăn xếp phần mềm của Google DeepMind dành cho mô phỏng dựa trên vật lý và môi trường Reinforcement Learning, sử dụng MuJoCo.

    4.681+6Thay đổi số sao trong 7 ngày qua
  • DouZero@kwai

    [ICML 2021] DouZero: Làm chủ Đấu Địa Chủ bằng Học tăng cường sâu tự chơi | AI Đấu Địa Chủ

    4.659+5Thay đổi số sao trong 7 ngày qua
  • alpha-zero-general@suragnair

    Một bản cài đặt sạch dựa trên AlphaZero cho bất kỳ trò chơi nào trong bất kỳ framework nào + hướng dẫn + Othello/Gobang/TicTacToe/Connect4 và hơn thế nữa

    4.512+5Thay đổi số sao trong 7 ngày qua
  • awesome-RLHF@opendilab

    Danh sách tài nguyên học tăng cường có phản hồi từ con người được tuyển chọn (cập nhật liên tục)

    4.424+2Thay đổi số sao trong 7 ngày qua
  • ElegantRL@AI4Finance-Foundation

    Học tăng cường sâu song song hàng loạt. 🔥

    4.359+2Thay đổi số sao trong 7 ngày qua
  • hands-on-modern-rl@walkinglabs

    🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.

    4.199+54Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề