Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · rlhf

rlhf

Các kho mã nguồn mở đang theo dõi được gắn thẻ rlhf, sắp xếp theo số sao.

Kho mã
44
Tổng số sao
223.657
Số sao trung bình
5.083
Tỷ trọng
0,01%

Những chủ đề thường xuất hiện cùng rlhf trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ rlhf.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • LlamaFactory@hiyouga

    Tinh chỉnh hiệu quả thống nhất cho hơn 100 LLM & VLM (ACL 2024)

    74.532+89Thay đổi số sao trong 7 ngày qua
  • Open-Assistant@LAION-AI

    OpenAssistant là trợ lý ảo dựa trên trò chuyện, hiểu các tác vụ, có thể tương tác với hệ thống bên thứ ba và truy xuất thông tin động để thực hiện.

    37.401-7Thay đổi số sao trong 7 ngày qua
  • LLMSurvey@RUCAIBox

    Trang GitHub chính thức cho bài báo khảo sát "A Survey of Large Language Models".

    12.208+2Thay đổi số sao trong 7 ngày qua
  • InternLM@InternLM

    Bản phát hành chính thức của dòng InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).

    7.277+4Thay đổi số sao trong 7 ngày qua
  • Dự án mô hình lớn Chinese LLaMA-2 & Alpaca-2 giai đoạn 2 + mô hình ngữ cảnh siêu dài 64K

    7.120+0Thay đổi số sao trong 7 ngày qua
  • alignment-handbook@huggingface

    Các công thức mạnh mẽ để căn chỉnh các mô hình ngôn ngữ với sở thích của con người và AI

    5.670-3Thay đổi số sao trong 7 ngày qua
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Huấn luyện bất kỳ tác nhân nào chỉ bằng cách trò chuyện.

    5.665+7Thay đổi số sao trong 7 ngày qua
  • transformerlab-app@transformerlab

    Môi trường nghiên cứu mã nguồn mở dành cho các nhà nghiên cứu AI để đào tạo, đánh giá và mở rộng quy mô mô hình một cách liền mạch từ phần cứng cục bộ đến cụm GPU.

    5.185+3Thay đổi số sao trong 7 ngày qua
  • reasoning-from-scratch@rasbt

    Triển khai một LLM suy luận bằng PyTorch từ đầu, từng bước một.

    5.138+49Thay đổi số sao trong 7 ngày qua
  • argilla@argilla-io

    Argilla là công cụ cộng tác dành cho các kỹ sư AI và chuyên gia lĩnh vực để xây dựng tập dữ liệu chất lượng cao

    5.093+5Thay đổi số sao trong 7 ngày qua
  • Kiln@Kiln-AI

    Xây dựng, Đánh giá và Tối ưu hóa các Hệ thống AI. Bao gồm đánh giá, RAG, tác nhân, fine-tuning, tạo dữ liệu tổng hợp, quản lý tập dữ liệu, MCP và nhiều tính năng khác.

    5.042+5Thay đổi số sao trong 7 ngày qua
  • align-anything@PKU-Alignment

    Align Anything: Huấn luyện mô hình đa phương thức với phản hồi

    4.671+3Thay đổi số sao trong 7 ngày qua
  • awesome-RLHF@opendilab

    Danh sách tài nguyên học tăng cường có phản hồi từ con người được tuyển chọn (cập nhật liên tục)

    4.424+2Thay đổi số sao trong 7 ngày qua
  • hands-on-modern-rl@walkinglabs

    🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.

    4.199+54Thay đổi số sao trong 7 ngày qua
  • docta@Docta-ai

    Bác sĩ cho dữ liệu của bạn

    3.485-1Thay đổi số sao trong 7 ngày qua
  • distilabel@argilla-io

    Distilabel là một framework dành cho dữ liệu tổng hợp và phản hồi AI dành cho các kỹ sư cần các đường ống (pipeline) nhanh, đáng tin cậy và có khả năng mở rộng dựa trên các bài báo nghiên cứu đã được kiểm chứng.

    3.384+3Thay đổi số sao trong 7 ngày qua
  • ROLL@alibaba

    Thư viện mở rộng hiệu quả và thân thiện với người dùng cho Học tăng cường với các Large Language Model

    3.380+6Thay đổi số sao trong 7 ngày qua
  • TorchLeet@Exorust

    LeetCode cho PyTorch — 65 bài toán phỏng vấn ML/AI từ các buổi phỏng vấn thực tế tại Google, Meta, Anthropic. Bao gồm Jupyter notebook, hệ thống tự động chấm điểm và gia sư AI MCP.

    2.461+12Thay đổi số sao trong 7 ngày qua
  • rlhf-book@natolambert

    Sách giáo khoa về học tăng cường từ phản hồi của con người (RLHF)

    2.357+11Thay đổi số sao trong 7 ngày qua
  • alpaca_eval@tatsu-lab

    Trình đánh giá tự động cho các mô hình ngôn ngữ tuân theo hướng dẫn. Được xác thực bởi con người, chất lượng cao, chi phí rẻ và nhanh chóng.

    2.012-1Thay đổi số sao trong 7 ngày qua
  • AgentsMeetRL@thinkwee

    Danh sách tổng hợp tuyệt vời cho Agentic RL

    1.832+29Thay đổi số sao trong 7 ngày qua
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: Học và Đánh giá Sở thích của Con người đối với Tạo ảnh từ văn bản

    1.703+1Thay đổi số sao trong 7 ngày qua
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Căn chỉnh giá trị có ràng buộc thông qua Học tăng cường an toàn từ phản hồi của con người

    1.613+1Thay đổi số sao trong 7 ngày qua
  • WebGLM@THUDM

    WebGLM: Hệ thống trả lời câu hỏi được tăng cường web hiệu quả (KDD 2023)

    1.601-1Thay đổi số sao trong 7 ngày qua
  • Công thức huấn luyện mô hình phần thưởng (reward model) cho RLHF.

    1.541+0Thay đổi số sao trong 7 ngày qua
  • MOSS-RLHF@OpenLMLab

    Bí mật của RLHF trong Large Language Models Phần I: PPO

    1.430+0Thay đổi số sao trong 7 ngày qua
  • xtreme1@xtreme1-io

    Xtreme1 là nền tảng gán nhãn và chú thích dữ liệu tất cả trong một dành cho huấn luyện dữ liệu đa phương thức, hỗ trợ đám mây điểm 3D LiDAR, hình ảnh và LLM.

    1.239+2Thay đổi số sao trong 7 ngày qua
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: Tối ưu hóa sở thích đơn giản với phần thưởng không cần tham chiếu

    959+1Thay đổi số sao trong 7 ngày qua
  • verl-omni@verl-project

    Khung huấn luyện RL đa phương thức cho các mô hình diffusion và omni

    955+60Thay đổi số sao trong 7 ngày qua
  • AI-Compass@tingaicompass

    “AI-Compass” sẽ định hướng cho cộng đồng khi điều hướng trong đại dương công nghệ AI, dù bạn là người mới bắt đầu hay nhà phát triển nâng cao, bạn đều có thể tìm thấy con đường dẫn đến các hướng đi lớn của AI tại đây. Nhằm giúp nhà phát triển hiểu một cách có hệ thống các khái niệm cốt lõi, công nghệ chủ đạo, xu hướng biên giới của AI, và nắm vững toàn bộ quá trình từ lý thuyết đến thực tiễn thông qua thực hành.

    933+10Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề