dpo
Các kho mã nguồn mở đang theo dõi được gắn thẻ dpo, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng dpo trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ dpo.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Dễ dàng tinh chỉnh, đánh giá và triển khai Qwen, Gemma hoặc bất kỳ LLM trọng số mở nào!
★ 9.383+3Thay đổi số sao trong 7 ngày qua - #2
MedicalGPT: Đào tạo mô hình GPT y tế của riêng bạn với quy trình huấn luyện của ChatGPT. Huấn luyện mô hình lớn y tế, hỗ trợ tiền huấn luyện gia tăng (PT), tinh chỉnh có giám sát (SFT), RLHF, DPO, ORPO, GRPO.
★ 5.771+12Thay đổi số sao trong 7 ngày qua - #3
Tinh chỉnh LLMs chỉ từ một YAML. Layer streaming đào tạo mô hình 8B trên GPU laptop 4 GB.
★ 4.929+1.365Thay đổi số sao trong 7 ngày qua - #4
Align Anything: Huấn luyện mô hình đa phương thức với phản hồi
★ 4.671+3Thay đổi số sao trong 7 ngày qua - #5
🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.
★ 4.199+54Thay đổi số sao trong 7 ngày qua - #6
Thư viện cung cấp các cài đặt mở rộng cho DPO, KTO, PPO, ORPO và các hàm mất mát nhận thức con người (HALOs) khác.
★ 909-1Thay đổi số sao trong 7 ngày qua - #7
[ICCV 2025] Mã nguồn chính thức của DeepMesh: Tạo lưới nghệ sĩ tự hồi quy với học tăng cường
★ 736+1Thay đổi số sao trong 7 ngày qua - #8
🌾 OAT: Khung nghiên cứu thân thiện cho việc căn chỉnh trực tuyến LLM, bao gồm học tăng cường, học ưu tiên, v.v.
★ 669-1Thay đổi số sao trong 7 ngày qua - #9
Tinh chỉnh LLM dễ dàng và hiệu quả (Hỗ trợ LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)
★ 621+0Thay đổi số sao trong 7 ngày qua - #10
Danh sách các bài báo nghiên cứu về học tăng cường cho tạo video
★ 591+1Thay đổi số sao trong 7 ngày qua - #11
Kho lưu trữ Deep Learning NLP sử dụng tensorflow, tổng hợp từ tiền xử lý văn bản đến các tác vụ hạ nguồn của các mô hình hiện đại như Topic Models, BERT, GPT và LLM.
★ 581+0Thay đổi số sao trong 7 ngày qua