post-training
Erfasste Open-Source-Repos mit dem Tag post-training, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit post-training am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit post-training getaggt wurden.
- #1
Das lebendige Ökosystem, in dem KI-Agenten Aufgaben durch Workflow-Schleifen erledigen, sich durch iterative Ausführung verbessern, von Mentor-Agenten oder Menschen bewertet werden und abgeschlossene Arbeit in wiederverwendbare Berufserfahrung und Daten umwandeln, um zukünftige Agenten zu verbessern.
★ 1.333
- #1
Ein einheitliches Inferenz- und Post-Training-Framework für beschleunigte Videogenerierung.
★ 4.150+128Sterne-Änderung der letzten 7 Tage - #2
Awesome Reasoning LLM Tutorial/Survey/Guide
★ 2.527+4Sterne-Änderung der letzten 7 Tage - #3
Großes Sprachmodell für psychische Gesundheit (LLM x Mental Health), Pre- & Post-Training, Datensatz, Evaluierung, Bereitstellung & RAG, kompatibel mit den Serien InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLaMA und GLM.
★ 1.781+3Sterne-Änderung der letzten 7 Tage - #4
Das lebendige Ökosystem, in dem KI-Agenten Aufgaben durch Workflow-Schleifen erledigen, sich durch iterative Ausführung verbessern, von Mentor-Agenten oder Menschen bewertet werden und abgeschlossene Arbeit in wiederverwendbare Berufserfahrung und Daten umwandeln, um zukünftige Agenten zu verbessern.
★ 1.333-3Sterne-Änderung der letzten 7 Tage - #5
Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen
★ 766+29Sterne-Änderung der letzten 7 Tage - #6
Offizielle Codebasis für „Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights“ (ICML 2026 Spotlight)
★ 640+0Sterne-Änderung der letzten 7 Tage - #7
Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.
★ 623+0Sterne-Änderung der letzten 7 Tage - #8
[ACL 2026 Oral] "LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?"
★ 608+1Sterne-Änderung der letzten 7 Tage - #9
Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.
★ 582+2Sterne-Änderung der letzten 7 Tage - #10
[NeurIPS 2025 Spotlight] LLM-Post-Training-Suite – mit ReasonFlux, ReasonFlux-PRM und ReasonFlux-Coder.
★ 542-1Sterne-Änderung der letzten 7 Tage - #11
Messung, wie gut CLI-Agenten wie Claude Code oder Codex CLI Basis-LLMs auf einer einzelnen H100 GPU in 10 Stunden nachtrainieren können.
★ 541+14Sterne-Änderung der letzten 7 Tage - #12★ 533+2Sterne-Änderung der letzten 7 Tage