datawhalechina/diy-llm
@datawhalechinaCours systématique sur la construction de grands modèles de langage (LLM) couvrant l'ingénierie des données de pré-entraînement, Tokenizer, Transformer, MoE, programmation GPU (CUDA/Triton), entraînement distribué, lois d'échelle, optimisation de l'inférence et alignement (SFT/RLHF/GRPO), avec 6 exercices progressifs axés sur le code.
Étoiles
1 276
Bifurcations
131
Langage
Jupyter Notebook
Licence
—
Dernier push
il y a 1 semaine
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.