記憶體優化與訓練方法,可用極少的硬體將語言模型的上下文長度推展至 100 萬個 token。
radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。