跳到主要内容
buildradar
登录

tomaarsen/attention_sinks

@tomaarsen

在常数内存用量下,将现有 LLM 的长度大幅扩展至原始训练长度之外,且无需重新训练

星数
734
Fork 数
44
语言
Python
许可
Apache-2.0
最后推送
2年前
Pythonpythonllmllmstransformersnlp

还没有相关情报

radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。