Hugging Face 每日论文·· 1 天前AI 评分55
长上下文混合模型机理研究 Part 1.1:从混合注意力到混合位置
Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position
AI 导读
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
来源:Hugging Face 每日论文 · huggingface.co