跳到主要内容

已发布集合

SparDA 用 Forecast 投影选择下一层 KV 块

该方法针对长上下文推理中的 KV cache 选择成本,可能改善稀疏注意力效率。

更新
编辑
Frontline Lab
内容数量
1
来源数量
1
时间范围
2026-08-12
主要标签
论文 · 训练方法 · SparDA · NVIDIA · DeepSeek

已发布证据

每条内容都保留摘要,并提供回到来源语境的路径。