2026-07-25ICML 2026 · OralWei-Lin Chiang · Zhuohan Li · et al. (UC Berkeley)
UltraLong-1M: 一个面向百万级 Token 推理的自回归 Transformer 长程记忆机制
UltraLong-1M 提出了一个分层的键值压缩与稀疏注意力机制,使 8B 参数的 Transformer 能在单张 H100 上稳定训练 1M Token 上下文。在 LongBench v2 与 RULER 上分别取得 78.3 与 91.4 分,相对 Llama-3-8B-1M 提升 12.7 分,训练成本下降 41%。
AI 深度解读