SciNexus 研枢研枢
2026-07-25ICML 2026 · OralWei-Lin Chiang · Zhuohan Li · et al. (UC Berkeley)

UltraLong-1M: 一个面向百万级 Token 推理的自回归 Transformer 长程记忆机制

UltraLong-1M 提出了一个分层的键值压缩与稀疏注意力机制,使 8B 参数的 Transformer 能在单张 H100 上稳定训练 1M Token 上下文。在 LongBench v2 与 RULER 上分别取得 78.3 与 91.4 分,相对 Llama-3-8B-1M 提升 12.7 分,训练成本下降 41%。

AI 深度解读
#长上下文#Transformer#稀疏注意力
2026-07-24arXiv · cs.CVJunsong Chen · Jincheng Yu · Yitong Li (NVIDIA)

SANA-Video 2.0: 基于混合线性注意力与残差机制的高效视频扩散 Transformer

NVIDIA 的 SANA-Video 2.0 引入混合线性注意力与周期性 softmax 锚点机制,5B 参数模型在单张 H100 GPU 上 13.2 秒生成 81 帧视频,VBench 总分 84.30,相对全 softmax 基线实现 3.2 倍 DiT 前向加速。

查看解读
#视频生成#扩散模型#线性注意力
2026-07-23ICLR 2026Yifei Ming · Sumanth Dathathri · et al. (Stanford)

AREX: 面向深度研究的递归自我进化智能体

AREX 提出了一种递归自进化机制:智能体在每次研究循环后自动重写自身的工具策略与检索流程,连续 4 轮迭代后在 DeepResearch Bench 上达到 73.8 分,相对静态智能体基线提升 19.2 分。

智能体实验记录
#智能体#递归学习