【arXiv 2025】Titans 论文解读:测试时记忆学习的神经长期记忆架构|从神经网络记忆机制视角

摘要

本文解读 arXiv 2025 论文《Titans: Learning to Memorize at Test Time》。该论文提出Titans 神经长期记忆架构,通过融合短程注意力测试时在线更新的神经记忆可学习持久记忆三分支,让模型在推理时把重要历史持续写入自己的网络权重,其特别之处在于把记忆建模为在线学习问题——用惊奇度量决定记什么、动量保持记忆、权重衰减决定遗忘。实验表明760M 规模下 Wiki 困惑度达到 18.61、有效上下文超过 200 万 token,并在 BABILong 百万级长文档推理上超越 GPT-4,为长上下文序列建模提供了全新范式。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Titans: Learning to Memorize at Test Time
标题(中文)测试时记忆学习:Titans 神经长期记忆架构
作者Ali Behrouz, Peilin Zhong, Vahab Mirrokni
机构Google Research
会议arXiv 2025
arXivhttps://arxiv.org/abs/2501.00663
项目网站https://arxiv.org/abs/2501.00663

背景与动机

Transformer 的注意力机制本质上是一块联想记忆:模型存储键值关联,并用查询与键的相似度做检索。但注意力对当前上下文窗口之外的依赖无能为力,且计算量随序列长度二次增长——2 万 token 以上的序列就难以承受。另一条路线是线性注意力与状态空间模型(Mamba、Mamba2、GLA、RetNet 等),它们把历史压缩进固定大小的矩阵状态,推理成本线性,但压缩导致精度下降,加性写入还会造成记忆溢出。

从记忆科学视角看,两者都缺少人类记忆系统的关键组件:短期记忆、长期记忆、元记忆(持久记忆)以及它们之间的协同。Titans 的核心主张:长期记忆不该是固定结构,而应该是一个神经网络,在测试时用联想记忆损失在线更新自己的权重——越是出乎意料(惊奇)的信息越值得记住。这正是与 TTT、DeltaNet 一脉相承的测试时学习思想,但 Titans 补上了遗忘门、动量更新与深度记忆三个关键设计。

研究主线:从问题到结论

Titans 论文研究主线流程图:问题到结论

图 7:Titans 研究主线(Mermaid 流程图):问题 → 动机 → 设计 → 方法 → 实验 → 结论

基准/方法设计

Titans 架构包含三个分支:核心分支用滑动窗口注意力负责短程精确建模;长期记忆分支是神经记忆模块(LMM),把过去的历史在线压缩进 MLP 权重;持久记忆分支是一组输入无关的可学习参数,编码任务级知识。作者给出三种接入方式:

  • MAC(Memory as Context):把记忆检索结果作为上下文拼进注意力输入,注意力同时决定"需要哪些历史"与"哪些信息值得写入";
  • MAG(Memory as Gate):用门控机制融合记忆输出与滑动窗口注意力输出;
  • MAL(Memory as Layer):把记忆作为网络中的一层,先压缩再交给注意力。

Titans 神经长期记忆架构 MAC 三分支数据流

图 1:Memory as a Context(MAC)架构:核心注意力 + 上下文长期记忆 + 持久记忆三分支

分类全景

Titans 神经记忆分类全景图:短程/长期/持久记忆

图 8:Titans 记忆系统分类全景(Mermaid 流程图):短程注意力、神经长期记忆 LMM 与持久记忆

方法细节

记忆模块的四个关键设计:

  1. 惊奇度量(Surprise):用输入梯度 $\nabla \ell(\mathcal{M}_{t-1}; x_t)$ 衡量意外程度——梯度越大,说明输入越偏离已有记忆,越值得记住;
  2. 动量式更新:$S_t = \eta_t S_{t-1} - \theta_t \nabla \ell$,过去与当前的惊奇共同决定写入,避免一次大惊奇后梯度消失、错过后续重要信息;
  3. 自适应遗忘:权重衰减门 $\alpha_t$ 管理有限容量,$\alpha_t \to 0$ 保留记忆、$\alpha_t \to 1$ 清空记忆,等价于数据依赖的遗忘机制;
  4. 并行化训练:逐 token 串行梯度下降被重写为分块矩阵乘法 + 并行关联扫描,训练吞吐随序列长度线性扩展。

神经记忆并行化训练示意

图 2:神经记忆的并行化训练:分块内用 matmul 与关联扫描,避免串行 O(N) 内循环

理论结果同样重要:Titans 的深度记忆在状态追踪任务上表达力超出 TC⁰,而 Transformer 与多数线性循环模型被限制在 TC⁰ 内。附录中进一步证明,LMM 是 Gated DeltaNet 的严格推广——DeltaNet、Longhorn、RWKV-7、TTT 均可视为其特例(LMM 补上了动量规则、深度记忆与遗忘门)。

MAL 架构:记忆作为网络层

图 5:Memory as a Layer(MAL)架构:记忆层先压缩过去与当前上下文,再交给滑动窗口注意力

实验设计与结果

评测覆盖 170M / 340M / 400M / 760M 四档规模,前三个在 FineWeb-Edu 的 15B token 上训练,760M 用 30B token。任务分五类:语言建模(WikiText、LMB)、常识推理(PIQA、HellaSwag、WinoGrande、ARC、SIQA、BoolQ)、长上下文(RULER S-NIAH、BABILong)、时间序列(ETT、ECL、Traffic、Weather)与 DNA 建模(GenomicsBenchmarks)。基线包括 Transformer++、Mamba、Mamba2、GLA、RetNet、DeltaNet、Gated DeltaNet、TTT 及混合模型 Samba、Gated DeltaNet-H2。

760M / 30B tokens 语言建模主表:

模型Wiki ppl↓LMB ppl↓LMB acc↑平均 acc↑
Transformer++25.2127.6435.7848.69
Mamba222.9428.3733.5448.34
TTT24.1723.5134.7447.32
Gated DeltaNet-H2*19.8820.8339.1851.49
Titans (MAC)*19.9320.1239.6252.51
Titans (MAG)*18.6119.8640.9852.50

Titans 在困惑度与推理两个维度同时压过同规模全部模型:MAG 的 Wiki 困惑度 18.61 比最强混合基线 Gated DeltaNet-H2 低 1.27,平均准确率 52.51(MAC)领先 1.02 个百分点。纯记忆模块 LMM(不带注意力)在简单模型中同样最优,证明记忆机制本身有效。

BABILong 微调结果:Titans MAC 超越 GPT-4

图 3:BABILong 微调设定:Titans(MAC)在 1M 级长文档推理上超越 GPT-4 等超大模型

训练吞吐对比

图 4:训练吞吐对比:Titans(MAL)吞吐随序列长度保持恒定,快于多数循环基线

长上下文是 Titans 的主场。S-NIAH(RULER 基准)中,序列从 2K 拉到 16K 时 TTT 从 98.4 掉到 88.4、Mamba2 从 98.6 崩到 5.4、DeltaNet 从 96.8 掉到 71.4,而 Titans 三个变体在 16K 仍保持 96 以上(MAC 达 98.4);BABILong 微调设定下,Titans(MAC)以不到 8 亿参数超越 Llama3.1-8B+RAG、GPT-4 与 Qwen2.5-72B。时间序列预测中,神经记忆在 7 个数据集的 6 个取得最优 MSE(ETTm2 0.261、ECL 0.162、Weather 0.231 等),全面优于 Simba、iTransformer、PatchTST。DNA 建模(GenomicsBenchmarks)上神经记忆在 Enhancer Cohn(75.2)与 Enhancer Ens(89.6)取得最优,与最强 DNA 模型 HyenaDNA 竞争性相当。

消融实验(附录 E)显示所有组件均为正向贡献,影响排序为权重衰减 > 动量 > 卷积 > 持久记忆:去掉权重衰减后长上下文准确率从 92.68 掉到 85.60,印证遗忘机制对记忆容量管理的核心作用;记忆深度从 1 层增加到 4 层,困惑度持续下降且对序列长度更鲁棒(但吞吐随深度线性下降,存在效果与效率权衡)。

深度记忆效果:ppl 随序列长度变化

图 6:不同记忆深度下 ppl 随序列长度的变化:更深的记忆在更长序列上收益更明显(170M 规模)

结果对比总结

Titans 结果对比总结图:基线到方法的提升

图 9:结果对比总结(Mermaid 流程图):Titans 在困惑度与准确率双维度领先基线

关键发现

  • 记忆即在线学习:长期记忆是一个在测试时做梯度下降的神经网络,联想记忆损失 $\ell = | \mathcal{M}(k_t) - v_t |_2^2$ 驱动写入,这是全文最核心的范式转变。
  • 有效上下文超 200 万 token:在 S-NIAH 与 BABILong 上,Titans 在 16K–1M 级序列保持 96% 以上准确率,而 Mamba2 在 16K 时已跌至 5.4%。
  • 760M 规模全面领先:Wiki 困惑度 18.61(MAG)与平均准确率 52.51(MAC),同时击败同规模 Transformer++(25.21 / 48.69)与全部混合基线。
  • 纯记忆模块即可打满全场:不带注意力的 LMM 在简单模型中困惑度最优(760M 下 20.04),证明记忆机制独立有效。
  • 精度与效率兼得:MAL 变体训练吞吐高于多数循环基线,得益于 Flash-Attention 与并行化记忆更新的组合。
  • 跨领域泛化:时间序列 6/7 数据集最优、DNA 建模与 SOTA 竞争性相当,机制不止适用于自然语言。

局限性

  • 规模验证有限:论文第一版仅报告到 760M / 30B token,更大规模的结论待后续版本。
  • 实现开销:深度记忆的测试时更新带来额外计算,吞吐略低于内核高度优化的 Mamba2。
  • 可解释性不足:记忆写入权重的语义难以直接审计,不像 KV 缓存那样显式可读。
  • 流式稳定性:测试时持续学习在长流式场景下的稳定性仍需更充分验证。
  • 作者计划开源 PyTorch / JAX 实现,并接入更复杂的记忆架构(如进化记忆、Muon 类更新)。

常见问题(FAQ)

Titans 和 TTT 有什么区别?

TTT 是 Titans 最接近的前作:两者都把记忆当作梯度更新的模型。但 TTT 没有遗忘机制,长序列会记忆溢出;Titans 引入权重衰减(自适应遗忘门)、动量式惊奇更新与深度记忆,并在消融中验证了每个组件的贡献。

MAC、MAG、MAL 三种变体怎么选?

MAC 长上下文最强(注意力帮记忆筛选信息)、MAG 语言建模困惑度最低(18.61)、MAL 训练吞吐最高(注意力走 Flash-Attention)。追求长程推理选 MAC,追求吞吐选 MAL。

Titans 为什么能超过 200 万 token?

因为长期记忆是参数化的:历史被在线压缩进网络权重而非显式 KV 缓存,推理成本不随历史长度增长;短程注意力只处理当前窗口,两者叠加使有效上下文远超窗口大小。

为什么说 LMM 是 Gated DeltaNet 的推广?

DeltaNet / Gated DeltaNet 的 Delta 规则只考虑瞬时惊奇且限于线性矩阵记忆;LMM 加入动量规则、深度 MLP 记忆与非线性递推,令前者成为 $\eta_t = 0$ 时的特例,RWKV-7、Longhorn 同理。

神经记忆在非语言任务上表现如何?

时间序列预测 7 个数据集中 6 个取得最优 MSE(如 ETTm2 0.261、Weather 0.231),DNA 建模在 GenomicsBenchmarks 与 HyenaDNA 竞争性相当,说明记忆机制对结构化数值与生物学序列同样有效。

有哪些已知局限?

760M 规模封顶、吞吐略慢于 Mamba2、记忆权重不可解释、流式场景稳定性待验证;代码当时尚未开源,社区复现需自行实现。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2501.00663
  • Mamba(线性时间序列建模):https://arxiv.org/abs/2312.00752
  • TTT(测试时学习的 RNN):https://arxiv.org/abs/2407.04620
  • Gated Delta Networks:https://arxiv.org/abs/2412.06464
  • Agent Memory Survey(Titans 列为参数化记忆代表):https://arxiv.org/abs/2512.13564

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

内容概要:本文针对有源中点箝位(ANPC)三电平并网逆变器在复杂电网环境下的性能瓶颈,提出了一种融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相技术与电网电压前馈控制的一体化高性能并网控制策略。通过深入分析ANPC三电平拓扑在开关损耗均衡性、中点电位稳定性及输出电能质量方面的固有优势,构建了高可靠性的硬件基础;在此之上,DPWMA调制策略有效提升了开关频率利用率,显著降低了输出电流谐波含量;正负序分离锁相环(SRF-PLL)精准提取电网正序分量,解决了电网不平衡工况下传统锁相技术存在的相位检测偏差与并网电流不对称问题;电网电压前馈控制则通过前馈补偿机制,提前抑制电网电压扰动对并网电流的直接影响,大幅增强了系统在电压骤升、骤降等动态工况下的响应速度与鲁棒性。研究通过Simulink搭建了完整的仿真模型,对稳态运行、电网不平衡及动态切换等多种工况进行了全面验证,结果表明该复合控制策略能显著提升并网电能质量、锁相精度与系统动态稳定性,适用于新能源发电、大功率工业变流等对并网性能要求严苛的应用场景。; 适合人群:具备电力电子与电力系统基础知识,从事新能源发电、微电网、大功率变流器、电能质量治理等相关领域研究的研发人员及高校研究生。; 使用场景及目标:①解决传统三电平逆变器在电网不平衡条件下锁相不准、电流畸变严重的问题;②提升并网逆变器在电压骤升/骤降等动态扰动工况下的响应速度、抗扰能力与并网稳定性;③为高性能、高可靠性的并网控制系统设计提供一套可复现、可验证的技术方案与完整的仿真模型参考。; 阅读建议:建议读者结合文中提供的Simulink仿真模型,按照“拓扑分析-控制策略设计-仿真验证”的逻辑主线,循序渐进地理解各模块的设计原理,重点钻研正负序分离锁相与电网电压前馈控制的实现细节,并通过设置不同的电网扰动工况进行仿真实验,对比分析控制效果,从而深入掌握多技术协同优化的内在机理与工程应用价值。
代码转载自:https://pan.quark.cn/s/679a7257f458 在Windows操作系统环境中,开发多线程程序是一项普遍存在的编程需求,其主要目的是为了达成不同任务的并行处理,从而优化程序的执行效能。在C++开发情境下,我们一般会借助WinAPI提供的`_beginthreadex`函数来进行线程的构建,此方法具备跨操作系统的兼容性,并且是C运行库(CRT)所包含的一部分。本文将深入剖析如何运用`_beginthreadex`函数来构建多线程以及相关的技术要点。 首先,让我们明确`_beginthreadex`函数的基本操作方法。该函数需要接收若干个参数,包括一个指向安全属性的指针、初始堆栈的尺寸、一个线程执行函数的指针、传递给线程执行函数的参数、线程的创建标识以及一个存放线程标识符的指针。线程执行函数是新线程将要运行的代码的起始位置。下面给出一个基础的实例代码: ```cpp uintptr_t thread_id; HANDLE hThread = (HANDLE)_beginthreadex( NULL, // 指向安全属性的指针,通常设置为NULL 0, // 堆栈尺寸,若传入0则表示采用系统默认值 ThreadFunction, // 指向线程执行函数的指针 NULL, // 传递给线程执行函数的参数,可以根据需求自定义 CREATE_SUSPENDED, // 线程的创建标识,可以选择使用CREATE_SUSPENDED来使线程处于挂起状态 &thread_id // 用于接收线程标识符的指针 ); ``` 在此代码中,`ThreadFunction`代表用户自定义的函数,它将作为新线程执行的起始点。例如: ```cpp D...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值