remember-me.ai / liuzhao1225 / Temporal Embedding
Research Concept Note

Temporal
Embedding

为 Transformer 引入时间认知的实验构想。核心目标不是先做一个工业系统,而是回答一个更基础的问题: 时间能否像位置一样,进入模型底层表示,成为大模型理解动态世界的结构性信号。

为什么会想到 Temporal Embedding

01 / Background

现有 Transformer 对“位置”敏感,但对“时间”并不原生敏感。它知道句子内部的先后顺序,却不天然知道一条内容发生在去年、今天还是几小时之后。

位置

Positional Encoding 解决序列顺序问题,让模型知道 token 的相对前后。

时间

现实任务中的“最新”“今天”“下周”“昨晚”都依赖明确时间锚点。

缺口

模型当前更多是文本匹配日期,而不是结构化建模时间。

  • 新闻、搜索、金融、客服、多轮对话、知识更新,本质上都带有强时间属性。
  • 同一句文本在不同时间点可能含义不同,时间不是附属 metadata,而是语义变量。
  • 如果时间只存在于 prompt 文本里,模型仍主要是在“猜”;如果时间以 embedding 形式进入表示层,才有机会成为底层结构信号。
因此自然会出现一个研究问题:既然 Transformer 已经通过位置编码解决了“序列坐标”,是否也可以通过一种系统机制,把“现实时间坐标”写进模型内部?

Temporal Embedding 是什么

02 / Concept

Temporal Embedding 是一种将绝对时间信息编码为连续向量,并注入 Transformer 表示层的机制。它让模型在处理文本时,不只看内容和位置,也同时看“这段内容发生在什么时间”。

Absolute Temporal Embedding (ATE)

ATE 是主时间轴。它提供统一的绝对时间锚点,例如 UTC 时间戳、日期、时段以及周期分量。它回答的是: 内容发生在什么时候、谁更早谁更晚、与当前时间相距多远。

Locale Context Embedding (LCE)

LCE 是本地语境层。它补充时区、地区、本地时间、工作日与节假日、昼夜阶段等上下文, 回答的是:同一个绝对时间点,对某个用户意味着清晨、午间还是深夜。

token representation = token embedding + positional embedding + absolute temporal embedding (+ optional locale context embedding)
  • ATE 是研究主问题,应常驻输入,不做 input-dependent gate。
  • LCE 更适合作为辅助变量,可在第二阶段做 no-gate 与 gate 对比。
  • 这不是替代 Positional Encoding,而是在 token 和 position 之外,补上第三类基础坐标:time。

它与 Position Encoding 的关系

03 / Framing

相同点:都在补模型缺失的坐标系

位置编码给模型一个序列坐标系;时间嵌入给模型一个现实时间坐标系。

不同点:位置回答“在文本里哪儿”,时间回答“在世界里何时”

前者描述 token 顺序,后者描述内容发生时间、时间间隔和时效性。

研究价值:从静态文本建模,走向带时间轴的世界建模

如果这个假设成立,时间将不只是注释信息,而会成为模型组织知识与注意力的底层变量。

实验构思的核心假设

04 / Hypothesis

假设一

把绝对时间作为结构化信号注入 Transformer,会改变模型的表示空间组织方式。

假设二

这种变化会提升模型对动态知识、时序关系和时间条件任务的处理能力。

假设三

本地语境可能进一步增强效果,但不是第一阶段必须解决的问题。

  • 第一阶段要验证的是“时间本身进入模型有没有价值”,而不是先做完整系统。
  • absolute time 常驻输入可以让因果更清楚,避免把“时间有效”与“门控机制有效”混在一起。
  • 无 gate 不等于无约束。ATE 仍应有固定投影、归一化和受控幅度,防止信号过强污染实验。

如何进行 Pretrain

05 / Pretrain

预训练阶段的目标,不是换掉语言模型任务,而是在原有语言建模过程中,让模型同时学习“文本内容”和“时间坐标”的联合分布。

1. 数据准备

预训练语料除了文本本身,还尽量带有时间标签。新闻、论坛、博客、论文、知识库、日志、对话记录,都可以作为天然时间语料来源。

2. 时间表示构造

为每条样本抽取时间锚点,编码为 ATE。编码内容可以包括连续时间戳、年月日时、周期分量,以及需要时的相对时间特征。

3. 进入表示层

在输入端将 temporal embedding 与 token embedding、position embedding 联合输入,使模型从一开始就在“文本 + 位置 + 时间”的坐标系中学习。

4. 训练目标保持稳定

总体仍然沿用语言模型目标,不急于重新设计大而全的新目标函数。重点是观察时间信号进入模型后,表示学习与泛化能力是否发生变化。

Pretrain 阶段真正想回答的是:时间坐标是否值得成为 Transformer 的底层输入变量,而不是只做 prompt 里的附加文本。

如何进行 Finetune

06 / Finetune

微调阶段的目标,是把预训练中获得的基础时间表征迁移到具体任务中,验证它是否真正可用。

适合验证的任务

  • 时间排序与时序推理
  • 新闻和事件的新旧判断
  • 时间条件问答
  • 带时间上下文的多轮对话
  • 具有时效性的检索与生成

微调阶段的关注点

  • 时间信号是否能稳定迁移到下游任务
  • ATE 与 LCE 各自贡献什么
  • 是否值得继续走向工业系统级优化
  • 时间输入应长期保留,而不是在下游阶段被拿掉
recommended ablation: token + pos token + pos + abs_time token + pos + abs_time + local_context token + pos + abs_time + gated_local_context

建议的研究路径

07 / Roadmap

第一阶段:验证主命题

先回答 ATE 是否值得进入 Transformer 底层。这个阶段追求因果清晰,而不是系统完整。

第二阶段:验证条件增强

在 ATE 基础上引入 LCE,对比 no-gate 与 gate,观察本地化时间语境是否带来稳定收益。

第三阶段:再谈工程化

更复杂的联合优化、记忆系统、检索增强、时间约束推理,都可以留到后续工业实现,而不应抢走第一篇研究的主线。

这个实验构思的价值

08 / Value

理论价值

在 token 与 position 之外,探索 time 是否可以成为第三类基础坐标。

应用价值

对新闻、搜索、对话、知识更新、长记忆 agent 等场景都具有潜在意义。

战略价值

它帮助回答一个更大的问题:大模型是否需要从静态语料建模走向动态世界建模。

Temporal Embedding 的意义,不在于给文本多加一个日期字段,而在于测试一件更底层的事:时间能否像位置一样,成为模型组织知识、理解世界、处理变化的结构性信号。