Positional Encoding 解决序列顺序问题,让模型知道 token 的相对前后。
为什么会想到 Temporal Embedding
现有 Transformer 对“位置”敏感,但对“时间”并不原生敏感。它知道句子内部的先后顺序,却不天然知道一条内容发生在去年、今天还是几小时之后。
现实任务中的“最新”“今天”“下周”“昨晚”都依赖明确时间锚点。
模型当前更多是文本匹配日期,而不是结构化建模时间。
- 新闻、搜索、金融、客服、多轮对话、知识更新,本质上都带有强时间属性。
- 同一句文本在不同时间点可能含义不同,时间不是附属 metadata,而是语义变量。
- 如果时间只存在于 prompt 文本里,模型仍主要是在“猜”;如果时间以 embedding 形式进入表示层,才有机会成为底层结构信号。
Temporal Embedding 是什么
Temporal Embedding 是一种将绝对时间信息编码为连续向量,并注入 Transformer 表示层的机制。它让模型在处理文本时,不只看内容和位置,也同时看“这段内容发生在什么时间”。
Absolute Temporal Embedding (ATE)
ATE 是主时间轴。它提供统一的绝对时间锚点,例如 UTC 时间戳、日期、时段以及周期分量。它回答的是: 内容发生在什么时候、谁更早谁更晚、与当前时间相距多远。
Locale Context Embedding (LCE)
LCE 是本地语境层。它补充时区、地区、本地时间、工作日与节假日、昼夜阶段等上下文, 回答的是:同一个绝对时间点,对某个用户意味着清晨、午间还是深夜。
- ATE 是研究主问题,应常驻输入,不做 input-dependent gate。
- LCE 更适合作为辅助变量,可在第二阶段做 no-gate 与 gate 对比。
- 这不是替代 Positional Encoding,而是在 token 和 position 之外,补上第三类基础坐标:time。
它与 Position Encoding 的关系
相同点:都在补模型缺失的坐标系
位置编码给模型一个序列坐标系;时间嵌入给模型一个现实时间坐标系。
不同点:位置回答“在文本里哪儿”,时间回答“在世界里何时”
前者描述 token 顺序,后者描述内容发生时间、时间间隔和时效性。
研究价值:从静态文本建模,走向带时间轴的世界建模
如果这个假设成立,时间将不只是注释信息,而会成为模型组织知识与注意力的底层变量。
实验构思的核心假设
假设一
把绝对时间作为结构化信号注入 Transformer,会改变模型的表示空间组织方式。
假设二
这种变化会提升模型对动态知识、时序关系和时间条件任务的处理能力。
假设三
本地语境可能进一步增强效果,但不是第一阶段必须解决的问题。
- 第一阶段要验证的是“时间本身进入模型有没有价值”,而不是先做完整系统。
- absolute time 常驻输入可以让因果更清楚,避免把“时间有效”与“门控机制有效”混在一起。
- 无 gate 不等于无约束。ATE 仍应有固定投影、归一化和受控幅度,防止信号过强污染实验。
如何进行 Pretrain
预训练阶段的目标,不是换掉语言模型任务,而是在原有语言建模过程中,让模型同时学习“文本内容”和“时间坐标”的联合分布。
1. 数据准备
预训练语料除了文本本身,还尽量带有时间标签。新闻、论坛、博客、论文、知识库、日志、对话记录,都可以作为天然时间语料来源。
2. 时间表示构造
为每条样本抽取时间锚点,编码为 ATE。编码内容可以包括连续时间戳、年月日时、周期分量,以及需要时的相对时间特征。
3. 进入表示层
在输入端将 temporal embedding 与 token embedding、position embedding 联合输入,使模型从一开始就在“文本 + 位置 + 时间”的坐标系中学习。
4. 训练目标保持稳定
总体仍然沿用语言模型目标,不急于重新设计大而全的新目标函数。重点是观察时间信号进入模型后,表示学习与泛化能力是否发生变化。
如何进行 Finetune
微调阶段的目标,是把预训练中获得的基础时间表征迁移到具体任务中,验证它是否真正可用。
适合验证的任务
- 时间排序与时序推理
- 新闻和事件的新旧判断
- 时间条件问答
- 带时间上下文的多轮对话
- 具有时效性的检索与生成
微调阶段的关注点
- 时间信号是否能稳定迁移到下游任务
- ATE 与 LCE 各自贡献什么
- 是否值得继续走向工业系统级优化
- 时间输入应长期保留,而不是在下游阶段被拿掉
建议的研究路径
第一阶段:验证主命题
先回答 ATE 是否值得进入 Transformer 底层。这个阶段追求因果清晰,而不是系统完整。
第二阶段:验证条件增强
在 ATE 基础上引入 LCE,对比 no-gate 与 gate,观察本地化时间语境是否带来稳定收益。
第三阶段:再谈工程化
更复杂的联合优化、记忆系统、检索增强、时间约束推理,都可以留到后续工业实现,而不应抢走第一篇研究的主线。
这个实验构思的价值
理论价值
在 token 与 position 之外,探索 time 是否可以成为第三类基础坐标。
应用价值
对新闻、搜索、对话、知识更新、长记忆 agent 等场景都具有潜在意义。
战略价值
它帮助回答一个更大的问题:大模型是否需要从静态语料建模走向动态世界建模。