温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。

作者:王艺霏 (北京第二外国语学院)
邮箱:wyyfff02@163.com

Source: Du, W., Wang, J., Qian, L., Yang, Y., Ibrahim, Z., Liu, F., Wang, Z., Liu, H., Zhao, Z., Zhou, Y., Wang, W., Ding, K., Liang, Y., Prakash, B. A., & Wen, Q. (2024). TSI-Bench: Benchmarking Time Series Imputation (Version 2). arXiv. Link (rep), PDFGooglegithub

  • Title:Python 包 TSI-Bench:时间序列缺失值插补新框架
  • Keywords:时间序列插补, 缺失值处理, 预测模型迁移, TSI‑Bench, 标准化基准

0. 引言

在实证研究中,时间序列数据与面板数据是我们开展研究工作的核心载体。无论是宏观经济指标、微观企业数据、高频金融序列,还是区域经济与民生相关监测数据,都可能出现观测值缺失的情况。同时,统计口径调整、调查中断、设备故障、监测延迟、样本退出,也都会让原本完整的数据结构出现缺口。

面对数据缺失,传统的处理方式往往过于简单。直接删除缺失样本,会造成有效信息损失,降低估计效率,在小样本或关键时段缺失时,甚至会导致研究无法继续。而随意采用均值、插值等方法填充,又可能扭曲数据本身的时序趋势、变量相关关系与经济结构,使得回归系数、因果效应、预测结果出现系统性偏差,最终影响结论的可靠性。

过去十余年间,时间序列插补技术不断发展,从传统的统计方法,到深度学习专用模型,再到近年来基于 Transformer 的预测模型,方法层出不穷。但在实际的计量研究中,研究者普遍面临三个难以解决的问题:

  1. 方法种类繁多,却没有统一的对比标准。
  2. 多数方法面向计算机领域设计,专业术语复杂、代码门槛高,计量研究者难以快速理解、复现与应用。
  3. 缺乏与实证研究场景匹配的实操指南。

正是在这样的背景下,TSI‑Bench 应运而生。它首次将插补方法的对比、验证、应用纳入统一框架,并提出了预测模型迁移插补这一低成本、高性能的创新思路,让原本复杂的插补任务变得可复现、可对比、可落地。

接下来,我们将从传统插补方法出发,逐步过渡到三大核心突破,结合具体的经济数据案例,讲解方法逻辑、实验设计与实操建议,并在对应位置提供论文官方开源代码,以便各位读者能够真正将前沿插补技术应用到自己的实证研究之中。

1. 计量研究中常见的传统插补方法

在介绍时序序列插值创新成果之前,我们先回顾计量研究中最常用、最容易上手的传统插补方法。

1.1 传统朴素插补方法

传统朴素插补方法,以计算简单、无需建模、无需调参为特点,在早期计量研究与快速数据预处理中广泛使用。

  • 均值与中位数插补:对某一变量的全部观测值计算均值或中位数,直接用该数值填充所有缺失位置。这种方法在横截面数据中偶尔使用,但在时间序列中缺陷极为明显,它完全忽略时序趋势与周期性。
    例如,对月度CPI数据使用全年均值填充缺失值,会抹平通胀的季节性波动,导致后续回归出现明显偏误。

  • LOCF 与 NOCB : 插补。 LOCF 用上一期观测值填充当前缺失值,适用于短期、平稳的时序数据; NOCB 则是用未来最近一期的值反向填充。在金融交易数据、月度工业产值数据中, LOCF 较为常用,但如果出现连续多期缺失,填充结果会完全失真。

  • 线性插值:以缺失位置前后两个观测点为基准,构建线性直线,用直线上的数值填充缺失段。这种方法能够捕捉简单的趋势,适用于缺失长度较短、变化平稳的经济数据。
    例如,填充某一个月缺失的固定资产投资增速,线性插值通常优于均值插补。

这一类方法的共同特点是:实现简单、速度快,但假设过强,无法捕捉非线性趋势、周期性与多变量联动关系,在中高缺失率、连续块缺失场景下不再适用。

1.2 传统插补专用模型

随着机器学习与深度学习的发展,学术界陆续提出一批专门用于时间序列插补的模型。这类模型能够建模时序依赖、多变量相关关系与不规则缺失模式,精度显著优于朴素方法。

  • BRITS :基于双向循环神经网络构建,同时利用历史与未来信息进行插补,特别适合存在不规则缺失、采样间隔不固定的面板数据。在计量研究中,它适用于部分个体缺失、部分时段缺失的微观面板与区域面板数据。

  • SAITS :基于自注意力机制设计,能够同时捕捉长期时序依赖与多变量之间的关联关系。在宏观经济联立指标、多变量金融时序插补任务中,SAITS 表现稳定,是过去数年插补领域的代表性模型。

  • CSDI :基于扩散模型的生成式插补方法,通过逐步生成的方式还原缺失数据,插补精度高,但计算量大、推理速度慢,更适合对精度要求极高、对实时性要求较低的研究场景。

这些专用模型虽然精度更高,但仍然存在明显局限:模型结构复杂、训练成本高、复现门槛高;不同模型的输入输出格式不统一;在计量研究中,研究者难以快速对比不同方法的优劣。

温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐