返回

团队研究成果被《Journal of the Royal Statistical Society Series B》正式接收

近日,由团队常晋源教授、黄光麟副研究员,英国伦敦政治经济学院姚琦伟教授与上海财经大学虞龙副教授合作完成的论文“CP-factorization for high-dimensional tensor time series and double projection iterations”被统计学国际顶级学术期刊《Journal of the Royal Statistical Society Series B》正式接收。论文提出了一种适用于高维张量时间序列的CP因子估计与推断方法,并将其用于分析北京空气污染在不同监测站、污染物和日内时段上的多维动态结构。

                        内容简介   

从高维复杂数据到多维结构识别:张量时间序列分析的新挑战

高维张量时间序列广泛存在于环境监测、金融、交通等领域。这类数据不仅随时间动态变化,还同时包含多个维度之间复杂的交互结构。与传统向量或矩阵数据相比,直接将张量数据向量化往往会破坏其原有的多维结构,并带来较高的计算和统计成本。CP(canonical polyadic)分解通过少数潜在因子及其在不同维度上的载荷对高维张量进行低维表示,为刻画这类复杂数据提供了自然的建模工具。然而,现有部分张量CP因子模型的估计方法依赖潜在因子近似不相关或因子载荷近似正交等较强假设,当不同潜在因子之间具有较强相关性时,其估计效果可能受到明显影响。针对这一问题,本文提出了一套适用于高维张量时间序列的CP因子估计与统计推断方法,在仅要求各维度因子载荷向量线性无关的条件下,允许潜在因子之间存在相关性以及因子载荷显著偏离正交结构,同时能够适应稀疏载荷和弱因子等复杂情形。

从一步估计到双重投影:提升高维张量因子估计的准确性
在方法上,研究首先利用张量时间序列的滞后依赖信息构造特定矩阵,通过标准特征分析得到因子载荷的一步估计量,从而避免复杂的多阶段估计及其带来的误差累积。在此基础上,论文进一步提出双重投影迭代方法:一方面利用已有载荷估计将原始高维张量数据投影到低维空间,降低高维估计带来的噪声和计算负担;另一方面对估计得到的因子序列进一步进行投影去相关,以削弱其他潜在因子对目标因子估计的干扰,使方法在潜在因子高度相关的情况下仍能够有效工作。针对实际分析中因子个数未知的问题,论文还提出了对数特征值比方法用于选择潜在因子个数。
从参数估计到统计推断:构建完整的高维张量分析框架
在理论方面,论文系统建立了一步估计量和双重投影迭代估计量的一致性与收敛速度,并从理论上刻画了迭代过程对估计精度的改进。进一步地,研究推导了双重投影估计量的渐近分布,构造了相应的偏差校正和渐近方差估计方法,从而使得对高维张量因子载荷进行置信区间构造和显著性检验成为可能。由此,本文形成了从因子识别、参数估计到统计推断的一套较为完整的高维张量时间序列分析框架。
在复杂因子相关结构下实现更稳定、更高效的估计
模拟研究考察了不同因子相关程度、因子载荷相关程度和稀疏程度下各方法的表现。结果表明(见图1),当潜在因子相关性较弱时,多种迭代方法均能获得较好的估计结果;当潜在因子高度相关时,依赖因子不相关条件的HOPE(Han et al., 2024)和CC-ISO方法(Chen et al., 2026)的估计误差可能无法随着迭代继续下降,而本文提出的双重投影迭代方法(Pro.iter)在不同初始估计下均能够快速降低估计误差,并在少量迭代后趋于稳定。进一步的计算实验比较了不同方法在数据维度不断增加时的运行时间。结果显示(见图2),在低维情况下三种方法的计算时间较为接近;随着维度增加,HOPE和CC-ISO的运行时间增长较快,而本文提出的双重投影迭代方法增长更加平缓,表现出更好的高维计算效率。
图1
图2
从多维观测到潜在污染模式:在北京空气污染数据中的验证
论文进一步将所提方法应用于北京市空气污染数据。研究将2013—2017年12个空气质量监测站、6类污染物和24个日内时段的观测组织成三阶张量时间序列,并识别出两个具有明确环境含义的潜在因子:第一个因子主要反映臭氧浓度变化,被解释为臭氧相关因子;第二个因子主要反映PM2.5、PM10、SO2、NO2和CO等多种污染物的共同变化,被解释为一般污染因子。在空间维度上,臭氧相关因子在不同监测站上的载荷较为均匀,而一般污染因子具有更明显的空间异质性。此外,日内变化分析表明,臭氧相关因子在午后达到高峰,呈现典型的光化学变化特征,而一般污染因子表现出明显的早晚双峰;从长期变化看,前者总体呈现夏季较高、冬季较低的季节规律,后者则表现出相反的变化特征。这些结果与北京空气污染已有研究所揭示的光化学污染和多污染物共同污染特征相吻合,表明本文方法能够从复杂的多站点、多污染物动态数据中提取具有明确环境解释的潜在污染模式。研究进一步体现了该方法在高维张量时间序列降维、结构识别与统计推断方面的优势,也展现出其在复杂环境与时空数据分析中的良好应用潜力。
图3

作者简介

常晋源,西南财经大学光华首席教授、统计交叉创新研究院执行院长、数据科学与商业智能联合实验室执行主任。主要从事复杂数据分析相关的研究。
黄光麟,西南财经大学统计交叉创新研究院副研究员。主要从事时间序列分析、金融风险管理和高维面板数据分析等领域的研究。
姚琦伟,英国伦敦政治经济学院讲席教授。主要从事高维时间序列分析、降维和因子建模、动态网络建模、时空建模、非平稳过程和协整分析等领域的研究。
虞龙,上海财经大学统计与数据科学学院副教授。主要从事因子模型、高维数据分析和随机矩阵理论等领域的研究。