★ 张萍(国网江苏省电力有限公司泰兴市供电分公司,江苏 泰兴 225400 )
关键词:两步Pair-Copula;供电计量数据;异常值;主动辨识;核密度估计;边缘分布;条件概率函数;置信区间
供电计量数据是用电特征提取、用电趋势分析以及电能管理规划的重要依据,精准辨识计量数据中的异常值是开展精细化用电管理的关键。众多学者围绕电能计量数据异常识别方向开展了大量研究工作。其中,黄公跃等人提出了一种基于数据挖掘和机器学习的方法[1]。该方法通过分析电能计量数据的特征,构建了异常识别模型,能够有效检测数据中的异常点。实验结果表明,该方法在异常识别的准确率和计算效率方面表现优异,为电能计量数据的质量管理提供了技术支持。但是在动态非参数变量场景下,该方法异常点识别的准确性较低;贾旭超等人提出了一种基于孤立森林(Isolation Forest)算法的电能计量数据异常检测方法[2]。该方法通过孤立森林算法对电能计量数据进行建模,能够快速识别数据中的异常点。实验结果表明,该方法在异常检测的准确率和计算效率方面具有显著优势,适用于大规模电能计量数据的实时监测。但其异常点识别的准确性高度依赖原始数据的质量;金晨提出了一种基于深度神经网络(Deep Neural Network, DNN)的电能计量异常筛选方法[3]。该方法通过构建DNN模型, 对电能计量数据进行训练和预测, 能够有效识别数据中的异常点。实验结果表明,该方法在异常筛选的准确率和鲁棒性方面表现优异,为电能计量数据的智能化管理提供了新的解决方案。但当DNN的训练样本无法覆盖所有异常状态时,模型对异常点识别的准确性较低。
在上述基础上,本文开展了基于两步Pair-Copula的供电计量数据异常值主动辨识方法的研究,并在数据集上对该方法的异常辨识性能进行了具体的分析。
1 供电计量数据异常值主动辨识方法设计
1.1 非参数变量Pair-Copula边缘分布计算
供电计量数据与客观变量状态密切相关,直接依据计量数据值的分布对异常值进行辨识时,往往存在较大误差。针对此,本文基于Pair-Copula对供电计量数据异常值进行主动辨识时,引入了关联供电计量数据值的非参数变量,对其边缘分布进行计算。
供电计量数据的非参数变量具有连续属性,导致其分布类型不明确。针对此,本文采用非参数核密度估计法开展基于供电计量数据本身的概率密度估计,得到对应的边缘分布,以此避免分布类型假设错误引起的非参数变量边缘分布计算误差。其中,供电计量数据非参数变量的核密度估计表达式如式(1)、式(2)、式(3)所示:

其中,K(x)表示供电计量数据的非参数随机变量x的高斯核函数; g(x)表示时序函数,利用其确保非参数随机变量在同一时间维度;f(x)表示供电计量数据的非参数随机变量x的边缘分布估计结果;N表示供电计量数据非参数随机变量的总体规模; xn表示供电计量数据非参数随机变量的具体参数; 表示供电计量数据非参数随机变量的分布区间范围。
按照上述所示的方式,确定非参数变量的Pair- Copula边缘分布,并将其作为后续异常值辨识的判定基础。
1.2 供电计量数据Pair-Copula置信分布判定
根据关联供电计量数据值的非参数变量边缘分布情况,本文在对供电计量数据异常值进行辨识时,利用Pair-Copula确定供电计量数据的置信分布,将超出置信区间上下边界的数值判定为异常值。
结合非参数变量Pair-Copula边缘分布,电计量数据在置信区间的分布概率可表示为式(4)、式(5):

其中,F(y)表示电计量数据y的置信区间; H(*)表示条件概率函数; β和down分别表示电计量数据高于置信区间F(y)上限和低于置信区间F(y)下限的概率;K表示置信区间F(y)的不对称系数; a表示电计量数据的置信概率。
结合式(5)的计算结果,将超出置信区间范围的电计量数据判定为异常值,以此保障异常辨识结果的准确性。
2 算例分析
2.1 测试数据
本次测试数据来源于某实际运行的电力计量系统。该系统中包含每个用户在每个特定时间间隔内的电力消耗情况,具体涵盖每日数据。为确保数据质量,首先对原始的供电计量数据记录进行过滤,根据实际需求设定数据对应的时间范围为24h,并将其中100位用户作为具体的筛选对象,最终输出的测试数据集共包含684条供电计量数据,对应数据采样频率为30.0min/次。具体的测试数据信息如表1所示。
表1 测试数据信息

将过滤后的测试数据集保存为Excel文档,作为异常值辨识分析的数据基础。
2.2 测试结果
本实验在对本文设计的供电计量数据异常值辨识方法的性能进行分析时,选取基于孤立森林,以及基于DNN的电能计量异常筛选方法作为对照组。
首先,对三种不同方法的异常值漏检数量进行对比分析,结果如图1所示。

图1 异常值未识别或检出数量对比图
由图1所示的测试结果可知,本文设计方法对测试数据不同时序下的异常值未识别数量始终低于3.0, 表明其具有有效的辨识性能。该方法利用数据与置信区间之间的分布关系对异常值进行判断,大大降低了以定值参数为基准进行判定引起的偏差,显著提高了异常辨识准确度。
其次,对三种不同方法的异常值误检数量进行对比分析,结果如图2所示。
由图2所示的测试结果可知,本文设计方法的异常值误检数量最少,表明其具有更高的辨识准确性。该方法利用Pair-Copula对供电计量数据非参数变量的边缘分布情况进行分析,使得作为异常值判断基准的置信区间更加合理,保障了异常辨识结果的准确性。

图2 异常值错误识别或检出数量对比图
3 结束语
本文开展了基于两步Pair-Copula的供电计量数据异常值主动辨识方法的研究。该方法在考虑关联供电计量数据值的非参数变量连续属性的基础上,采用核密度估计法确定了非参数变量的具体Pair-Copula边缘分布,确保了供电计量数据置信区间的设置能够适应非参数变量,并根据供电计量数据与置信阈值之间的关系,实现了异常值的准确辨识。实验结果表明,该方法的异常值未识别数量和误识别数量均处于较低水平,能够实现供电计量数据异常值的可靠、精准辨识。 AP
作者简介:
张 萍 (1981-)女,江苏泰兴人,工程师,学士,现就职于国网江苏省电力有限公司泰兴市供电分公司,研究方向为计量技术。
参考文献:
[1] 黄公跃, 付婷婷, 林思远, 等. 用电信息采集系统电能计量数据异常识别研究[J]. 电网与清洁能源, 2023, 39 (04) : 25 - 30 + 46.
[2] 贾旭超, 马迅, 刘安磊, 等. 基于孤立森林法的电能计量数据异常检测方法[J]. 河北电力技术, 2023, 42 (02) : 41 - 45.
[3] 金晨. 基于深度神经网络的电能计量异常筛选方法[J]. 数字通信世界, 2023, (01) : 84 - 86.
摘自《自动化博览》2026年6月刊






案例频道