本发明属于城市道路交通,涉及一种城市道路信号交叉口饱和车头时距泛化估计方法及系统。
背景技术:
1、城市道路信号交叉口是城市路网交通供需矛盾突出的关键节点,准确刻画与认知信号交叉口的供给能力特性对于实现精细化、智能化的路口交通管理与控制具有重要意义。在交通工程学中,车头时距是衡量交通流状态的重要指标之一。饱和车头时距反映了在饱和流状态下车辆通过交叉口的效率,是交叉口供给特征的重要表征。
2、现有的饱和车头时距估计方法有:(1)基于hcm的方法:通过采集大量数据计算饱和流率的相关修正参数,估计饱和流率,进而得到饱和车头时距。修正系数的计算涉及到车道数、大车率、坡度、公共汽车影响、区域类型、转弯车辆、行人及非机动车等因素。(2)基于数据驱动的方法:分为阈值法与模型法。前者通过设置阈值判断车头时距是否处于饱和状态,阈值的设置通常以采集样本的中值或平均值为基准;后者通过建立相关模型对车头时距进行分类从而提取饱和车头时距,如隐马尔可夫链模型法、高斯混合模型法、k-means聚类法等。但以hcm为代表的方法较为系统地考虑了饱和车头时距的各类影响因素,在现实应用中需采集大量数据进行模型参数的标定,许多参数在现实城市道路中难以充分获取。而基于数据驱动的饱和车头时距估计模型局限于特定条件和场景下的饱和车头时距估计,缺乏对饱和车头时距影响因素的深入分析,会导致模型泛化性不足。
3、目前,我国城市道路可广泛获取的交通数据包括号牌识别数据、浮动车数据两大类。其中,号牌识别数据指利用交通监控摄像头在交叉口检测车辆驶离,并通过文字自动识别技术获取车辆号牌,包括检测器编号、检测时间、车牌、车辆类型、所在车道等信息。浮动车数据指通过卫星定位车辆(如出租车)收集的位置数据,包括时间、车牌、载客状态、位置、速度等信息。如何利用这些现实可观测数据分析饱和车头时距的影响因素并建立泛化估计模型,是当前有待深入研究和解决的一项问题。
技术实现思路
1、本发明的目的是提供一种城市道路信号交叉口饱和车头时距泛化估计方法及系统,能够根据现有且易获取的号牌识别数据和浮动车数据,对饱和车头时距进行泛化估计,为城市信号交叉口供给特征的刻画提供科学依据。
2、为解决上述技术问题,本发明是采用下述技术方案实现的。
3、第一方面,本发明提供一种城市道路信号交叉口饱和车头时距泛化估计方法,包括:
4、选取若干饱和车头时距的潜在影响因素,所述潜在影响因素包括道路等级、车道类型、车辆类型以及天气状况,对所述潜在影响因素进行判别,进而得到饱和车头时距影响因素;
5、将筛选得到饱和车头时距影响因素输入预先构建好的概率估计模型中,得到饱和车头时距的泛化估计结果,所述饱和车头时距的泛化估计结果为饱和车头时距均值与概率分布;
6、其中,所述概率估计模型的构建方法为:
7、基于ngboost模型,建立同时期下饱和车头时距与所述饱和车头时距影响因素的函数关系的概率估计模型。
8、结合第一方面,进一步地,构建所述概率估计模型的具体方法为:
9、首先,初始化概率估计模型参数,是概率估计模型估计目标分布的参数,对于正态分布,。
10、其次,构建基学习器,ngboost 使用基学习器(如决策树)来逐步逼近目标分布的参数;
11、最后,对于每一轮迭代更新,执行以下步骤:
12、计算负对数似然(negative log-likelihood, nll):
13、
14、其中,是负对数似然,是目标变量,是当前迭代中概率估计模型估计的参数;
15、计算负对数似然关于的梯度:
16、
17、其中, 是负对数似然关于的梯度,是当前迭代中概率估计模型估计的参数,是负对数似然;
18、计算 fisher 信息矩阵:
19、
20、其中,是fisher信息矩阵,是期望算子,是目标变量,是当前迭代中概率估计模型估计的参数;
21、自然梯度更新:
22、
23、其中,是自然梯度,是fisher信息矩阵, 是负对数似然关于的梯度;
24、使用基学习器拟合自然梯度:
25、
26、其中,是基学习器在当前迭代中的预测增量,是当前的迭代次数,是训练数据的特征,是自然梯度,为基学习器;
27、更新估计目标分布的参数:
28、
29、其中,是第步的更新参数,是学习率,是基学习器在当前迭代中的预测增量。
30、结合第一方面,进一步地,所述概率估计模型的训练方法为:利用提取到的饱和车头时距样本进行概率估计模型训练与测试,基于网格搜索确定所述概率估计模型的最优超参数组合。
31、所述概率估计模型的最优超参数组合如下:
32、(1)学习率(learning rate):
33、控制每棵树的权重调整幅度,影响模型收敛速度。
34、(2)基学习器的数量(n estimators):
35、指定了要构建的基学习器的数量,影响模型的复杂度。
36、(3)小批量比例(minibatch frac):
37、用于指定训练过程中每个迭代步骤所使用的训练数据的比例,确定了每次迭代更新时使用的数据量。
38、(4)列抽样比例(col sample):
39、用于指定构建每个基学习器时要使用的特征列的子样本比例,控制了每个基本学习器所能看到的特征的数量。
40、结合第一方面,进一步地,所述饱和车头时距样本的提取方法为:
41、获取历史号牌识别数据,利用所述历史号牌识别数据识别车辆队列,基于所述车辆队列提取得到交叉口信号周期;
42、获取历史浮动车数据;
43、匹配所述历史号牌识别数据与历史浮动车数据,提取所有交叉口信号周期下路口排队车辆的饱和车头时距样本。
44、结合第一方面,进一步地,得到所述交叉口信号周期的具体方法为:
45、对历史号牌识别数据进行预处理得到车头时距;
46、基于所述车头时距,设定车头时距阈值gap识别车辆队列;
47、以每一个车辆队列的头车确定信号周期开始,将历史号牌识别数据按周期进行划分,得到交叉口信号周期。
48、结合第一方面,进一步地,对历史号牌识别数据进行预处理的步骤包括按路口车道划分号牌识别数据、去除重复检测的号牌识别数据以及将车辆连续检测时间相减计算得到车头时距。
49、结合第一方面,进一步地,基于所述车头时距,设定车头时距阈值gap识别车辆队列的具体方法为:
50、对于每一个车头时距,若小于车头时距阈值gap则加入车辆队列,否则新增一个车辆队列,对每一个车辆队列编号;
51、筛除车辆队列中车辆数小于车辆数阈值num的车辆队列;
52、合并不满足最小红灯间隔的相邻车辆队列,更新车头时距及车辆队列编号;
53、以每一个车辆队列的头车确定信号周期开始,将号牌识别数据按周期进行划分,得到交叉口信号周期。
54、结合第一方面,进一步地,匹配所述历史号牌识别数据与历史浮动车数据,提取所有交叉口信号周期下路口排队车辆的饱和车头时距样本的具体方法为:
55、针对每个交叉口信号周期,以车辆号牌与时间为基准,将停车状态下的历史浮动车数据与历史号牌识别数据一一进行匹配;
56、提取同一交叉口信号周期内匹配到的车辆及其之前车辆的车头时距,作为饱和车头时距样本。
57、结合第一方面,进一步地,得到饱和车头时距影响因素的具体方法为:
58、选取若干饱和车头时距的潜在影响因素;所述潜在影响因素包括道路等级、车道类型、车辆类型、天气状况等,总体需满足易获取、可泛化性高的特点。
59、对所述潜在影响因素进行vif检验,判断是否有特征存在共线性;具体方法为:
60、(1)对每个潜在影响因素作为响应变量对其他所有潜在影响因素进行线性回归。
61、(2)计算回归模型的值,即决定系数,表示其余潜在影响因素可以在多大程度上解释该潜在影响因素的变异性。
62、(3)计算vif值:
63、
64、其中,是上述回归模型的决定系数。
65、(4)根据vif值筛选出存在共线性的特征。vif值越大,说明该潜在影响因素与其他潜在影响因素之间存在越强的线性关系,进一步进行相关性检验。
66、获取饱和车头时距的备选影响因素;基于斯皮尔曼相关系数对存在共线性的潜在影响因素进行相关性检验,筛除与其他潜在影响因素相关性较高的特征,得到备选影响因素;斯皮尔曼相关系数的计算公式如下:
67、
68、其中,是斯皮尔曼相关系数,是第对数据在两个饱和车头时距的潜在影响因素排名之间的差异,是饱和车头时距样本数量。
69、基于 ks 检验判断备选影响因素是否对饱和车头时距存在显著影响,ks检验主要通过比较两个经验累积分布函数ecdf来判断某一备选影响因素不同特征值下的两个样本是否来自同一分布,ks 检验量是两个经验累积分布函数之间的最大绝对差距,其值越大,表明样本与假设分布的差异越大。ks检验量计算如下:
70、
71、其中,是ks检验量,是饱和车头时距样本大小为的经验累积分布函数,是饱和车头时距样本大小为的经验累积分布函数,表示第一个样本的大小,表示第二个样本的大小,表示变量的取值(即饱和车头时距)。
72、确定饱和车头时距的影响因素,所述饱和车头时距的影响因素为在经过共线性检验与ks检验后满足各特征之间无明显共线性且对饱和车头时距存在显著影响。
73、第二方面,本发明提供一种城市道路信号交叉口饱和车头时距泛化估计系统,包括:
74、饱和车头时距影响因素模块,被配置用于选取若干饱和车头时距的潜在影响因素,所述潜在影响因素包括道路等级、车道类型、车辆类型和天气状况,对所述潜在影响因素进行判别,进而得到饱和车头时距影响因素;
75、饱和车头时距概率估计模块,被配置用于将筛选得到饱和车头时距影响因素输入预先构建好的概率估计模型中,得到饱和车头时距的泛化估计结果;
76、其中,所述概率估计模型的构建方法为:
77、基于ngboost模型,建立同时期下饱和车头时距与所述饱和车头时距影响因素的函数关系的概率估计模型。
78、结合第二方面,进一步地,本发明提供的饱和车头时距泛化估计系统还包括:
79、交叉口信号周期提取模块,被配置用于获取历史号牌识别数据,利用所述历史号牌识别数据识别车辆队列,基于所述车辆队列提取得到交叉口信号周期;
80、浮动车数据获取模块,被配置用于获取历史浮动车数据;
81、饱和车头时距样本提取模块,被配置用于匹配所述历史号牌识别数据与历史浮动车数据,提取所有交叉口信号周期下路口排队车辆的饱和车头时距样本。
82、第三方面,本发明提供一种计算机可读存储介质,其上存储有计算机程序,该计算机程序被处理器执行时,实现上述的饱和车头时距泛化估计方法的步骤。
83、第四方面,本发明提供一种计算机设备,包括:
84、存储器,用于存储计算机程序;
85、处理器,用于执行所述计算机程序以实现上述的饱和车头时距泛化估计方法的步骤。
86、第五方面,本发明提供一种计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现上述的饱和车头时距泛化估计方法的步骤。
87、本发明基于号牌识别数据划分信号周期,并通过匹配历史号牌识别数据与历史浮动车数据识别路口排队队列中的车辆,实现饱和车头时距样本的提取。基于vif检验与相关性检验判断各因素间的共线性,基于ks检验判断各因素对饱和车头时距的影响程度,筛选出饱和车头时距影响因素。基于ngboost模型构建饱和车头时距与饱和车头时距影响因素的关系模型,实现不同道路等级(如主干道、次干道、支路)、车道类型(如左转车道、直左车道、直行车道、直右车道)、车辆类型(如小型车、大型车)和天气状况(如降雨量、降雪量)等动静因素下饱和车头时距均值与概率分布的泛化估计。
88、与现有技术相比,本发明所达到的有益效果:
89、(1)本发明利用我国城市道路可广泛获取的号牌识别数据和浮动车数据,提取信号交叉口饱和车头时距样本,揭示饱和车头时距的关键影响因素,借助机器学习方法构建泛化估计模型,为城市信号交叉口供给特征的刻画提供科学依据。
90、(2)本发明与基于hcm的估计方法相比,提出的方法考虑易获取的饱和车头时距影响因素,显著提高了估计模型在实际应用中的泛化性。
91、(3)本发明构建的基于ngboost的概率估计模型,相比数据驱动的方法,进一步分析饱和车头时距的影响因素,能够输出饱和车头时距的概率分布,提高模型鲁棒性的同时对于估计结果具有良好的可解释性。
92、(4)本发明可为城市道路交通流建模、交通信号配时优化等提供科学、可靠的路口交通供给特性参数。
1.一种城市道路信号交叉口饱和车头时距泛化估计方法,其特征在于,包括:
2.根据权利要求1所述的城市道路信号交叉口饱和车头时距泛化估计方法,其特征在于,所述概率估计模型的训练方法为:利用提取到的饱和车头时距样本进行概率估计模型训练与测试,基于网格搜索确定所述概率估计模型的最优超参数组合;
3.根据权利要求2所述的城市道路信号交叉口饱和车头时距泛化估计方法,其特征在于,得到所述交叉口信号周期的具体方法为:
4.根据权利要求3所述的城市道路信号交叉口饱和车头时距泛化估计方法,其特征在于,基于所述车头时距,设定车头时距阈值gap识别车辆队列的具体方法为:
5.根据权利要求2所述的城市道路信号交叉口饱和车头时距泛化估计方法,其特征在于,匹配所述历史号牌识别数据与历史浮动车数据,提取所有交叉口信号周期下路口排队车辆的饱和车头时距样本的具体方法为:
6.根据权利要求1所述的城市道路信号交叉口饱和车头时距泛化估计方法,其特征在于,得到饱和车头时距影响因素的方法为:
7.一种城市道路信号交叉口饱和车头时距泛化估计系统,其特征在于,包括:
8.一种计算机可读存储介质,其上存储有计算机程序,其特征在于:该计算机程序被处理器执行时,实现权利要求1~6中任一所述的饱和车头时距泛化估计方法的步骤。
9.一种计算机设备,其特征在于,包括:
10.一种计算机程序产品,包括计算机程序,其特征在于:该计算机程序被处理器执行时实现权利要求1~6中任一项所述的饱和车头时距泛化估计方法的步骤。
