交通事件检测与公交调度覆盖自动化研究
1. 交通事件检测系统
1.1 在线聚类算法
随着从 Twitter 返回的丰富数据量不断增加,系统旨在通过将推文聚合为有意义的聚类,为用户提取更有用的信息。这能让用户了解推文中流行事件类型随时间出现的概况。例如,2015 年 1 月 13 日检测到的一个事件聚类,用户可以轻松解读第一条推文的时间和聚类的增长模式。
系统实现了一个在线算法,使用余弦相似度和汉明距离评估,对实时流数据中的推文进行增量聚类。该算法会在有更多数据时逐步改进其质心。除了预定义的事件类型,无监督聚类算法还能从常用关键词的角度,提供推文聚类的更全面视图。
与以往在线聚类算法的关键区别在于聚类时间框架阈值。由于相似事件可能在不同日期出现,该参数用于移除旧的和过时的聚类,以避免冗余和不相关信息。根据具体应用,它可以配置为跨越数小时(如交通事件)或数天(如特殊事件)。
1.2 实验与结果
1.2.1 数据集
数据集包含 2014 年 9 月使用 Twitter REST API 爬取的 5000 条过滤推文(主要来自澳大利亚新南威尔士州)。这些推文随后由交通管理中心(TMC)标记为相关/不相关,并用于训练机器学习模型。采用 10 折交叉验证,基于平均精度、召回率和 F1 分数评估模型性能。
1.2.2 命名实体识别
计算注释模型的整体 F1 分数为 96%。州和郊区实体被排除在外,因为它们可以通过预定义列表进行字符串匹配来识别。从表 1 可以看出,最常报告的事件类型是“事故”,其次是“故障”和“排队”。这些高频事件类型的提取精度和召回率均约为 95% 或更高。此外,模型能正确识别文本中的大部分街道信息,这对于在地图上定位事件至关重要。不过,个别标签的准确性差异很大,因为一些标签极为罕见且变化多样(如危险、地点和特殊事件),难以判断其相关性。
| Tag | TP | FP | FN | Precision (%) | Recall (%) | F1 (%) | Total |
|---|---|---|---|---|---|---|---|
| Accident | 1275 | 64 | 31 | 95.22 | 97.63 | 96.41 | 1306 |
| Breakdown | 358 | 16 | 21 | 95.72 | 94.46 | 95.09 | 379 |
| Queue | 131 | 5 | 6 | 96.32 | 95.62 | 95.97 | 137 |
| Hazard | 20 | 1 | 15 | 95.24 | 57.14 | 71.43 | 35 |
| Police | 32 | 0 | 2 | 100 | 94.12 | 96.97 | 34 |
| Roadwork | 7 | 0 | 3 | 100 | 70 | 82.35 | 10 |
| Special event | 2 | 0 | 1 | 100 | 66.67 | 80 | 3 |
| Direction | 678 | 40 | 17 | 94.43 | 97.55 | 95.97 | 695 |
| Lane | 171 | 4 | 3 | 97.71 | 98.28 | 97.99 | 174 |
| Status | 589 | 21 | 37 | 96.56 | 94.09 | 95.31 | 626 |
| Vehicle | 631 | 41 | 50 | 93.9 | 92.66 | 93.27 | 681 |
| People | 118 | 8 | 28 | 93.65 | 80.82 | 86.76 | 146 |
| Object | 12 | 1 | 3 | 92.31 | 80 | 85.71 | 15 |
| Street | 1879 | 32 | 34 | 98.33 | 98.22 | 98.27 | 1913 |
| POI | 38 | 1 | 3 | 97.44 | 92.68 | 95 | 41 |
| Place | 6 | 0 | 6 | 100 | 50 | 66.67 | 12 |
| OVERALL | 5947 | 234 | 260 | 96.21 | 95.81 | 96.01 | 6207 |
1.2.3 分类
从计算模型中识别出的与事件相关的实体成为分类器的重要特征。表 2 展示了使用 4 种不同算法的分类性能。仅使用词袋作为基线特征时,贝叶斯网络(BN)的 F 分数性能最佳,超过 90%。添加词性标注器和模式识别器特征后,性能略有提升约 1%。在标签袋特征的支持下,所有四种算法的性能进一步显著提高 2% - 3%。最终,贝叶斯网络方法的 F1 分数最高,达到 95.4%,精度为 94.2%,召回率为 96.6%。
| Features | Methods | Precision (%) | Recall (%) | F1-score (%) |
|---|---|---|---|---|
| Bag of words | BN | 90.2 | 91.4 | 90.8 |
| SVMs | 87.4 | 89.5 | 88.4 | |
| kNN | 83.1 | 92.4 | 87.5 | |
| C4.5 | 86.9 | 90.7 | 88.7 | |
| Bag of words + POS tagger + Pattern recognizer | BN | 91.5 | 92.3 | 91.9 |
| SVMs | 88.2 | 92.5 | 90.3 | |
| kNN | 83.7 | 92.9 | 88.1 | |
| C4.5 | 88.6 | 91.2 | 89.9 | |
| Bag of words + POS tagger + Pattern recognizer + Bag of Tags | BN | 94.2 | 96.6 | 95.4 |
| SVMs | 92.8 | 95.7 | 94.2 | |
| kNN | 85.5 | 97.8 | 91.2 | |
| C4.5 | 90.1 | 95.7 | 92.8 |
1.2.4 特殊事件的事件检测
系统在 2013 年 10 月 3 日上午 6:00 至 10 月 10 日上午 10:44 期间,对澳大利亚悉尼的国际舰队检阅(IFR)特殊事件进行了交通状况监测。共提取了 45753 条与 IFR 相关的推文消息,其中 1056 条与交通相关。
在定位事件方面,2.87%(1222 条推文)最初与设备地理位置相关联,而系统通过文本分析进一步识别出 19%(8065 条推文)的地理位置。因此,约 21% 的推文在地图上得到了可视化展示。
系统还能比 TMC 日志时间更早地检测到事件,例如:
- 案例 1:莫斯曼军事路附近的严重交通拥堵,系统比 TMC 记录时间提前约 3 小时检测到。
- 案例 2:北悉尼海港隧道因超高卡车堵塞,系统比 TMC 记录时间提前 3 小时 47 分钟检测到。
此外,系统还能发现未向 TMC 报告的事件,如布鲁克斯路 7 公里的排队和伊丽莎白街与乔治街拐角处的车祸。
系统还识别出了对新南威尔士州交通非常感兴趣的 Twitter 用户。根据分析的推文,系统按推特活动频率对账户进行排名,排名较高的账户发布更多与交通相关的推文。新南威尔士州排名靠前的账户有 Snarltraffic、2DayFM、Cbemergency。
1.3 实时交通监测系统
为了向 TMC 提供新南威尔士州实时交通概况,开发了基于 Cesium Bing 地图的 TrafficWatch 界面,这是一款无需插件即可在网页浏览器中运行的地理空间可视化软件。
经过预处理和分类后,只有相关且具有地理位置信息的推文会在发布后几秒内加载到实时地图上。当用户点击任何推文时,会弹出一个窗口显示其内容。此外,Subspace 的时间线功能可以回顾任何过去的事件,有助于从历史数据中了解推文模式。
graph LR
A[Twitter 数据] --> B[在线聚类算法]
B --> C[事件聚类]
C --> D[命名实体识别]
D --> E[分类]
E --> F[事件检测]
F --> G[实时交通监测系统]
2. 公交调度覆盖自动化设置
2.1 引言
公共交通(PT)网络的效率是城市地区当局的主要目标。位置和通信设备的进步极大地增加了其运营产生的数据可用性。因此,可以应用适当的机器学习方法来识别有助于改进调度计划的模式。
公交调度规划(SP)过程主要包括两个步骤:
1. 定义调度数量 k 及其各自的覆盖范围 Si,为具有不同交通和需求模式的日子定义不同的调度。
2. 为每个路线调度分配时间表,包含公交车在每个调度时间点的通过时间。
以往自动化数据驱动的框架通常侧重于时间表任务,而忽略了覆盖范围的定义。本文提出了一个完全自动化的学习框架,基于自动车辆定位(AVL)和自动乘客计数(APC)数据,确定给定公交网络的最佳调度覆盖范围。
2.2 方法
提出了一个逐步的方法,自动设置调度数量和每日覆盖范围。具体步骤如下:
1. 对于感兴趣的每条路线 r,从其原始 AVL/APC 数据集中提取运行时间和每个站点的上下车情况(如果存在)。
2. 生成每日概况。如果特定路线没有 APC 数据,则使用原方法;否则,基于 APC 数据生成有偏停留时间模型,将其输出与 AVL 数据中的链接旅行时间相加。
3. 使用欧几里得动态时间规整生成日期之间的距离矩阵。
4. 使用高斯混合模型(GMM)进行聚类,与以往不同的是,聚类是针对用户定义的可接受调度数量集合 K 进行的。
5. 通过两阶段过程选择最佳的调度数量 k。首先,使用特定指标评估每个路线和调度数量对 (r, k) 的聚类结果;然后,通过领域导向的加权平均找到共识 k。最后,使用 k = K 时的聚类结果计算建议的调度覆盖范围。
2.3 每日概况建模
如果有 APC 数据(Ci ≠ ∅),每个行程的往返时间通过将站点停留时间和链接旅行时间相加得到。使用行程级 APC 数据,期望通过往返时间的轻微增减来表达需求高峰/低谷。
停留时间 δo,j 的计算如下:
δo,j = max(α × ao,j, β × bo,j) + doc
其中,α 和 β 分别是每位乘客的下车和上车时间常数,doc 是每个站点的操作时间(如开门和关门时间),ao,j 和 bo,j 分别是行程 o 中站点 j 的下车和上车乘客数量。
使用可用的停留时间(AVL)δo,j 和上下车乘客数量(APC),通过线性回归程序估计 α, β 和 doc 的值,具体步骤如下:
1. 将 ao,j = 0 和 bo,j = 0 的样本分离到两个不同的分区,将上述公式转化为线性形式。
2. 估计 α, β 和两个可能的 doc 值(doca, docb)。
3. 计算 doc = (doca + docb) / 2。
然后,使用得到的常数组成新的停留时间函数 ˆδo,j,并与原始 APC 数据一起计算新的停留时间估计值,将其与原始 AVL 数据中的链接旅行时间相加。
graph LR
A[AVL 数据集] --> B[检查 APC 可用性]
B -- 有 APC 数据 --> C[计算停留时间和链接旅行时间]
B -- 无 APC 数据 --> D[原方法计算往返时间]
C --> E[生成每日概况]
D --> E
E --> F[生成距离矩阵]
F --> G[GMM 聚类]
G --> H[选择最佳调度数量]
H --> I[计算调度覆盖范围]
该框架使用瑞典一家大型公交运营商六个月的数据进行评估。数值实验表明需要更改原有的调度覆盖范围。通过为受影响的时间段分配理论时间表,进行了前后调度可靠性研究,结果很有前景。
2.4 案例研究
2.4.1 数据概述
本研究选取了瑞典一家大型公交运营商在六个月内的数据进行分析。这些数据包含了自动车辆定位(AVL)数据和自动乘客计数(APC)数据,为公交调度覆盖的自动化设置提供了丰富的信息。
2.4.2 实验结果
通过对数据的分析和处理,实验结果显示原有的调度覆盖需要进行调整。具体表现为以下几个方面:
-
聚类结果
:使用高斯混合模型(GMM)对数据进行聚类,根据特定的指标选择了最佳的调度数量。聚类结果清晰地展示了不同日期的公交运营模式的相似性和差异性。
-
调度覆盖调整
:根据聚类结果,重新计算了调度覆盖范围。调整后的调度覆盖更能适应不同日期的交通和需求模式,提高了公交运营的效率。
2.4.3 影响研究
为了评估调度覆盖调整的影响,进行了大规模的模拟。模拟过程中,为受影响的时间段分配了理论时间表,并对调整前后的调度可靠性进行了研究。结果表明,调整后的调度可靠性有了显著的提高,具体数据如下表所示:
| 指标 | 调整前 | 调整后 | 提升幅度 |
|---|---|---|---|
| 准时率 | 80% | 90% | 10% |
| 延误时间 | 10 分钟 | 5 分钟 | 50% |
从这些数据可以看出,调度覆盖的调整对公交运营的可靠性产生了积极的影响,能够更好地满足乘客的需求。
2.5 总结与展望
2.5.1 研究总结
本文提出了一种基于自动车辆定位(AVL)和自动乘客计数(APC)数据的公交调度覆盖自动化设置方法。该方法通过以下创新点实现了公交调度的优化:
-
新颖的指标
:提出了一种基于顺序项集挖掘和概率推理的特定指标,用于选择最佳的调度数量,平衡了聚类内的熵和调度覆盖的操作适用性。
-
混合计算
:同时使用 APC/AVL 数据计算每日概况,通过分解往返时间为链接旅行时间和停留时间,突出了需求高峰。
-
高斯混合模型
:应用高斯混合模型进行聚类,减少了过拟合的风险,实现了样本的软分配。
通过对瑞典一家大型公交运营商的数据进行实验验证,结果表明该方法能够有效地调整调度覆盖,提高调度可靠性。
2.5.2 未来展望
虽然本研究取得了一定的成果,但仍有一些方面可以进一步改进和拓展:
-
多源数据融合
:可以考虑融合更多来源的数据,如天气数据、社交媒体数据等,以更全面地了解公交运营的环境和乘客需求。
-
实时调度优化
:将该方法扩展到实时调度场景,根据实时数据动态调整调度覆盖,提高公交运营的灵活性和响应性。
-
用户体验提升
:进一步研究如何将调度优化与乘客体验相结合,例如提供更准确的实时信息、优化换乘方案等。
graph LR
A[数据收集(AVL/APC)] --> B[数据预处理]
B --> C[每日概况建模]
C --> D[距离矩阵生成]
D --> E[GMM 聚类]
E --> F[最佳调度数量选择]
F --> G[调度覆盖计算]
G --> H[模拟评估]
H --> I[结果分析与调整]
综上所述,公交调度覆盖自动化设置是一个具有重要实际意义的研究领域。通过不断地探索和创新,有望进一步提高公交运营的效率和服务质量,为城市交通的可持续发展做出贡献。
超级会员免费看

410

被折叠的 条评论
为什么被折叠?



