
一、题目核心认知:从“迁到便宜地方”到“时空能源协同”
这道题最容易被误解的地方是:简单理解为“把任务迁到电价便宜的地方”。这个想法忽略了五方面关键约束:
-
网络时延:实时推理对响应速度极其敏感,不能把实时任务都迁到西部
-
GPU容量:电价低不代表有足够GPU承接所有任务
-
任务完成期限:训练任务可延迟但不能无限推迟
-
新能源波动:光伏白天丰富晚上减少,风电存在随机波动
-
储能影响:储能可能在前面存了低成本或低碳电能,改变了“什么时候用电最便宜”的结论
因此真正问题是:什么任务,在什么时间,到什么区域执行,由什么能源供电,在保证服务质量的前提下达到整体最优。
二、核心数据分析:真正值得调度的是AI训练
50000条任务中,三类任务数量接近(实时推理16724、批量推理16717、AI训练16559),但GPU占用完全不同:
|
指标 |
实时推理 |
批量推理 |
AI训练 |
|---|---|---|---|
|
任务数 |
16724 |
16717 |
16559 |
|
GPU-hour占比 |
~10% |
~10% | ~80% |
|
AI IT能耗占比 |
~6% |
~7% | ~87% |
核心结论:决定算力峰值、电费和碳排放的是训练任务。调度策略应为:实时任务少动,批量任务适度动,训练任务重点动。
三、问题一:GPU需求预测 + 基础算力调度
3.1 问题结构
问题一包含两个不同任务:
-
预测:预测第2376—2399小时短期GPU需求
-
调度:根据实际到达任务完成最后24小时调度
⚠️ 关键:预测用于验证模型能力,但最终调度必须用实际到达任务,不能用预测数据代替。
3.2 预测模型
按 “区域×任务类型” 建立18条独立小时级GPU需求序列。采用Holt-Winters季节指数平滑模型,季节周期取24小时。
训练流程(严格按时间顺序):
-
0—2351小时:训练
-
2352—2375小时:验证调参
-
0—2375小时:重训
-
2376—2399小时:最终预测测试
预测特征设计:
-
近期变化:最近1小时、2—3小时、6小时需求
-
近期负荷水平:过去12小时均值、24小时均值、波动程度、峰值
-
周期规律:过去一天相同小时、一天中时段
预测结果:测试段六区域平均MAE约92.5GPU,RMSE约142GPU。⚠️ MAPE约148.8%——这个数字看起来很大,是因为部分区域深夜存在大量0值或极小值时段,极小分母会放大MAPE。应同时报告RMSE说明模型在高负荷时段预测准确。
3.3 基础调度模型
采用服务质量优先的纯算力基准方案,分层调度:
|
优先级 |
目标 |
说明 |
|---|---|---|
|
第一 |
任务合法完成 |
实时到达立即开工、不超时、不超GPU/功率上限 |
|
第二 |
尽量不迁移 |
问题一没有能源收益,无需大规模跨区 |
|
第三 |
减少等待 |
批量/训练任务可延迟但不无意义拖延 |
|
第四 |
负载均衡 |
多区域可行时分配给GPU利用率较低的区域 |
⚠️ 重要细节:任务持续时间单位是分钟。如任务运行95分钟,必须按每个小时内实际运行分钟数折算GPU占用,不能向上取整为2小时全部占满。
最后24小时调度结果:实际到达538个任务(实时推理160、批量推理184、AI训练194)。区域GPU利用率:RegionF峰值达99.5%,RegionE达96.8%,全部任务在容量与时限内完成。
四、问题二:碳感知任务调度
4.1 任务→能源的传导链
每个任务放到某区域后形成:GPU占用 → AI IT功率 → 区域IT总负荷 → ×PUE → 设施负荷 → 新能源/电网供电 → 电费与碳排放。任务调度=能源调度。
4.2 预剪枝:剪掉不可能的区域
根据时延约束:
|
任务类型 |
时延上限 |
可行迁移范围 |
|---|---|---|
|
实时推理 |
20ms |
A/B/C内部调节,D基本本地,E/F互调 |
|
批量推理 |
80ms |
迁移范围明显扩大 |
|
AI训练 |
150ms |
六区域间自由迁移 |
4.3 区域偏好分析
RegionE电价较RegionA低约47%,碳强度低约65%;RegionD GPU容量最大,RegionE PUE最低。但优势具有时间特征——RegionE白天光伏强时优势明显,晚上光伏下降后RegionF风电或RegionD低价电可能更有优势。
4.4 三类任务差异化策略
|
任务类型 |
策略 |
柔性定位 |
|---|---|---|
|
实时推理 |
就近运行+小范围负载均衡 |
局部调节 |
|
批量推理 |
成本和时延折中,东部高价时延迟或迁移 |
中尺度调节 |
|
AI训练 |
跟随低价、低碳和新能源时间窗口迁移 |
大范围调节 |
4.5 求解策略
采用滚动时域调度:每到当前时刻,看已到达未执行任务,查看未来电价/碳强度/新能源/GPU余量,决定当前应执行哪些,只执行窗口最前面的决策。
4.6 问题二结果
|
指标 |
本地执行(基准) |
碳感知优化 |
变化 |
|---|---|---|---|
|
运行成本 |
948.5百万元 |
882.7百万元 | -6.9% |
|
碳排放 |
0.978百万吨 |
0.887百万吨 | -9.3% |
|
平均时延 |
5.0ms |
28.2ms |
全部满足上限 |
结果解读:训练与批量任务大量迁往电价低、碳强度低的RegionD/E/F,东部实时任务保持本地执行。
五、问题三:储能协同优化
5.1 ⚠️ 必须与问题二“切断”
赛题明确规定:问题三直接使用Baseline_AI_IT_Load和NonAI_IT_Load作为给定负荷,不允许重新优化任务迁移和开工时间。这样才能单独识别储能本身的贡献。
5.2 储能模型四类行为
-
新能源富余时优先充电:E/F区域新能源大于负荷时,优先让储能吸收
-
低价低碳时段电网充电:价格低、碳强度低、未来将进入高价时段时提前储能
-
高价高碳时段放电:一次放电同时减少电费、碳排和峰值
-
主动削峰:净购电接近峰值时提前放电
5.3 ⚠️ 终端SOC约束
赛题要求:第2406小时SOC不低于初始SOC。若不设此约束,优化器会在最后几小时放空电池,夸大收益。
5.4 问题三结果(以RegionF风电富集区为例)
|
指标 |
无储能 |
储能优化 |
变化 |
|---|---|---|---|
|
峰值净购电 |
410MW |
191MW | -53% |
|
净购电波动标准差 |
128MW |
102MW |
↓ |
|
运行成本(六区域合计) |
9.84亿元 |
5.2亿元 | -47% |
|
碳排放(六区域合计) |
93.8万吨 |
59.9万吨 | -36% |
六、问题四:多区域算—储—电协同优化
6.1 为什么不能简单串行
把问题二的结果扔进问题三,那是串行优化——任务完全确定后储能被动适应。真正联合优化应允许双方互相影响:
-
若任务调度器不知道储能状态,可能把所有训练任务都推到新能源高峰期,造成GPU峰值
-
若储能不知未来任务会迁移,可能提前把电放掉,真正负荷来时反而没电
6.2 三层交替协调结构
|
层次 |
功能 |
输入→输出 |
|---|---|---|
|
第一层 |
任务可行域剪枝 |
删除超时延/超容量候选 |
|
第二层 |
任务调度层 |
根据电价/碳强度/储能余量决定任务去向和开工 |
|
第三层 |
能源层 |
根据新负荷决定充放电/新能源利用,反馈新成本 |
形成闭环:任务改变负荷→负荷改变储能策略→储能改变边际供电成本→反改变任务调度。
6.3 Pareto分析与情景分析
多目标(成本、碳排、时延、服务、新能源利用率、峰值购电)不可能同时最优,应生成Pareto前沿比较不同方案。
三类规定情景:
-
碳约束收紧:训练任务进一步向E/F迁移,新能源利用提高,运行成本可能增加
-
峰谷电价变化:峰谷差扩大→任务延迟价值上升;峰谷差缩小→时间调度意义下降
-
新能源波动增强:储能重要性提高,需保留更多SOC裕度
七、四问递进关系与核心思想
|
问题 |
核心问题 |
关键约束 |
适合方法 |
|---|---|---|---|
|
问题一 |
GPU预测+合法调度 |
GPU/SLA/期限 |
分层预测+SLA优先调度 |
|
问题二 |
低成本低碳运行 |
时延/GPU/功率 |
碳感知滚动调度 |
|
问题三 |
储能改善能源运行 |
SOC/终端SOC |
多目标储能优化 |
|
问题四 |
算力与能源联合最优 |
全部约束统一 |
滚动分解+Pareto分析 |
三种灵活性联合利用:空间灵活性(任务跨区迁移) + 计算时间灵活性(任务延迟) + 能源时间灵活性(储能)。
终极策略:实时推理靠近用户保SLA,批量推理有限时空迁移,AI训练大范围跟随低价低碳绿电,储能搬移绿电,算力与能源互相反馈形成算—储—电协同闭环。
八、八大常见陷阱
-
问题一用预测任务做最后24小时调度 → 必须用实际到达任务
-
随机划分时间序列训练集 → 产生未来信息泄漏,必须按时间顺序
-
任务持续时间向上取整 → 高估GPU占用,按分钟折算
-
三类任务用相同迁移规则 → 实时和训练时延敏感度完全不同
-
问题二直接用附件原始IT负荷 → 调度后AI负荷已变,必须重新计算
-
问题三继续用问题二的新负荷 → 问题三有独立负荷口径
-
储能终端直接放空 → 无终端SOC约束夸大收益
-
问题四简单串行组合 → 不是真正联合优化
通过网盘分享的文件:2026华数杯分享链接: https://pan.baidu.com/s/1z-QqhjqNqngh3u0EBTq9lg 提取码: 2x2i

314

被折叠的 条评论
为什么被折叠?



