Makes the repo fully bilingual: every _en.md now has a matching _zh.md sibling with identical section structure. New translations: - primers/technical_newsvendor_zh.md - primers/technical_scuc_sced_zh.md - primers/technical_stochastic_optimization_zh.md - markets/us/field_guide_zh.md - markets/us/forecasting_open_ecosystem_zh.md README: link the new _zh docs and drop the "EN only" / awaiting-translation markers. Translations follow house conventions (CJK bold padding, arabic section-number parity, shared bilingual glossary, _zh cross-doc links). Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
44 KiB
美国电力市场:实战指南
报价、交易,以及 AI 带来的影响 —— 汇编自 2026 年 7 月一系列工作研讨。
目录
1. 市场如何出清
整个格局分裂为两个世界: 市场运营机构 (美国七大 ISO/RTO —— PJM、CAISO、ERCOT、MISO、NYISO、SPP、ISO-NE)负责 出清 市场,而 市场主体 (发电商、电池、交易员、对冲基金)向市场 报价 。本指南中的一切,都落在这条分界线的某一侧。
1.1 出清算法(ISO/RTO 侧)
其核心是大规模的 混合整数规划 ,而非机器学习:
- SCUC(安全约束机组组合) 出清日前市场 —— 一个庞大的 MILP,用商业求解器(Gurobi / CPLEX / Xpress)求解,在网络与可靠性约束下决定机组组合。
- SCED(安全约束经济调度) 在实时市场中每 5 分钟运行一次(LP/QP),产出 节点边际电价(LMP) ,并将其分解为能量 + 阻塞 + 损耗。
- 能量与辅助服务在同一次出清中联合优化。
出清侧的活跃前沿: 针对非凸性的凸包定价 / 扩展 LMP;应对可再生能源不确定性的随机机组组合与鲁棒机组组合;以及机器学习加速的优化 —— 学习式热启动、有效约束预测、输电约束筛选(由 ARPA-E 电网优化竞赛推动)。
1.2 两结算体系:日前 vs. 实时
七大 ISO 全部采用两结算(日前 + 实时)设计。 一句话概括:日前是成交量和资金所在,实时是风险所在。
日前市场(DAM)
- 在多数设计中是主市场;美国 ISO 中约 90–95%+ 的物理电量以日前价格进行财务结算
- 每日通过一次拍卖出清,带完整网络建模
- 是远期曲线的参考价格;多数套保以此为锚
- 是经典学术意义上的电价预测(EPF)问题
实时(平衡)市场
- 仅结算相对日前头寸的偏差 —— 成交量小,但波动极大
- 价格可在几分钟内从 $30 冲到 $3,000+/MWh(或深度负值)
- 对以下场景至关重要:风险管理、电池、快速爬坡的调峰机组、需求响应、日前–实时价差交易者
- 电池运营商的能量套利收入往往主要来自实时波动
预期实时价格锚定日前价格(虚拟报价平均而言会套利二者的差异),但实现的实时价格噪声要大得多。对多数市场主体而言,实用的预测优先级是:(1)日前小时价格,(2)日前–实时价差,(3)日内/实时 —— 若你运营储能或快速响应资产,则此顺序 反转 。
参与者侧独具美国特色的要素: 虚拟报价 (INC/DEC)、 FTR/CRR 拍卖 ,以及快速增长的 电池储能报价 这一专门领域。
2. 市场主体如何竞争
2.1 电价预测:一切的基础
电力无法大规模存储,因此价格反映的是瞬时供需平衡,既可能飙升也可能转负。预测方法可归为三大类,通常混合使用:
基本面(结构)模型 直接模拟市场本身:负荷预测 vs. 供给曲线(经济调度序位)。关键输入:燃料价格(尤其是天然气,它常常决定边际),可再生能源出力预测,计划内/计划外停运,输电约束,进口/出口。工具:PLEXOS、Aurora、内部的生产成本 / 调度仿真。公用事业公司、大型发电商和 ISO 大量使用。
统计 / 计量经济模型 —— ARIMA/ARIMAX、用于波动率的 GARCH,以及对温度、天然气、负荷的回归。它们利用强烈的季节性(时段、星期、季节),在"正常"条件和短期预测上表现最佳。
机器学习模型 —— 梯度提升树、神经网络(LSTM、基于 Transformer 的模型),在天气、负荷、可再生能源、价格、燃料和停运数据上训练。成熟的团队会预测 完整分布 ,而不只是均值 —— 赚钱或亏钱都发生在分布的尾部。
实践中:混合。 用基本面模型给出结构性形态 + 机器学习/统计修正 + 人工交易员判断,尤其针对模型难以处理的事件(寒潮、机组跳闸、异常电网状况)。
通用关键输入: 天气预报(最大的单一驱动因素)、天然气价格、可再生能源发电预测、停运计划、输电/阻塞状况。
技术前沿。 基准的演进路径是 LEAR(正则化线性/LASSO)→ 深度神经网络 → 时序架构(LSTM、Transformer) 。Transformer 模型如今已用于在波动剧烈的市场(如 ERCOT)中预测日前–实时价差,利用负荷 / 光伏 / 风电预测及时序特征,并配合逐步向前(walk-forward)的再训练。调优良好的线性模型仍出人意料地有竞争力;带在线学习的线性+非线性混合架构是当前的一个前沿。实用的 SOTA 正日益走向 概率化 —— 分位数回归、分布式深度网络、保形预测 —— 因为决策需要的是完整分布,而不是点预测。
2.2 策略性报价优化
面向价格制定者的两大 SOTA 框架: 双层优化(MPEC 式) 与 强化学习 。深度强化学习(DDPG + 优先经验回放、PPO、SAC)能处理连续的状态/动作空间和非凸的运行特性。但 随机规划与鲁棒优化仍是主力 ,用于在不确定性下联合优化能量 + 辅助服务报价,并以条件风险价值(CVaR)作为标准的风险叠加。
2.3 电池储能套利(最热门的领域)
- 经典方法:随机动态规划、在价格情景上的模型预测控制(MPC)、将退化成本纳入目标函数。
- 现代方法:用深度强化学习学习充放电策略; 决策导向学习 (预测以利润为训练目标,而非以准确度为目标 —— 见 §4.4)。
- 研究前沿:分层 / 多智能体强化学习,在两结算体系下协调日前 + 实时报价,并采用风险调整后的奖励(固定策略在市场机制切换下表现挣扎)。
- 行业实践:优化商(Habitat Energy、Gridmatic、Tyba、Fluence Mosaic)以商业化方式运行机器学习预测 + 优化技术栈。
2.4 虚拟报价与金融交易(INC、DEC、FTR)
本质上就是量化交易:用梯度提升树(XGBoost/LightGBM)和深度网络在节点粒度上预测日前–实时价差,特征取自天气、负荷/可再生能源预测误差、停运和阻塞模式。组合构建在风险限额下进行;FTR 拍卖还额外引入了阻塞租金的情景优化。
2.5 新兴方向
- 在线 / 无悔学习 —— 报价策略直接从市场结果中更新,并带有次线性的悔值保证。
- 多智能体强化学习 —— 用于市场仿真和市场力分析的纳什均衡近似。
- LLM 增强的交易框架 —— 非常早期,开始出现在文献中。
- 开源基准 —— Grid2Op、RL2Grid、新的两结算报价环境。
2.6 行业现实核查
真金白银大多仍靠 强概率预测 + 经典优化(随机 MIP/MPC)+ 人工交易员判断 赚取。强化学习目前主要在少数几家成熟团队的储能调度中进入生产。深度学习显然已在 预测 层胜出; 决策 层仍由带机器学习输入的优化主导。
一句话概括前沿: 深度学习/Transformer 已赢下预测层;强化学习正在争夺优化层,但尚未取代随机优化。
两点微妙之处:这两次变革处于 不同的成熟阶段 —— 深度学习在预测中的接管已经完成(并日益概率化),而强化学习在决策中仍是挑战者,面对的是已部署的随机优化 / MPC。而且 两层之间的边界正在消融 :决策导向学习直接以交易利润为目标训练预测,把"先预测后优化"折叠成单一的学习式管线 —— 这可以说是当前最有意思的研究方向(§4.4)。
2.7 速查表
| 层 | 已部署的标准做法 | 研究前沿 |
|---|---|---|
| 市场出清(ISO) | MILP SCUC + LP SCED、LMP | 凸包定价、随机机组组合、机器学习加速的优化 |
| 电价预测 | 概率深度网络、GBT、调优的线性模型 | Transformer、混合+在线学习、保形预测 |
| 报价/调度决策 | 随机规划、MPC、双层 MPEC | 深度强化学习(DDPG/PPO/SAC)、分层与多智能体强化学习、无悔在线学习 |
| 预测↔决策接口 | 两阶段先预测后优化 | 决策导向 / 端到端学习 |
| 储能套利 | MPC + 概率预测 | 决策导向学习(DFL)、风险感知的分层强化学习 |
| 虚拟报价 / FTR | GBT/DNN 价差模型 + 组合风险限额 | Transformer 价差预测、LLM 增强框架 |
3. 真正的优势藏在哪里
3.1 可持续优势的层级结构
任何报价系统都可分解为三个功能层:一个 数据与预测层 ,将天气、电网和市场数据转化为经过校准的概率分布;一个 优化层 ,在风险约束下将分布转化为报价曲线和头寸;以及一个 执行与风险层 ,负责提交报价、监控头寸、结算并强化纪律。
这些层的竞争价值并不相等:
- 预测质量与校准 占主导。两个市场主体在不同预测上运行相同的优化器,其盈亏会大幅分化;而两个市场主体在相同预测上运行不同(但都够格)的优化器,其结果会相当接近。
- 执行与风险纪律 排第二。在拥挤的策略中,那个每个时段都重新优化、从不错过提交窗口、并按自身规则止损的团队,会跑赢不这么做的团队,即便前者没有任何分析上的优势。
- 优化器建模 排第三。底层数学(分位数报价、两阶段随机规划、CVaR 约束、储能 MILP)都已公开、已成为通用品;各团队之间的差异在于工艺,而非理论。
对搭建的启示:把最好的工程力量花在预测和回测上,中间层用无聊但久经验证的数学,并把运行可靠性当作一项功能来对待。
3.2 内幕信息的迷思(PJM / SCUC-SCED)
一个自然的担忧:一家掌握 PJM 出清算法内情 —— 或是流入其中的报价内情 —— 的供应商,难道不会碾压所有竞争对手吗?这一担忧在细究之下便烟消云散。
其实并不真正保密的东西。 算法 本身:SCUC/SCED 是标准的 MIP/LP 建模,被详尽记录在案(PJM Manual 11/12、OATT、业务实践手册),用 CPLEX/Gurobi 级别的商业求解器求解。有能力的量化团队会依据公开文档搭建"影子 SCED"模型。
真正保密 —— 且受法律围栏保护的东西:
| 项目 | 它是什么 | 为何它具有决定性 |
|---|---|---|
| 其他主体的报价/出价 | 仅以脱敏形式发布,约 4 个月滞后 | 日前价格是这些报价的涌现函数 |
| 网络状态 | 状态估计器的实时视图:潮流、电压、拓扑、约束裕度 | 知道下一个将起约束作用的约束 = 在节点价格分化发生之前就看到它 |
| 出力降额 | 机组能力的实时下调(例如一台 900 MW 机组降到 600 MW) | 供给比市场所认为的更紧张 → 在价格飙升之前布好头寸;FERC 案件中经典的重大非公开信息(MNPI) |
| 调度指令 | 5 分钟 SCED 设定值 + 市场之外的运营动作(可靠性组合、手动调度) | 揭示外部模型看不见的决策;可靠性组合会扭曲局部价格 |
使用这些是 联邦犯罪 ,而非供应商的优势:FERC 反操纵规则(EPAct 2005 之后)涵盖基于重大非公开信息的交易;PJM 员工和系统供应商受保密和交易禁令约束;独立市场监测机构(Monitoring Analytics —— 独立于 PJM 之外)和 FERC 执法办公室会筛查异常盈利。已有先例 —— 针对个人基于非公开电网信息交易的执法案件,而 Powhatan/UTC 事件也表明,即便是激进地钻规则空子,FERC 也会追究。
为何完美掌握算法本身也走不了多远。 SCED 在 给定其输入 时是确定性的,但这些输入事先无从知晓 —— 连 PJM 也不知道。日前价格取决于尚未提交的报价;实时价格取决于强迫停运、天气误差、联络线交换和起约束作用的约束。价格是成千上万私人决策加上物理随机性所涌现的产物。
真正的差异化在于别处: 更好的天气集合预报与负荷/可再生能源模型; 预测哪些输电约束将起约束作用 (这是节点市场中真正困难、高价值的问题);从滞后的公开数据建模报价行为;重建网络拓扑(CEII 模型访问权、FTR 结果、历史影子价格)。
诚实的残余部分: EMS/市场软件供应商和前 ISO 员工带着合法的"软"内幕知识 —— 运营人员行为、求解器怪癖、市场之外的动作。它有价值、普遍存在,且合法。真正的护城河: 那些懂得七月稀缺日傍晚 6 点控制室实际会如何运作的人。
3.3 准确的电价预测真是最有价值的事吗?
不是 —— 对多数市场主体而言,点预测是一项输入,很少是差异化的关键。
发电商:期权性与风险,而非预测。 分布的右尾比均值重要得多 —— 一台调峰机组一年的收入靠寥寥数个稀缺小时挣得;问题在于是 3 个还是 30 个稀缺小时,而不是均价上下浮动 $2/MWh。 电量–价格相关性风险 主导套保:恰好在价格飙升时被迫退出(冬季风暴"乌里"(Uri):远期卖出的发电商在机组冻结时以 $9,000/MWh 买回)。而经济学运行在 价差而非价格 之上:火花价差(天然气)、暗价差(煤)、顶底价差(电池)。
售电主体 / 大买家:负荷预测胜过电价预测。 敞口是平方级的 —— 炎热的一天意味着高负荷 且 高价格。最有价值的是:你自己的负荷预测、套保比例政策,以及形态风险管理。ERCOT 零售商的破产(Griddy)源于未对冲的结构性敞口,而非糟糕的电价预测。
金融交易者:相对价值、尾部、速度。 钱在 价差与阻塞 里(日前–实时虚拟、UTC、FTR、枢纽到节点的基差)—— 本事在于预测哪些约束会起约束作用。 校准胜过准确度 :校准良好的尾部加上恰当的仓位,会跑赢一个更锐利的点预测,并能在爆仓中幸存。 速度 很重要:比市场重新定价更快地对机组跳闸、天气模型运行和联络线交换变化作出反应。
可以说比任何预测都更重要的东西:
- 风险管理与资本纪律 —— 坟场里堆满的是风控失败,而非预测失败(GreenHat 的 FTR 违约,1.8 亿美元+被社会化分摊;"乌里"事件的伤亡者)。 大致正确且确保有偿付能力 才是赢家。
- 结构性期权性 —— 电池需要一套好的响应 策略 ,而非一个预测;做市商赚取价差;结构化交易台赚取风险转移的利润。
- 理解底层管道 —— 结算规则、附加费用/补足支付、信用机制、FTR 拍卖的怪癖、紧急情况下运营人员的自由裁量。规则知识是持久的;预测优势会衰减。
- 天气作为上游输入 —— 许多公司最有价值的单一专有资产就是其天气集合预报的处理能力;电价预测在很大程度上是天气 + 燃料 + 停运的衍生物。
综合:电价预测是必要的,但护城河低;风险结构化以及对约束/网络的洞察才是真正的差异化因素。 稀缺的能力是:(a)校准良好的尾部分布,(b)节点级的阻塞洞察,(c)能在判断错误时幸存下来的仓位控制纪律,以及(d)规则/底层管道的专业知识 —— 因此各公司为前控制室运营人员、网络工程师和风险经理支付溢价,其急切程度不亚于对预测人才。 预测只是入场底注;其他那些才是这场牌局。
4. AI 如何改变格局
§3.1 的三层分解是评估当前这波 AI 浪潮的正确视角,因为近来的进展落在各层上极不均匀 —— 而且,很凑巧地,它们恰恰最猛烈地落在最重要的那一层上。
| 层 | 优势排名 | AI 影响 | 成熟度 | 采纳姿态 |
|---|---|---|---|---|
| 预测 | 第 1 | 阶跃式变化(AI 天气集合预报) | 现已投入运行 | 积极采纳;优势正在衰减 |
| 执行 / 风险运营 | 第 2 | 影响大但不起眼(LLM 运营) | 具备人工复核即可投产 | 悄悄采纳;优势会复利累积 |
| 优化器 | 第 3 | 渐进式(决策导向学习) | 研究 → 早期实践 | 试验;保持可审计的结构 |
4.1 第 1 层 —— 预测:真正的阶跃式变化
AI 天气模型的转变。 对电力交易而言,最具影响力的 AI 进展不是强化学习或语言模型;而是用学习式大气模型替代(或增强)基于物理的数值天气预报(NWP)。里程碑序列短促而陡峭:华为的 Pangu-Weather (Nature,2023 年 7 月)在同行评审测试中展示出比传统集合系统快约 10,000 倍的预报;Google DeepMind 的 GraphCast (Science,2023 年 12 月)在约 1,380 个验证目标中的约 90% 上超越了 ECMWF 的旗舰 HRES 确定性模型;ECMWF 于 2024 年将其基于 AI 的 AIFS 模型转为运行状态 —— 成为首个将学习式模型投入运行的大型气象机构;微软的 Aurora 基础模型(Nature,2025 年 5 月)在超过一百万小时的地球物理数据上预训练,以传统计算成本的一小部分,把这一方法扩展到天气、空气质量和海浪预测;而 DeepMind 的 GenCast 则把这一架构族推向了概率集合预报。
学习式大气模型如何工作。 神经网络接受训练 —— 大多在 ERA5 再分析(约 45 年的逐小时全球大气状态)之上 —— 直接学习"t 时刻的大气 → t+6h 时刻的大气"这一映射,用单次前向传播替代对物理方程的数值积分。架构涵盖三维视觉 Transformer(Pangu)、二十面体网格图神经网络(GraphCast)、图/Transformer 混合体(AIFS)、采样可能未来的扩散模型(GenCast —— 原生概率化),以及预训练的地球物理基础模型(Aurora)。预报以自回归方式滚动展开,这会累积误差,并且 —— 在 MSE 训练下 —— 产生渐进式平滑,从而低估极端值。关键依赖:它们仍然需要来自物理管线的初始条件;数据同化并未被替代。全球分辨率(约 25–31 km)意味着站点级的降尺度/校准更重要,而非更不重要。
为何经济性比排行榜更重要。 传统 NWP 在超级计算机上对三维网格单元求解微分方程,每天刷新两到四次,每次的成本达数千美元。学习式模型在 GPU 上于数秒到数分钟内运行,在 12–48 小时的日前窗口内达到准确度对等。由此引出三个后果:
- 速度 → 概率。 当一次预报运行只花几秒的 GPU 时间时,生成数十乃至数百个集合成员就变得微不足道。整条下游报价管线消耗的是概率分布 —— 用于日前报价的生产分位数、用于失衡风险的价差分布 —— 因此集合预报的经济性直接转化为校准更好的输入,从而带来更好的报价。这是从"近来的 AI"到报价盈亏之间最清晰的因果路径。
- 速度 → 新鲜度。 商业 AI 天气供应商如今宣称每天多达 24 次运行,而传统 NWP 只有 2–4 次。在两结算市场中,更新鲜的预报在日前收盘到实时交割之间最为重要:实时再报价、日内头寸调整,以及风电和光伏组合的失衡管理。
- 速度 → 迭代(与进入门槛)。 廉价的重预报驱动回测,而开放的模型权重加上公开的初始条件数据,让任何拥有 GPU 的团队都能获得接近 SOTA 的全球预报 —— 这套基础设施此前需要一个国家气象部门或一份昂贵的供应商合同。
注意事项与失效模式。 三点注意事项让这一切保持诚实:
- 极端值是薄弱环节。 以均方误差为目标训练的模型会产生平滑的场,从而系统性地低估陡峭梯度 —— 例如剧烈风暴中的峰值风速。电力市场恰恰在尾部赚钱或亏钱(稀缺事件、爬坡、结冰),因此一个在平均 RMSE 上取胜的模型,对于那些主导年度盈亏的小时来说,仍可能是错误的工具。集合式与生成式方法(GenCast 式)能缓解但无法消除这一点。任何采纳计划都应包含针对你自己资产历史的、尾部专项的验证,而不只是看头条的技巧评分。
- 供应商声称需要独立验证。 商业 AI 天气领域尚年轻,营销味浓。实用的检验是:做一次付费试点,在 你的 节点、 你的 变量(轮毂高度风速、阵列平面辐照度、温度驱动的负荷)和 你的 损失函数上,与你现有的供应商打分对比 —— 最好用下游的交易指标,而不是气象 RMSE。
- 优势会衰减。 这些模型开放或可低价获取,因此仅仅"使用它们"所带来的优势会随采纳扩散而被侵蚀。公开的 AI 抬高了所有人的地板。它无法商品化的,是你把它与什么结合:用于本地校准的专有资产遥测、面向你特定站点的降尺度,以及 —— 最重要的 —— 从天气到 节点价格 的转换,而这要经由阻塞。
天气的下游:价格、负荷、阻塞。 电价预测已从经典时序方法转向梯度提升树,并日益转向 Transformer 和时序基础模型;实际收益最大的地方在于对日前/实时价差的概率(分位数)预测,这正是给可再生能源失衡风险定价的输入。负荷预测受益于同样的架构,外加改进的温度输入。 阻塞与节点基差预测仍是最难、最未被商品化的问题 —— 学习从系统状况到起约束作用的输电约束之间的映射 —— 而正因为几乎没人能做好它,这里也正是预测层投资保留最持久优势之处。编码电网拓扑的图神经网络是活跃的研究方向;没有任何供应商在卖一套值得拥有的交钥匙方案。
第 1 层综合:尽早且积极地采纳 AI 天气集合预报,独立验证尾部,并把省下的预算再投入公开模型无法提供的两件事 —— 针对你自己遥测的本地校准,以及节点阻塞建模。
4.2 第 2 层 —— 执行、运营与风险:LLM 悄然取胜
这一层被供应商营销所忽视,而这恰恰是它被低估的原因。它是不起眼的后台工作 —— 但它攻击的是排名第二的优势来源,因为有人工复核输出而模型风险低,且其收益会复利累积。
市场规则智能。 美国 ISO 的参与受制于数千页的关税、业务实践手册,以及源源不断的市场通知、协议修订和 FERC 备案。搭建报价系统的工程师们一致地把这个 —— 而非数学 —— 认定为最主要的成本。这几乎是一个理想的 LLM 工作负载:对你所交易的每个 ISO 的关税和手册集合建立检索语料;对每日市场通知进行自动分诊,标记出任何触及你报价参数、结算公式或辅助产品定义的内容;以及将协议修订与你的优化器所编码的假设进行变更差异比对。需要工程性防范的失效模式是虚构的规则引用 —— 缓解手段是标准的(以检索为依据的回答、强制引用来源段落、对任何改变系统行为的内容强制人工签字)。
合规文档与套保/投机的边界。 对任何同时运行物理资产和金融头寸的团队而言,FERC 操纵风险使文档成为头等大事:每一笔物理报价都应能作为"资产利润最大化"独立地站得住脚,并留有记录。LLM 非常适合生成这类记录 —— 从优化器自身的输入和输出(所用的预测分位数、起约束作用的约束、相对中性基线的偏离及其原因)以一致、可审计的语言起草每日报价理由文档。这把交易团队长期投入不足的合规负担,转化为报价运行的一个基本自动化的副产品,并实质性地强化了套保账户与投机账户之间的架构分离(§5.2)。
结算、监控与事件响应。 影子结算 —— 独立重新计算 ISO 应付给你的金额并对差异提出争议 —— 是高价值、细节繁重的工作,混合了结构化数据与非结构化的规则文本:同样是天然的"LLM + 工具"工作负载(解析结算单、与内部计算核对、起草带规则引用的争议申请)。夜间运营监控(遥测异常、错过的调度指令、提交截止前的预测数据源故障)同样受益于一个具备自主能力的层,它负责分诊、汇总并升级,而不是事事都呼叫人工。
工程速度。 一个二阶但真实的效应:具备自主能力的编码工具压缩了整个系统的搭建周期 —— ISO API 集成、回测框架、数据管线 —— 这对那些与拥有庞大工程团队的老牌对手竞争的小团队尤其有利。2026 年 SOTA 的报价团队,未必是拥有最奇特模型的那家;往往是那家五名工程师能像二十人一样交付的团队。
第 2 层综合:把 LLM 部署为以检索为依据的分析师和起草者,横跨市场规则、合规、结算和监控,并始终在动作发生点保留人工复核。这种优势安静、可防守,而且 —— 因为竞争对手恰恰在这些职能上投入不足 —— 是持久的。
4.3 第 3 层 —— 优化器:设计上就是渐进的,而这没问题
优化数学从来都不是瓶颈。面向可再生能源的报童式分位数报价、带 CVaR 的两阶段随机规划,以及面向储能的 MILP/动态规划建模,都已公开、被教授、并可用商业或开源求解器高效求解。它们也是 可审计的 :每一笔报价都能追溯到一项预测输入和一条约束,这对内部风险治理和监管辩护都极其重要。任何针对这一层的 AI 提案,都必须同时胜过调优良好的经典方法 且 保留可解释性 且 界定其失效模式。有两项候选技术值得关注,其成熟度截然不同。
4.4 决策导向学习:可信的升级
传统管线训练预测以最小化统计误差(MSE、弹球损失),然后独立地针对这些预测进行优化 —— 而不考虑预测误差如何传导为决策质量。 决策导向学习 (DFL,也称价值导向预测或"智能先预测后优化")把下游优化整合进训练回路,使预测器针对一种悔值式损失进行训练,该损失衡量其预测所诱导的 决策 的次优程度。奠基性成果:Donti、Amos 和 Kolter 的基于任务的端到端学习(NeurIPS 2017),以及 Elmachtoub 和 Grigas 的"Smart Predict-then-Optimize"(Management Science 2022);能源领域的文献已将该框架应用于面向能量和备用市场的日前调度、储能套利与"先预测后报价"框架,以及鲁棒的微电网运行。
其核心洞察与报价直接相关: 最准确的预测未必是最有价值的预测。 一个电价预测可以在改善其平均误差的同时,恰恰在报价决策具有后果的高价格小时上变得更差;文献已反复表明,是某个特定的分位数选择、而非最准确的点预测,才能使交易价值最大化。DFL 把这一直觉形式化并自动化了。关键在于 —— 与端到端强化学习不同 —— 它保留了可审计的优化器:你改变的是预测 为何而训练 ,而不是由谁来做决策。
投产就绪度:并非普遍就绪 —— 处于后期研究 / 早期采纳。 已成熟的部分:既有框架(智能先预测后优化、以经验学习、黑盒可微优化器),以及通过凸优化层的隐式微分,已在经济调度和储能套利上得到验证,对于简单的凸问题,在实现利润上持续击败以准确度为目标训练的预测。它尚未跨入广泛生产的原因:
- 通过优化器的微分很脆弱 —— 反向传播没有闭式解;展开(unrolling)有准确度/效率问题;解析方法强加了僵硬的问题形式要求;混合整数/非凸报价需要代理模型、次梯度或扰动估计器(在实践中很脆)。
- 不确定性覆盖不全 —— 多数 DFL 只处理目标函数中的不确定性,假设约束参数已知;真实交易处处都是不确定性。
- 任务专属性 —— 模型被焊死在一个决策问题上;任何变动(资产规模、市场、报价格式)都迫使重新训练。两阶段管线是模块化的:一份预测可喂给许多决策。
- 可解释性 / 风险控制 —— 以利润训练的预测是刻意有偏的,且难以向风险委员会解释;两阶段则让你分别审计预测和决策。
- 数据稀缺与机制切换脆弱性 —— 在历史利润上训练的策略,恰恰在市场切换时可能严重退化。
近期的评估工作补充了诚实的反面证据:DFL 的收益取决于应用场景,并不总能转化为更高的经济价值,同时通常要求多得多的计算量。采纳障碍在结构上也存在 —— 第三方预测供应商无法针对每个客户的私有损失函数进行训练,而以成本为导向的预测目标缺乏人工复核者所依赖的直观解释(均值、中位数、分位数)。
经验法则:
- 小型凸内层问题 + 简单资产(单个电池、单个市场): 对于一支强技术团队,DFL 如今已具备投产可行性。
- 整数机组组合、多市场联合优化、ISO 报价曲线: 两阶段概率预测 + 优化仍是已部署的标准,很可能还会持续数年。
- 务实的折中地带 (许多团队实际的做法):"决策感知"训练 —— 保留两阶段架构,但按经济后果对预测损失加权。收获大部分好处,却几乎没有那些脆弱性。
DFL 值得试点, 因为你拥有自己的完整管线 (这是自建相对于外购的一项优势),并应针对一个强分位数预测基线、以实现的交易盈亏(而非预测误差)来评估,且预期它在决策问题不对称之处 —— 储能报价和有失衡敞口的可再生能源报价 —— 回报最大,而非处处均匀受益。
4.5 强化学习:影子模式,而非生产
端到端强化学习 —— 一个直接输出报价曲线的学习式策略 —— 尽管文献浩繁(综述性论文覆盖 150+ 篇),仍绝大多数停留在学术层面。结构性障碍并未松动:以真实市场成本进行现场试错是不可能的,因此策略只能在仿真器中训练,而这些仿真器与真实市场的保真度差距从未被弥合;日前拍卖每年只提供大约 365 个独立样本,是一个残酷的样本效率困境;而一个在稀缺事件中行为失当、又无法解释的策略,既是财务灾难也是监管灾难。
强化学习的近亲方法 确实 已进入生产的地方很有启发性: 近似/随机动态规划 —— 在序贯决策上的价值函数方法,数学上是强化学习的姊妹 —— 是商业储能优化器内部的标准配置;而学习式策略也可信地部署在 欧洲的连续日内市场 ,那里每天数千次的下单决策为强化学习提供了它所需的交互密度。
对一套美国系统而言,合理的路线图正映射了这一模式:日前拍卖用经典随机优化;强化学习实验限定在实时再报价和日内调整,因为那里决策频繁;在任何资本敞口之前,强制针对生产优化器进行影子模式评估;并且,若强化学习真能凭本事进来,就将其部署为叠加在优化器输出之上的、有界的残差修正,而不是取而代之。
4.6 供应商的"AI 报价"宣称:实质 vs. 炒作
实质: 全天候自动报价确实有效,且如今 可被独立度量 (Modo Energy 的储能优化器排行榜);机器学习预测确实优于旧方法;仅凭运营上的一致性就能跑赢人工交易台。
炒作套路: "AI"往往只是把一个标准的 GBM 预测 + LP 优化器包装了一下;提升(uplift)宣称缺乏明确的反事实基准;而仅靠自动化带来的优势会随采纳扩散而被压缩 —— ERCOT 辅助服务的饱和就是明证。
面向任何供应商的尽调问题: 你在独立基准上排第几?模型架构究竟是什么,你的提升数字背后的反事实是什么?系统在冬季风暴"乌里"(Uri)/ 上一次稀缺事件期间表现如何?收费结构是什么(收入分成 vs. 固定费用)?
4.7 横切动态
地板抬高;天花板是私有的。 这里讨论的几乎每一项 AI 进展都是公开或可购买的:开放的天气模型权重、基础时序模型、通用 LLM、已发表的 DFL 方法。它们的扩散压缩了任何单一技术所能提供的优势 —— 这在 ERCOT 电池市场已经显现,那里辅助服务的算法饱和把收入推向了能量套利,并缩小了顶尖与中位运营商之间的差距。持久的差异化迁移到了无法购买之物:专有遥测及其在本地校准中的运用、节点阻塞建模、执行可靠性,以及一套运转良好的风险流程所具备的制度性纪律。
可审计性是一项功能,而非约束。 监管环境(FERC 操纵原则、ISO 市场监测机构的审视)和内部风险治理,都奖励那些决策能够事后被解释的架构。这是支持"先预测后优化"胜过端到端学习式替代方案的一个真实而常被忽视的论据 —— 也正是为什么最新 AI 中价值最高的应用(天气集合预报、LLM 运营、DFL)恰恰是那些 强化 经典架构而非取代它的应用。
独立基准正在改变供应商生态。 面向储能优化器的第三方排行榜,已用一个共享的参照点取代了供应商自定义的基准,而同样的纪律也应在内部施行:技术栈中的每一次 AI 采纳,都值得配一个反事实(现有方法本会赚到多少?)和一次尾部事件压力测试(这个组件在冬季风暴"乌里"(Uri)或最近一次稀缺事件期间本会如何表现?)。
4.8 采纳路线图
按对投入的预期风险调整回报排序:
- 现在 —— AI 天气集合预报(第 1 层)。 用一个或多个 AI 天气数据源对比现有供应商做试点,在你的资产和你的交易损失函数上打分,并做明确的尾部验证。集成风险低、盈亏路径直接,且优势正在衰减,回报早行动者。
- 现在 —— LLM 运营层(第 2 层)。 以检索为依据的市场规则助手、自动化的报价理由文档、影子结算分诊,以及具备自主能力的工程工具。在每一个动作发生点都保留人工复核。
- 未来两个季度 —— 本地校准与阻塞建模(第 1 层)。 把天气层省下的钱再投入资产专属的降尺度和节点阻塞预测;这里正是预测优势在商品化中幸存之处。
- 未来两个季度 —— DFL 试点(第 3 层)。 针对一个资产类别(储能或单个风电组合),以实现的报价悔值重新训练生产预测的损失,并针对分位数基线、以交易盈亏(而非预测误差)来评估。
- 机会主义地 —— 影子模式下的强化学习(第 3 层)。 仅限实时再报价;晋升到生产取决于持续的影子模式超额表现和有界动作的部署。
贯穿始终的主线:近来的 AI 并未颠覆一套搭建良好的报价系统的架构。它让那套无聊的架构变得更好 —— 输入的分布更锐利、周围的纪律更廉价、内部的目标略微更聪明 —— 而鉴于秘密真正所在之处,这恰恰是搭建者应当想要的结果。
5. 搭建一套报价系统
5.1 面向"可再生能源 + 批发商"报价系统的架构
五阶段管线: 数据摄取 → 概率预测 → 报价优化 → 提交 → 结算/监控 ,并带一条反馈回路,用结算结果重新训练模型。
关键设计决策:
- 预测: 对出力和负荷做分位数预测(P10–P90),构建在与资产遥测融合的 NWP 集合输入之上;日前 LMP、实时 LMP,以及关键的日前–实时 价差 分布。
- 优化核心: 对于一个价格接受型的可再生能源资产,最优日前报价是出力分布的一个报童分位数,由预期的日前/实时价格比设定,并包裹在带 CVaR 的两阶段随机规划之中。每资产每日一个可高效求解的 LP(Gurobi/CPLEX/HiGHS)。批发商侧是其镜像:日前 vs. 实时的负荷采购,加上一层套保叠加(远期、FTR)。
- 运营: 带规则校验的自动 ISO 提交、影子结算,以及一套认真的回测框架 —— 这是最常被建设不足的组件。
- 主导真实盈亏的坑: 负价格与 PTC/REC 驱动的报价下限;节点基差与阻塞(往往是投资回报率最高的预测工作);PPA/套保结构重塑激励;各 ISO 的规则差异。
混合资产的提示:储能同址会把优化器从一个 LP 变成一个序贯问题(见 §2.3)。
5.2 把套保与投机分离
分离出于三个原因而必要:
- 业绩归因 —— 两个账户对"成功"的定义截然相反。
- 风险治理 —— 有界的物理敞口 vs. 带杠杆的金融亏损分布(GreenHat 是警世故事)。
- FERC 操纵风险 —— 物理报价必须能独立站得住脚;对物理报价和金融头寸做联合优化,是操纵指控的制造机。
但完全分离是不可能的:每一个日前报价分位数 本身就是 一种价差观点。解决办法:定义一个 中性基线报价 (例如 P50 报价 / 100% 日前负荷),把每一次偏离记录为"内嵌 alpha",并把盈亏分解为基线 + 内嵌观点 + 纯投机账户。在架构上:共享数据、预测和回测;分离优化器、授权、限额和盈亏;保持耦合是单向的 —— 物理优化器绝不读取金融账户的头寸。
两个账户以不同方式消费同一套预测技术栈:套保账户需要校准良好的分布中段分位数;投机账户需要尾部和价差偏度。
策略性提示:虚拟/FTR 是拥挤的量化市场;在一个运转良好的资产账户内部的内嵌观点 alpha,往往是建模投入更好的初始回报。
6. 中国:市场结构与落地
6.1 市场结构:不同的设计,更弱的保障
市场运营机构并不独立 —— 这是与美国的根本区别。 省级现货市场由 电网公司内部 (国家电网、南方电网)的调度中心和交易中心运行。交易中心名义上通过股份制改革实现独立,但调度仍留在电网组织内部。电网公司历史上对结果有商业利益 —— 这里的"内部人"是结构性的,而非假设性的。调度/交易分离自 9 号文(2015)以来一直是改革诉求。
透明度:在改善,但远低于 PJM。 自 2023 年起已搭建起"1+6"的国家规则框架:市场运营基本规则 + 现货市场(2023)、信息披露(2024)、中长期交易、注册、辅助服务(2025)、计量/结算(2025)。多个省份(山西、广东、山东)公布出清方法;数个省份采用集中式 SCUC/SCED 式出清,部分为节点/分区制。相对 PJM 的差距:无报价级数据(即便是脱敏/滞后的也没有),约束级细节很少,出清模型内部未披露 —— 影子 SCED 重建要难得多。规则常由行政通知频繁修订,且各省差异巨大;限价(上限/下限)很紧,行政干预更常见且记录更少。
法律与执法:尚处萌芽。 不存在类似 Monitoring Analytics 的独立市场监测机构 —— 监督由交易中心/调度(即电网公司)加上人手单薄的国家能源局派出机构完成。没有成型的电力市场操纵判例体系;一般性法律在现货电力行为上尚未经检验。国企主导的参与和行政式的争议解决,意味着几乎没有"以先例形成威慑"的效果。
综合评估。 PJM 的三大保障(§3.2)在中国都更弱:算法披露不完整、有利于电网关联实体的结构性数据不对称、执法尚在萌芽。现实的信息优势来自 对电网/调度机构的近水楼台 ,而非流氓供应商。缓解因素:大量的中长期合同覆盖(2024 年约占用电量的 47%)加上限价,意味着现货中每单位信息优势所对应的资金更少,而改革方向明确指向披露和监督。 值得关注: 调度是否真正从电网公司中分离出去。全国统一市场目标约为 2029 年;截至 2025 年已有七个省份进入现货全面运行(山西、广东、山东、甘肃、蒙西、湖北、浙江)。
6.2 面向中国部署的天气数据采购
评估过的基线技术栈 —— 以 ECMWF HRES+EPS 为骨干、GFS/GEFS 为次要、CMA 区域模型 + 观测、Himawari/风云卫星辐照、客户测风塔、WRF 降尺度上"先买"—— 在传统意义上是稳健的。建议的改动:
- 加入 AI 天气模型 —— 最明显的遗漏。 AIFS 开放数据加上开源权重模型(GraphCast/Pangu)以接近零的边际成本加密集合预报;中国本土的 AI 天气生态(Pangu、Fuxi、FengWu、CMA 集成)既便宜又是一项合规资产;GPU 成本低廉的模型解锁了那套授权技术栈无法提供的日内刷新节奏。
- 第一天就加入 ERA5/再分析 —— 校准模型和回测的训练基底。
- 把融合/校准层显式化 ,给它单独的预算行 —— 针对每个站点用地面真值校准的多模型集合,正是钱之所在;来源多样性是校准的燃料。
- 指定一套回退层级 (EPS → AIFS 开放 → GFS → 持续性)作为工程要求。
- 尽早做双向合规审查: ECMWF 再分发条款 × 中国关于外国数据商用和本土观测数据出境的法规 —— 这限制了融合层在物理上能在哪里运行。
- 加入逆变器/SCADA 数据作为地面真值 (免费、密集、内建了真实的机组行为),外加一条面向客户传感器的质控管线。
- 把"自建 WRF"重新表述为"自建降尺度",方法开放 —— 到需要决策时,学习式降尺度很可能在成本上胜过 WRF。
- 在 0–4 小时窗口显式设计"卫星临近预报 → NWP"的融合交接 ,以避免在日内交易时段出现不连续。
7. 开放问题
从讨论中沿承下来:
- 哪个(些)市场? 美国 ISO vs. 中国省级现货试点 —— 关门时间和结算规则会改变预测刷新的要求。
- 资产组合? 光伏/风电/带储能的混合 —— 储能同址会把优化器从一个 LP 变成一个序贯问题。
- 风险授权? 对一个独立金融(虚拟/FTR)账户的胃口,vs. 仅在资产账户内部做内嵌 alpha。
8. 参考资料与延伸阅读
- GraphCast: Learning skillful medium-range global weather forecasting, Science (Dec 2023). https://www.science.org/doi/10.1126/science.adi2336
- Pangu-Weather: Accurate medium-range global weather forecasting with 3D neural networks, Nature (Jul 2023). https://www.nature.com/articles/s41586-023-06185-3
- Aurora: A foundation model for the Earth system, Nature (May 2025). https://www.nature.com/articles/s41586-025-09005-y
- ECMWF AIFS operational status (2024). https://www.ecmwf.int/en/about/media-centre/news/2024/ecmwfs-ai-forecasts-become-operational
- Donti, Amos, Kolter: Task-based end-to-end model learning in stochastic optimization, NeurIPS 2017. https://arxiv.org/abs/1703.04529
- Elmachtoub & Grigas: Smart "Predict, then Optimize", Management Science (2022). https://arxiv.org/abs/1710.08005
- Decision-focused learning for energy/reserve market participation. https://www.researchgate.net/publication/383107857
- Decision-focused predict-then-bid for strategic storage. https://arxiv.org/abs/2505.01551
- Statistical vs. economic evaluation of electricity-market forecasts (DFL counter-evidence). https://arxiv.org/abs/2511.13616
- RL in deregulated energy markets: comprehensive review (150+ papers). https://www.sciencedirect.com/science/article/abs/pii/S0306261922014696
- On-line RL for real-life energy trading (simulator-gap discussion). https://arxiv.org/abs/2303.16266
- Modo Energy: independent benchmarking of storage optimizers. https://modoenergy.com
编写于 2026 年 7 月。所依据研究中引用的供应商性能宣称,应在采购决策前针对你自己的资产独立验证。