vpp-ai-platform/docs/05-skills-and-data.md

102 lines
5.8 KiB
Markdown
Raw Permalink Normal View History

2026-09-01 19:46:59 -04:00
# 05 · 专业模型工具层与数据底座
## 1. 工具层(Skills)总则
- 每个 Skill 是**类型化、版本化、无状态**的服务,注册于 Runtime 工具注册表;
- LLM 只能调用注册表内工具,调用记录(输入/输出快照引用 + 版本)自动写入 Proposal 血缘(P2/P5);
- Skill 内部可以是任何技术(统计模型、深度学习、MILP、仿真引擎),对外契约统一。
## 2. 核心 Skill 契约(一期清单)
### 2.1 预测类
| Skill | 输入 | 输出 | 备注 |
|---|---|---|---|
| 短期负荷预测 | 用户/聚合级历史负荷、气象、日历特征、horizon | 96 点曲线 + 分位数区间(P10/P50/P90) | 目标:平均误差 ≤ 8% |
| 光伏出力预测 | 场站档案、辐照预报、历史出力 | 96 点曲线 + 区间 | |
| 现货电价预测 | 市场历史出清、供需信息、气象 | 96 点分时价格 + 区间 | 已有基础能力,迭代 |
**契约要点**:预测输出必须带不确定性区间——报价优化的风险测算依赖区间而非点值。
### 2.2 评估与优化类
| Skill | 输入 | 输出 |
|---|---|---|
| 可调潜力辨识 | 用户负荷曲线、设备档案、历史响应记录 | 分时段可调容量 + 置信度(目标准确率 ≥ 90%) |
| 报价优化(MILP) | 电价预测区间、可调容量、持仓约束(账本)、风险偏好参数 | 96 点申报曲线(价格/电量对)+ 预期收益分布 |
| 聚合/调度优化(MILP) | 资源池、目标曲线、网络与设备约束 | 分聚合单元的分配方案 |
| 指令分解优化 | 单元目标、设备约束、用户承诺 | 设备级设定值序列 |
| 激励优化 | 候选用户集、响应率预测、预算约束 | 邀约清单 + 激励方案 |
### 2.3 仿真与校核类
| Skill | 输入 | 输出 |
|---|---|---|
| 收益情景回测 | 申报 Proposal、价格情景集 | 收益/风险分布、极端情景亏损 |
| 功率平衡/潮流仿真 | 控制计划 Proposal、网架数据 | 可行 / 告警(越限点清单) |
| 申报格式校验 | 申报文件 | 通过 / 错误清单 |
### 2.4 分析与生成类
归因分析(预测/响应/交易/控制偏差分解)、异常检测(遥测流)、报告生成(复盘/专题,LLM 参与文字,数字全部引用工具输出)。
## 3. 数据底座(五类存储,各司其职)
| 存储 | 内容 | 主要写入方 | 主要消费方 | 选型示意 |
|---|---|---|---|---|
| 时序库 | 负荷/出力/电价/气象遥测曲线 | 数据接入管道、边缘上送 | 预测 Skill、监测看板 | TimescaleDB / IoTDB |
| 关系库 | 用户档案、合同、资源台账、市场结果、持仓账本 | 业务应用、结算接入 | 全体 | PostgreSQL |
| 向量库 + 知识库 | 交易规则、政策法规、设备约束文档、案例(RAG) | 知识运营流程 | 交易博弈 Agent、规则校核辅助、智能问答 | pgvector / 专用向量库 |
| 特征库 | 预测模型特征(在线/离线一致) | 特征管道 | 预测 Skill 训练与推理 | Feast 或自建 |
| 事件日志 | 全部业务事件、Proposal 状态迁移、审计 | Runtime(事件溯源) | 复盘、审计、监管取证 | Kafka + 对象存储归档 |
### 3.1 数据流主干
```mermaid
flowchart LR
SRC[电网 / 市场 / 气象 / 用户 / 设备] --> ING[接入管道<br/>清洗 · 对齐 · 质量校验 · 主数据]
ING --> TS[(时序库)] & RDB[(关系库)] & FS[(特征库)]
DOCS[规则 / 政策 / 设备文档] --> KB[(知识库/RAG)]
RT[Runtime / 可信执行链] --> EL[(事件日志)]
EL -->|复盘 ETL| RDB
TS & FS --> SKILL[预测 / 优化 Skill]
KB --> AG[智能体 RAG]
```
### 3.2 治理要点
- **主数据管理**:用户、资源、站点、设备的唯一标识与映射(现有共性能力层的档案/设备/站点中心是承接点);
- **数据质量门禁**:进入特征库的数据必须通过质量校验(缺失率、跳变、时标对齐),不合格数据打标隔离——预测误差 ≤ 8% 的 KPI 一半靠数据质量;
- **快照与引用**:Proposal 血缘引用的数据是不可变快照(按版本/时间戳),保证任何历史决策可复现;
- **脱敏分级**:用户行为数据按敏感级分级,跨区流动(如上送省级)经脱敏策略。
## 4. 政策包(Policy Pack)与知识库运营
2026-09-01 19:46:59 -04:00
**知识(可检索)与规则(可执行)严格分开**:RAG 用于解释规则、定位出处、支撑问答;
任何有后果的校核(市场规则、安全限值、设备约束、财务上限)由**政策包**强制执行。
### 4.1 政策包
规则校核引擎的规则不是散落的代码,而是**版本化、可测试、可部署的政策包**:
```yaml
PolicyPack:
id: hubei-spot-bidding
version: 2026.03 # 随规则修订升版,旧版本保留(历史决策重放需要,I7)
effective: {from, to}
rules: [...] # 可执行规则(申报格式、价格限值、持仓偏差带…)
tests: [...] # 每条规则附正/反用例,升版必须全绿
source_refs: [...] # 指向知识库原文条目(可解释性:规则 → 出处)
```
- Proposal 血缘固化**政策包版本**(03 篇 `evidence_versions.policy_pack`)——
「当时按哪版规则校核的」永远可查、可重放;
- 政策包升版触发影响分析工作流:扫描悬挂中/包络内的存量 Proposal,标记需重校核者。
### 4.2 知识库运营(容易被低估的持续成本)
2026-09-01 19:46:59 -04:00
- 知识条目带**生效期与版本**,RAG 检索默认过滤失效条目;
- 知识条目(文本规则)变更触发对应政策包同步评审的工作流
(避免「文档更新了、校核引擎还是旧规则」的双轨漂移);
- 每次申报被交易平台驳回的原因,强制回流为知识条目候选 + 政策包规则候选(复盘流程的一部分)。