diff --git a/docs/00-overview.md b/docs/00-overview.md index 30c41a9..e5464e0 100644 --- a/docs/00-overview.md +++ b/docs/00-overview.md @@ -121,3 +121,4 @@ flowchart TB | 09-runtime-implementation | Runtime 实现设计(Mastra 落地细节) | 2.3 建设内容 05 | | 10-federation | 省间协同联邦边界 | 3.3 二期推广 | | 11-contracts | 接口清单、业务对象总表、TS↔Python 契约策略 | 2.3 建设内容 02/05 | +| 12-evaluation | 四层评测体系、数据集、变更门禁、KPI 口径 | 3.1 目标成果核心指标 | diff --git a/docs/08-implementation.md b/docs/08-implementation.md index 87b9277..d3e3923 100644 --- a/docs/08-implementation.md +++ b/docs/08-implementation.md @@ -49,6 +49,7 @@ Agent 代码 → 能力接口(complete / plan / extract / explain, 统一消 ——在确认前,抽象层按「OpenAI 兼容 + 8K 上下文 + 无原生工具调用」的保守假设设计降级路径; 3. **评测集先行**:为意图解析、规则问答、申报说明生成等每个 LLM 任务建立评测集, 换后端 = 跑评测集对比,而非人工感觉;这也是向评审证明「模型可替换、平台不锁定」的硬材料。 + 评测体系全貌(四层对象、数据集、变更门禁、KPI 口径)见 12 篇。 ## 3. 部署形态 diff --git a/docs/12-evaluation.md b/docs/12-evaluation.md new file mode 100644 index 0000000..112d384 --- /dev/null +++ b/docs/12-evaluation.md @@ -0,0 +1,110 @@ +# 12 · 评测体系(Evaluation) + +> 回答三个问题:评什么、拿什么数据评、评测结果门禁什么。 +> 基础事实:I7(任何决策可从证据重放)使事件日志 + 快照天然成为评测数据源—— +> **审计架构就是评测基础设施**,不另建数据管道。 + +## 1. 评测对象分层(四层,各有不同的方法论) + +``` +L4 端到端决策质量 影子运行对比 · 历史回测收益 · 反事实分析 +L3 可信执行链正确性 政策包测试 · 红队用例 · 不变式验证 +L2 专业模型 Skill 预测精度 · 求解质量 · 辨识准确率(对应核心 KPI) +L1 LLM 任务 意图路由 · 结构化输出 · RAG 忠实度 · 解释质量 +``` + +**分层的意义**:L4 出问题时能定位到层。申报收益差,是电价预测偏了(L2)、 +持仓约束读错了(L3 校核漏检)、还是策略解释误导了审批人(L1)——混在一起评就无法归因。 + +### L1 · LLM 任务评测 + +| 任务 | 指标 | 方法 | +|---|---|---| +| 意图路由(路由 Agent) | 模板选择准确率、参数抽取 F1 | 标注集:真实运营提问 + 变体扩增 | +| 结构化输出 | schema 合规率、工具引用完整率(数字必须是 `{toolCallId, path}` 引用) | 自动校验,零人工 | +| RAG 规则问答 | 引用准确率、忠实度(答案是否被检索片段支持)、失效条目误引率 | 规则库标注集 + 政策包升版时回归 | +| 申报说明 / 复盘报告生成 | 数字一致性(文中数字 vs 血缘工具输出,自动比对);可读性走人工抽样评分 | LLM-as-judge **仅用于**可读性回归对比,永不裁决数字正确性 | + +**换模型 = 跑完 L1 全集**(08 篇 P6 的落点):光明大模型接入验收即 L1 全集 + L4 影子对比 +达到商用 API 基线的规定比例,这是「模型可替换」主张的硬证据。 + +### L2 · Skill 评测(对应 proposal 核心 KPI) + +| Skill | 指标(口径见 §4) | 数据 | +|---|---|---| +| 负荷/光伏预测 | MAPE、分位数覆盖率(P10–P90 区间实际覆盖率) | 滚动历史回测 + 在线逐日 | +| 电价预测 | MAPE + **方向准确率**(高低价时段排序对——报价优化更依赖排序而非绝对值) | 同上 | +| 可调潜力辨识 | 辨识准确率(预估可调量 vs 实际履约量) | 执行反馈回流 | +| 报价优化 | 回测收益 vs 三基准:完美后见之明(上界)、人工历史决策、朴素策略(下界) | 历史行情重放 | +| 指令分解 | 可行解率、分解后仿真通过率 | 历史场景库 | + +**区间校准单独考核**:预测点值准但区间虚(P10–P90 实际只盖住 60%)会让收益风险测算 +系统性乐观——这是比点值偏差更危险的失效模式。 + +### L3 · 可信执行链评测 + +- **政策包测试**(05 篇):每条规则正/反用例,升版全绿才能发布; +- **不变式测试**(01 篇 I1–I8):每条不变式至少一个自动化用例 + (AI 尝试自批 → 必须被拒;伪造数字的 Proposal → 血缘校验必须拦截; + 过期 Permit → 网关必须拒收;LLM 服务下线 → 校核/审批/申报链路必须可用); +- **红队用例库**:越权工具调用、RAG 注入(规则文档里埋指令)、提示注入 + (用户提问诱导路由到高权限流程)、包络边界探测(恰好压线/超线一分钱)。 + 红队集随攻击面演进持续扩充,进 CI 全量回归。 + +### L4 · 端到端决策质量 + +- **历史回测**:I7 重放——取历史某日的证据快照,让当前系统版本完整跑 07 篇场景, + 对比当时的实际人工决策与实际市场结果;系统升级(提示词、模型、政策包、Skill)后 + 跑固定历史日集合,防决策质量回退; +- **影子运行**(08 篇 M5):线上持续评测——逐日记录影子决策 vs 人工决策 vs 事后最优, + 形成三线对比曲线;这是包络放宽审批的**唯一合法依据**; +- **反事实归因**:复盘流程中,收益偏差按层分解(预测贡献/策略贡献/执行贡献), + 写入 ReviewFinding——L4 结果驱动 L1–L3 的改进优先级。 + +## 2. 数据集体系 + +| 数据集 | 来源 | 用途 | 维护 | +|---|---|---|---| +| 黄金标注集 | 运营真实提问/文档 + 人工标注 | L1 | 每季评审补充 | +| 历史重放集 | 事件日志 + 快照(I7) | L2/L4 回测 | 自动沉淀,选代表日固化(高温日/大风日/价格异常日/节假日) | +| 红队用例库 | 安全评审 + 演练发现 | L3 | 持续扩充,只增不删 | +| 生产回流集 | **每条 ReviewFinding 自动生成评测用例候选**(失败案例是最贵的评测资产) | 全层 | 复盘流程内置步骤 | + +## 3. 评测即门禁(什么变更触发什么评测) + +| 变更 | 必须通过 | 附加 | +|---|---|---| +| 提示词 / Agent instructions | L1 相关任务集 | 固定历史日 L4 回测无回退 | +| LLM 后端切换(含光明接入) | L1 全集 | L4 影子对比 ≥ 基线的约定比例 | +| Skill 模型升版 | L2 该 Skill 全指标 | 下游 L4 回测 | +| 政策包升版 | L3 政策包测试全绿 | 存量 Proposal 影响分析(05 篇) | +| 包络放宽 | — | **仅凭 L4 影子/在线数据审批**(03 篇自治拨盘),无数据不放宽 | +| 契约 schema 变更 | 双端黄金样例(11 篇) | 兼容性检查 | + +## 4. KPI 口径(proposal 核心指标 → 可测量定义) + +| proposal 指标 | 建议口径(待业务确认) | +|---|---| +| 预测平均误差 ≤ 8% | 聚合层面日前 96 点负荷 MAPE,月滚动均值;光伏单独统计(建议按装机归一的 nRMSE,逆天气日单列) | +| 可调潜力辨识准确率 ≥ 90% | \|预估可调量 − 实际履约量\| / 预估可调量 ≤ 阈值的事件占比 | +| 协同决策响应 ≤ 3 分钟 | 事件触发 → Proposal 进入待批/自动批准状态的 P95 时延(不含人工审批等待——人的时间不算系统的) | +| 调度指令执行成功率 ≥ 98% | 收到有效 Permit 的指令中,按回执确认执行且偏差在带内的占比 | +| 综合市场收益提升 15% | 影子/实盘 vs 同期人工基线的归一化收益差(需冻结基线口径,防「基线漂移」) | +| 跨区域资源匹配准确率 ≥ 85% | 联邦工件层面:承诺容量 vs 交付确认(10 篇 §3) | + +> **TODO(业务)**:以上口径需运营团队确认后写入 07 篇场景与验收材料; +> 特别是「收益提升 15%」的对照基线定义——这是验收时最容易被质询的指标。 + +## 5. 基础设施与代码位置 + +``` +packages/evals/ +├── datasets/ # 黄金集 · 红队库 · 代表日清单(重放集本体在事件日志,不复制) +├── harness/ # 重放驱动器(读快照 → 起工作流 → 比对产出)、指标计算 +├── judges/ # 自动校验器(schema/数字一致性/引用完整)+ 抽样评分工具 +└── reports/ # 每次评测运行的留档(评测本身也留痕:跑了哪版模型/数据/口径) +``` + +- 评测运行记录进事件日志——「当时凭什么放宽包络」与「当时凭什么切换模型」同样可审计; +- L2 在线指标(逐日预测误差、区间覆盖率)进运营看板,异常触发事件(喂给智能分析 Agent, + 评测体系自身也被监测)。