AI 评测
用固定回归集做版本评测
同一套 500 条固定测试集,每次迭代都对比同一批指标:检索看 Recall@5 / MRR,生成看准确性、完整性、可解释性与忠实性。
500条离线测试集(定义 / 条件 / 综合)
Recall@5 · MRR检索效果指标
1–5 分生成质量四维打分 + 强制引用
| 指标 | 说明 |
|---|---|
| Recall@k | 前 k 个检索结果中包含正确条款的比例 |
| Precision@k | 前 k 个检索结果中相关条款的比例 |
| MRR | 正确条款排名的倒数平均值 |
| 维度 | 说明 |
|---|---|
| 准确性 | 答案符合规范原文,无事实错误 |
| 完整性 | 覆盖问题的全部要点 |
| 可解释性 | 清楚引用条款编号,逻辑可核验 |
| 忠实性 | 严格基于检索到的条款,无幻觉 |
版本评测结果:V1.0 → V1.1
同一套 500 条固定回归集,离线回放评测。
| 指标 | V1.0 | V1.1 | 变化 | 说明 |
|---|---|---|---|---|
| Recall@5 | 0.876 | 0.960 | +0.084 | Top5 命中正确条款的问题占比 |
| MRR | 0.495 | 0.753 | +0.257 | 正确条款排名的倒数平均值 |
| 准确性均分 | 4.038 | 4.90 | +0.862 | 回答符合规范原意 |
| 完整性均分 | 4.28 | 4.90 | +0.620 | 覆盖问题全部要点 |
| 可解释性均分 | 4.272 | 4.84 | +0.568 | 条款依据表达清晰 |
| 忠实性均分 | 3.994 | 4.90 | +0.906 | 严格基于检索证据 |
| 引用正确率 | 83.8% | 95.2% | +11.4pp | 条款编号 / 来源与证据一致 |
| 平均响应时长 | 3.53s | 3.28s | -0.25s | 提交到完整答案的平均耗时 |