AI 评测

用固定回归集做版本评测

同一套 500 条固定测试集,每次迭代都对比同一批指标:检索看 Recall@5 / MRR,生成看准确性、完整性、可解释性与忠实性。

500条离线测试集(定义 / 条件 / 综合)
Recall@5 · MRR检索效果指标
1–5 分生成质量四维打分 + 强制引用
检索效果指标
指标说明
Recall@k前 k 个检索结果中包含正确条款的比例
Precision@k前 k 个检索结果中相关条款的比例
MRR正确条款排名的倒数平均值
生成质量维度(1–5 分)
维度说明
准确性答案符合规范原文,无事实错误
完整性覆盖问题的全部要点
可解释性清楚引用条款编号,逻辑可核验
忠实性严格基于检索到的条款,无幻觉

版本评测结果:V1.0 → V1.1

同一套 500 条固定回归集,离线回放评测。

版本评测指标汇总(固定 500 条回归集)
指标V1.0V1.1变化说明
Recall@50.8760.960+0.084Top5 命中正确条款的问题占比
MRR0.4950.753+0.257正确条款排名的倒数平均值
准确性均分4.0384.90+0.862回答符合规范原意
完整性均分4.284.90+0.620覆盖问题全部要点
可解释性均分4.2724.84+0.568条款依据表达清晰
忠实性均分3.9944.90+0.906严格基于检索证据
引用正确率83.8%95.2%+11.4pp条款编号 / 来源与证据一致
平均响应时长3.53s3.28s-0.25s提交到完整答案的平均耗时