成果与复盘

结果、复盘与资料

500条离线测试集(定义型 / 条件型 / 综合型)
0.96Recall@5(V1.0 0.876 → V1.1 0.960)
0.75MRR(正确条款排序前移)
95.2%引用正确率(V1.0 83.8% → V1.1 95.2%)

项目复盘

做对了什么

先冻结评测口径——同一套 500 条固定回归集,每次迭代对比同一批指标,让"改动有没有用"可验证,而不是凭感觉。

踩过的坑

中文数字表达漏召回、"应采用"被弱化、综合题只答一半、答案对但漏引表格——这些都靠定位到具体层级后逐一修复。

下一版怎么走

引入真实查询扩充同义词与边界测试,增强跨专业条文关联(知识图谱),并把上线后的采纳率、点踩率纳入迭代闭环。

数据说明

评测为同一套 500 条固定回归集上的离线回放结果(V1.0 / V1.1,模型 DeepSeek-R1)。

联系方式