做对了什么
先冻结评测口径——同一套 500 条固定回归集,每次迭代对比同一批指标,让"改动有没有用"可验证,而不是凭感觉。
成果与复盘
先冻结评测口径——同一套 500 条固定回归集,每次迭代对比同一批指标,让"改动有没有用"可验证,而不是凭感觉。
中文数字表达漏召回、"应采用"被弱化、综合题只答一半、答案对但漏引表格——这些都靠定位到具体层级后逐一修复。
引入真实查询扩充同义词与边界测试,增强跨专业条文关联(知识图谱),并把上线后的采纳率、点踩率纳入迭代闭环。
评测为同一套 500 条固定回归集上的离线回放结果(V1.0 / V1.1,模型 DeepSeek-R1)。