Bad Case

失败模式与迭代

每条 Bad Case 都定位到具体层级(查询解析 / 问题拆解 / 答案生成 / 引用),改完放进固定回归集验证,避免同类问题复发。

Bad Case 与优化闭环
ID类型现象定位层级优化动作优化前 → 优化后状态
BC-001条件型中文数字高度表达漏召回 5.5.27查询解析 / 扩展中文数字标准化 + 高度 / 楼梯间术语映射部分 Top5 未命中 → 多数进入 Top1–2已解决
BC-002条件型"应采用"被弱化为"建议采用"答案生成增加 应 / 不应 / 宜 / 可 原义保持规则忠实性波动 → 忠实性稳定提升已解决
BC-003综合型只答出口数量,漏掉宽度计算问题拆解拆分数量 / 宽度两个回答点并分别绑定证据完整性偏低 → 完整性提升已解决
BC-004综合型答案正确但漏引表格依据引用 / 工程条款编号与表格来源由 metadata 输出引用正确率偏低 → 引用正确率提升已解决
BC-005定义型安全出口定义被过度压缩答案生成定义型问题优先保留规范原义准确性偶有下降 → 准确性稳定已解决
BC-006综合型极口语表达仍有漏召回领域词典扩充安全出口 / 疏散宽度等领域同义词少量 Top5 未命中 → 待 V1.2 验证优化中

版本迭代

版本与验证范围
版本阶段目标主要改动结果状态
V0.1验证检索增强可行性规范结构化、基础向量检索、问答输出能完成基础问答,召回与引用稳定性不足完成
V1.0形成可回归评测版本混合召回、Rerank、强制引用以 500 条回归集汇总指标,口语 / 综合题仍需优化完成
V1.1提升召回与答案约束查询标准化、领域词扩展、子问题拆分、引用字段绑定召回、排序与生成质量全面提升完成
V1.2扩大真实场景覆盖引入真实查询,扩充同义词与边界测试待验证规划