Bad Case
失败模式与迭代
每条 Bad Case 都定位到具体层级(查询解析 / 问题拆解 / 答案生成 / 引用),改完放进固定回归集验证,避免同类问题复发。
| ID | 类型 | 现象 | 定位层级 | 优化动作 | 优化前 → 优化后 | 状态 |
|---|---|---|---|---|---|---|
| BC-001 | 条件型 | 中文数字高度表达漏召回 5.5.27 | 查询解析 / 扩展 | 中文数字标准化 + 高度 / 楼梯间术语映射 | 部分 Top5 未命中 → 多数进入 Top1–2 | 已解决 |
| BC-002 | 条件型 | "应采用"被弱化为"建议采用" | 答案生成 | 增加 应 / 不应 / 宜 / 可 原义保持规则 | 忠实性波动 → 忠实性稳定提升 | 已解决 |
| BC-003 | 综合型 | 只答出口数量,漏掉宽度计算 | 问题拆解 | 拆分数量 / 宽度两个回答点并分别绑定证据 | 完整性偏低 → 完整性提升 | 已解决 |
| BC-004 | 综合型 | 答案正确但漏引表格依据 | 引用 / 工程 | 条款编号与表格来源由 metadata 输出 | 引用正确率偏低 → 引用正确率提升 | 已解决 |
| BC-005 | 定义型 | 安全出口定义被过度压缩 | 答案生成 | 定义型问题优先保留规范原义 | 准确性偶有下降 → 准确性稳定 | 已解决 |
| BC-006 | 综合型 | 极口语表达仍有漏召回 | 领域词典 | 扩充安全出口 / 疏散宽度等领域同义词 | 少量 Top5 未命中 → 待 V1.2 验证 | 优化中 |
版本迭代
| 版本 | 阶段目标 | 主要改动 | 结果 | 状态 |
|---|---|---|---|---|
| V0.1 | 验证检索增强可行性 | 规范结构化、基础向量检索、问答输出 | 能完成基础问答,召回与引用稳定性不足 | 完成 |
| V1.0 | 形成可回归评测版本 | 混合召回、Rerank、强制引用 | 以 500 条回归集汇总指标,口语 / 综合题仍需优化 | 完成 |
| V1.1 | 提升召回与答案约束 | 查询标准化、领域词扩展、子问题拆分、引用字段绑定 | 召回、排序与生成质量全面提升 | 完成 |
| V1.2 | 扩大真实场景覆盖 | 引入真实查询,扩充同义词与边界测试 | 待验证 | 规划 |