AI 评测
用标准采样代替一次性问答
生成式 AI 的回答本身带随机性,所以评测不靠单次结果,而靠固定问题库、固定引擎、固定轮次建立可复现的口径,再做发布前后的对比复检。
20 × 2 × 3问题 × 引擎 × 轮次 = 120 次标准巡检
14 / 28 天发布后周期复检
双人标注关键评测集 + 难例回流
| 能力 | 目标 |
|---|---|
| AI 引擎有效采样成功率 | ≥90% |
| 品牌实体识别准确率 | ≥95% |
| 直接引用 URL 抽取准确率 | ≥98% |
| 策略人工可执行率 | ≥80% |
| 内容初稿可用率 | ≥75% |
| 报告生成成功率 | ≥95% |
明确推荐率按复检汇总口径统计;内部再拆分为明确首选率、明确 Top3 推荐率与无序推荐。
指标口径
| 指标 | 定义 / 计算口径 | 为什么需要 | 注意事项 |
|---|---|---|---|
| 品牌提及稳定率 | 包含目标品牌提及的有效采样次数 ÷ 全部有效采样次数 | 避免单次回答随机性 | 统计单元需绑定问题、引擎、模型版本、地区、语言、轮次 |
| 明确首选率 | AI 回答中将品牌明确表述为首选 / 最佳 / 第一推荐的次数 ÷ 有效推荐类采样次数 | 衡量强推荐关系 | 必须存在明确首选表达 |
| 明确 Top3 推荐率 | 存在明确顺序 / 编号且品牌进入 Top3 的次数 ÷ 有效推荐类采样次数 | 衡量有排序的推荐位置 | 无序并列推荐不计 Top3,应单独记录 |
| 品牌属性覆盖率 | 目标品牌属性中被 AI 在有效采样中明确提及的属性比例 | 衡量目标品牌认知是否出现 | 属性标签需统一 |
| 事实一致率 | AI 回答中的品牌事实论断与品牌事实库一致的比例 | 控制幻觉与错误信息风险 | 参数、价格、日期、功能、认证等优先核验 |
| 负面风险暴露率 | 包含明确负面品牌主张的有效采样次数 ÷ 全部品牌提及采样次数 | 衡量品牌风险暴露 | 需结合严重度与证据等级判断 |
| 自有来源直接引用率 | AI 回答直接引用的有效 URL 中,品牌官网 / 官方帮助 / 官方媒体 / 授权页面占比 | 观察自有内容是否成为直接信源 | 只有直接 URL 引用才算,不把语义相似当引用 |
| 内容任务采纳率 | 用户采纳的策略任务数 ÷ Strategist 输出的有效策略任务数 | 衡量策略可执行性 | 采纳不等于最终业务效果 |
| 内容初稿可用率 | 无需整体重写、仅需局部修改即可使用的初稿数 ÷ 全部生成初稿数 | 衡量 Creator 产出效率 | 核心事实错误应判不可用 |
| 变化关联强度 | Tracker 根据复检可比性、直接引用和指标变化输出 A / B / C / D / U 关联等级 | 避免把相关性写成因果 | 只有新发布 URL 被直接引用时才可输出 A 级直接证据 |
Agent 链路级评测
| Case | 测试目标 | 目标 Agent | 结构化输出 | 结果正确性 | 问题分类 | 优化动作 | 回归 |
|---|---|---|---|---|---|---|---|
| E001 | 推荐关系判断 | Analyzer | 通过 | 部分错误 | 推荐关系误判 | 补充首选 / Top3 / 无序推荐 / 普通提及的判定边界与反例;加入规则校验 | 通过 |
| E002 | 比例统计稳定性 | Analyzer | 通过 | 正确 | LLM 计算漂移 | 比例 / 计数完全下沉 Tool,LLM 只解释结果 | 通过 |
| E003 | 证据等级判断 | Analyzer | 通过 | 部分错误 | 证据不足 | 按直接引用证据 E1–E4 分级;禁止将语义相似或主题相关直接表述为引用 | 通过 |
| E004 | 跨 Agent 协作 | Strategist → Analyzer | 失败 | 错误 | Agent 循环 | 固定必填字段;缺字段直接返回结构化补充请求;限制循环次数 | 通过 |
| E005 | 采样失败恢复 | Listener | 通过 | 正确 | 外部服务异常 | 失败重试、部分完成、补采与状态记录 | 通过 |
| E006 | 上下文控制 | Creator | 通过 | 可用但冗余 | Context 过载 | 按职责只传目标问题、策略、品牌事实与必要证据 | 通过 |
| E007 | 任务规格遵循 | Orchestrator | 通过 | 部分错误 | 任务规格偏离 | 明确输出契约与必填参数;把模糊目标转成可验收问题 | 通过 |
| E008 | 停止条件判断 | Orchestrator | 通过 | 部分错误 | 步骤重复 / 无停止条件 | 显式终止条件 + 最大步数 + 重复动作检测 | 通过 |
| E009 | 角色边界遵循 | Analyzer | 通过 | 错误 | 角色越界 | 角色职责与禁止项写入 instructions;越权调用拦截 | 通过 |
| E010 | 关键参数澄清 | Orchestrator | 通过 | 部分错误 | 未主动澄清 | 每轮只问一个最关键问题;非关键参数给默认值 | 通过 |
| E011 | 上下文隔离 | Creator | 通过 | 可用但冗余 | 上下文过载 / 历史丢失 | 关键状态写入任务对象,按职责只传必要上下文 | 通过 |
| E012 | 验证完整性 | Tracker | 失败 | 错误 | 验证不足 / 过早终止 | 增加高层目标验证与外部校验,满足完成条件才结束 | 通过 |
| E013 | 敏感信息与提示泄露 | Creator | 通过 | 正确 | 敏感信息 / Prompt 泄露 | 不把敏感信息放入提示;输出过滤与权限隔离 | 通过 |
| E014 | 提示注入防护 | Listener | 通过 | 正确 | 提示注入 | 外部内容一律当数据;工具参数结构化;最小权限 | 通过 |