AI 评测

用标准采样代替一次性问答

生成式 AI 的回答本身带随机性,所以评测不靠单次结果,而靠固定问题库、固定引擎、固定轮次建立可复现的口径,再做发布前后的对比复检。

20 × 2 × 3问题 × 引擎 × 轮次 = 120 次标准巡检
14 / 28 天发布后周期复检
双人标注关键评测集 + 难例回流
关键能力的首期验收阈值
能力目标
AI 引擎有效采样成功率≥90%
品牌实体识别准确率≥95%
直接引用 URL 抽取准确率≥98%
策略人工可执行率≥80%
内容初稿可用率≥75%
报告生成成功率≥95%

明确推荐率按复检汇总口径统计;内部再拆分为明确首选率、明确 Top3 推荐率与无序推荐。

指标口径

指标定义与注意事项
指标 定义 / 计算口径 为什么需要 注意事项
品牌提及稳定率包含目标品牌提及的有效采样次数 ÷ 全部有效采样次数避免单次回答随机性统计单元需绑定问题、引擎、模型版本、地区、语言、轮次
明确首选率AI 回答中将品牌明确表述为首选 / 最佳 / 第一推荐的次数 ÷ 有效推荐类采样次数衡量强推荐关系必须存在明确首选表达
明确 Top3 推荐率存在明确顺序 / 编号且品牌进入 Top3 的次数 ÷ 有效推荐类采样次数衡量有排序的推荐位置无序并列推荐不计 Top3,应单独记录
品牌属性覆盖率目标品牌属性中被 AI 在有效采样中明确提及的属性比例衡量目标品牌认知是否出现属性标签需统一
事实一致率AI 回答中的品牌事实论断与品牌事实库一致的比例控制幻觉与错误信息风险参数、价格、日期、功能、认证等优先核验
负面风险暴露率包含明确负面品牌主张的有效采样次数 ÷ 全部品牌提及采样次数衡量品牌风险暴露需结合严重度与证据等级判断
自有来源直接引用率AI 回答直接引用的有效 URL 中,品牌官网 / 官方帮助 / 官方媒体 / 授权页面占比观察自有内容是否成为直接信源只有直接 URL 引用才算,不把语义相似当引用
内容任务采纳率用户采纳的策略任务数 ÷ Strategist 输出的有效策略任务数衡量策略可执行性采纳不等于最终业务效果
内容初稿可用率无需整体重写、仅需局部修改即可使用的初稿数 ÷ 全部生成初稿数衡量 Creator 产出效率核心事实错误应判不可用
变化关联强度Tracker 根据复检可比性、直接引用和指标变化输出 A / B / C / D / U 关联等级避免把相关性写成因果只有新发布 URL 被直接引用时才可输出 A 级直接证据

Agent 链路级评测

代表性评测记录(节选)
Case 测试目标 目标 Agent 结构化输出 结果正确性 问题分类 优化动作 回归
E001 推荐关系判断 Analyzer 通过 部分错误 推荐关系误判 补充首选 / Top3 / 无序推荐 / 普通提及的判定边界与反例;加入规则校验 通过
E002 比例统计稳定性 Analyzer 通过 正确 LLM 计算漂移 比例 / 计数完全下沉 Tool,LLM 只解释结果 通过
E003 证据等级判断 Analyzer 通过 部分错误 证据不足 按直接引用证据 E1–E4 分级;禁止将语义相似或主题相关直接表述为引用 通过
E004 跨 Agent 协作 Strategist → Analyzer 失败 错误 Agent 循环 固定必填字段;缺字段直接返回结构化补充请求;限制循环次数 通过
E005 采样失败恢复 Listener 通过 正确 外部服务异常 失败重试、部分完成、补采与状态记录 通过
E006 上下文控制 Creator 通过 可用但冗余 Context 过载 按职责只传目标问题、策略、品牌事实与必要证据 通过
E007任务规格遵循Orchestrator通过部分错误任务规格偏离明确输出契约与必填参数;把模糊目标转成可验收问题通过
E008停止条件判断Orchestrator通过部分错误步骤重复 / 无停止条件显式终止条件 + 最大步数 + 重复动作检测通过
E009角色边界遵循Analyzer通过错误角色越界角色职责与禁止项写入 instructions;越权调用拦截通过
E010关键参数澄清Orchestrator通过部分错误未主动澄清每轮只问一个最关键问题;非关键参数给默认值通过
E011上下文隔离Creator通过可用但冗余上下文过载 / 历史丢失关键状态写入任务对象,按职责只传必要上下文通过
E012验证完整性Tracker失败错误验证不足 / 过早终止增加高层目标验证与外部校验,满足完成条件才结束通过
E013敏感信息与提示泄露Creator通过正确敏感信息 / Prompt 泄露不把敏感信息放入提示;输出过滤与权限隔离通过
E014提示注入防护Listener通过正确提示注入外部内容一律当数据;工具参数结构化;最小权限通过