AI产品经理每个月都会遇到这个问题:模型团队说新版本效果提升了,产品上到底怎么验证?大模型输出的开放性让传统软件的「断言式测试」基本失效——没有标准答案的场景,怎么评估好坏?
评估失败大多不是方法问题,而是从未定义清楚什么叫好。对AI客服,「好」可能是解决率;对写作助手,「好」可能是采纳率;对摘要功能,「好」可能是信息完整且不捏造。先和业务方对齐评估维度(准确性、相关性、语气、格式合规等),再谈方法。
做法:抽样输出,按定义好的维度打分。
关键点:
人工评估准确但昂贵、慢,适合抽检和建立基准,不适合高频迭代。
做法:用一个强模型当裁判,按评分细则对输出打分。
关键点:
机评便宜、快、可全量,适合日常迭代回归。
前两层都是离线评估,最终裁判是真实用户。
做法:A/B测试新旧版本,观察产品级指标。
关键指标:任务完成率、采纳率(AI输出被用户采纳/修改/抛弃的比例)、纠错率(用户修改AI输出的幅度)、以及最终的留存和转化。
注意:AI产品的A/B实验通常需要更长周期,因为用户对输出的感知有累积效应,短期数据可能有噪声。
日常迭代:机评为主,每次变更跑回归评估集。
重要版本:人评抽样(200-500条)+ 机评全量 + 灰度在线实验。
模型更换或重大策略调整:完整的基准测试集 + 全流程评估 + 显著性检验的A/B实验。
评估体系是AI产品的地基。没有它,每次模型升级都是开盲盒。投入在评估上的每一分工程努力,都会在后续无数次迭代里加倍偿还。