[82] Testing AI with Real Design Scenarios(NN/G):用真实场景给 AI 体验写验收¶
- 原始来源:https://www.nngroup.com/articles/testing-ai-methodology/
- 对应章节:第 4 章(原型与信息架构)、第 5 章(验证与打磨)、第 6 章(UI 设计)、第 18 章(评测体系)
一句话摘要¶
评测 AI 体验不要用玩具例子,要用真实任务场景;否则你得到的是看起来很强的错觉,而不是上线后能站得住的结论。
你应该从这里带走什么¶
- 用真实任务组织测试:每个场景都包含目标、约束、失败后怎么继续,避免只测一句话问答。
- 把提示当作实验变量:提示词、上下文结构、控件默认值会显著影响结果,必须记录并可复跑。
- 把失败样本当主要产出:评测不是为了写报告,而是为了把失败写进回归集并进入门禁。
- 把方法拆成可重复流程:样本来源、评分口径、复跑方式、裁决规则,缺一项就会变成争论。
落地要点(可执行)¶
- 用真实日志与用户反馈生成场景卡:每张卡包含任务描述、输入样例、成功门槛、失败判定。
- 每次改动只回答一个问题:这次是为了更快、更准还是更安全,别混在一起。
- 记录上下文与版本指纹:模型、提示、检索策略、控件默认值、预算策略都要可追溯。
- 用回归驱动改进:上线事故优先写成回归样本,下一轮评测先确保它不再复发。
常见误用提醒¶
- 只测最容易的例子:上线之后的真实分布会把你没测过的角落全部放大。
- 没有门槛就宣布更好:缺少阈值与失败判定的评测,最后一定会退化成主观偏好。