对AI生成的测试用例进行六维评审(完整性、准确性、可执行性、风险覆盖、规范性、追溯性),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分...
---
name: qa-ai-output-critique
version: 1.6.0
description: >-
对AI生成的测试用例进行六维评审(完整性、准确性、可执行性、风险覆盖、规范性、追溯性),是AI生成用例后的第一个质量门禁。当AI刚刚生成了一大批测试用例、你需要确保这些用例真的有价值而不是"看起来不错"时,应当使用此技能。不要假设AI输出的都是对的——AI经常生成语义正确但实际操作不了的用例。每个维度评分低于7分的必须标注问题并使用MISSING/WRONG/VAGUE等规范格式标记。
when_to_use: AI生成用例后自动激活(最终输出前的必过门禁);用户说"检查一下输出"、"评审用例质量"、"验证完整性"、"这个用例对吗"、"自动检查"时
allowed-tools: Read Grep Glob
related_skills:
upstream:
- qa-ai-prompt-strategy # 输入:AI生成的测试用例
- qa-scenario-tree # 可选输入:场景树(用于完整性评审)
- qa-risk-intuition # 可选输入:风险清单(用于风险覆盖评审)
downstream:
- qa-ai-blindspot-compensation # 输出:评审结果传递给补盲
- qa-expert-review
- qa-output-validation
references:
- references/report-templates.md
- references/review-dimensions.md
input_format:
required:
- name: AI生成测试用例
type: array
description: AI生成的测试用例列表
optional:
- name: 需求文档
type: string
description: 原始需求描述
- name: 评审标准
type: object
description: 评审维度和标准配置
output_format:
traceability:
- 本技能评审用例,不新增唯一ID;评审问题关联到原用例ID(TC-XXXX)
structure:
- critique_report: 六维评审报告
- coverage_gaps: 覆盖遗漏清单
- quality_score: 质量评分
- improvement_suggestions: 改进建议列表
depth_requirement_quantification:
reference_value: "根据用例数量和复杂度调整评审深度:简单x1/中等x2/复杂x3"
minimum: "至少覆盖功能正确性、边界条件、异常场景3个评审维度"
categories: ['Development','Testing','AI']
error_recovery_guidance:
on_failure: "评审发现系统性问题时回退到AI生成步骤修正"
retry_behavior: "修正提示词或上下文后重新生成并评审"
---
> **⚠️ 安全警告**:本技能的示例可能涉及测试用例整理、合并或删除建议。
> 实际使用时请勿直接执行批量删除操作,先备份原数据并确认非关键用例。
> 本技能仅在 workspace/ 输出评估文件,不持久化、不外传、不跨会话复用。
# AI 输出评审
## 使用逻辑
本技能分为四个阶段,按顺序执行:
```text
阶段一:评审框架(八维评审法)
│
│ 使用八维评审法对AI输出进行系统打分
│ 输出:评审报告(评分 + 问题清单)
│
▼
阶段二:报告模板(输出格式)
│
│ 按标准格式输出评审结果
│ 输出:结构化评审报告
│
▼
阶段三:追问问法(深入挖掘)
│
│ 使用追问技巧引导发现问题
│ 输出:更深层的质量洞察
│
▼
阶段四:辅助工具(假设挖掘/反驳机制/投入产出评估)
│
│ 补充评审维度,提升评审深度
│ 输出:完整评审结论
```
**关键点**:阶段三的"追问问法"是在评审报告输出后使用的,用于引导发现更深层的问题,不是独立的评审体系。
## 输入要求
### 必填输入
- AI生成的测试用例
### 推荐输入(提供则评审更准确)
- 场景树(来自qa-scenario-tree):用于完整性评审,判断场景覆盖率
- 风险清单(来自qa-risk-intuition):用于风险覆盖评审,判断高风险区域是否深测
- 需求ID列表:用于追溯性评审,判断用例是否可追溯
### 降级策略
如果缺少推荐输入:
| 缺少的输入 | 评审策略 | 降级处理 |
|-----------|----------|----------|
| 场景树 | 完整性评审 | 基于通用场景清单(主流程/分支/异常/边界) |
| 风险清单 | 风险覆盖评审 | 基于默认风险类型(资金/安全/并发/数据一致性) |
| 需求ID列表 | 追溯性评审 | 跳过,标记为"需补充追溯信息" |
## 评审模式
### 模式A:完整评审(有场景树和风险清单)
- 八维评审全部启用
- 输出完整评审报告
- 适用场景:工作流中的标准评审
### 模式B:快速评审(无上游数据)
- 启用六维评审(跳过追溯性,简化完整性)
- 输出简化评审报告
- 标注"建议补充场景树后重新评审"
- 适用场景:独立使用、快速检查
### 模式选择规则
```text
有场景树 AND 有风险清单 → 模式A(完整评审)
否则 → 模式B(快速评审)
```
## 核心原则
AI输出看起来都对,但专家能看出哪里不够。
## 八维评审法速查
**评分标准**:每维度10分,总分≥64分为合格。详见 [`references/review-dimensions.md`](references/review-dimensions.md)。
| 维度 | 评分核心 | 核心关注 |
|------|---------|---------|
| 完整性 | 场景覆盖是否完整 | 主路径+分支+异常+边界 |
| 正确性 | 业务规则和预期是否正确 | 内容正确性 |
| 可执行性 | 步骤是否清晰可执行 | 可操作性 |
| 风险覆盖 | 高风险区域是否深测 | 资金/安全/并发/数据 |
| 规范性 | 格式是否符合标准 | 编号/表格/字段 |
| 追溯性 | 需求/风险ID是否完整 | 需求追溯链 |
| 一致性 | 用例间是否自相矛盾 | 前置与步骤匹配 |
| 冗余度 | 是否有无价值用例 | 重复/低价值用例 |
> 每维度的详细评分标准、评审清单和追问问法参见 [`references/review-dimensions.md`](references/review-dimensions.md)。
## 评审报告模板
详见 [`references/report-templates.md`](references/report-templates.md),包含三种模板:
- **完整评审报告(模式A)**:八维评分 + 问题清单 + 改进方向
- **简化评审报告(模式B)**:六维评分 + 降级标注
- **快速评审模板**:星级评价 + 主要问题 + 迭代方向
## 假设挖掘
AI输出中常见的隐含假设:
| 假设类型 | 示例 | 验证方法 |
|---------|------|---------|
| 用户行为假设 | "用户会正常输入" | 追问:用户误输入怎么办? |
| 环境假设 | "网络正常" | 追问:网络异常时会怎样? |
| 数据假设 | "数据格式正确" | 追问:格式错误时怎么处理? |
| 时序假设 | "操作按顺序执行" | 追问:乱序执行会怎样? |
| 依赖假设 | "第三方服务正常" | 追问:第三方挂了怎么办? |
**挖掘问法**:
```text
请列出你在输出中做的所有假设
哪些假设可能不成立?
如果假设不成立,测试场景会有什么变化?
```
## 迭代决策树
当AI输出不满意时:
```text
输出不满意
│
├── 完整性不够?
│ └── 补充场景:请补充[缺失的场景类型]
│
├── 深度不够?
│ └── 深入分析:请按[具体维度]深入分析
│
├── 风险覆盖不足?
│ └── 重点强化:请对[高风险区域]做专项测试
│
├── 有矛盾?
│ └── 修正一致性:请修正[具体矛盾点]
│
├── 冗余过多?
│ └── 精简用例:请合并或删除[低价值用例]
│
└── 不可执行?
└── 调整可行性:请确保[测试步骤]可实际执行
```
## AI反驳机制
让AI挑战你的假设,而不是迎合你。
### 反驳问法模板
```text
模式1:质量负责人视角
"请站在质量负责人角度,指出可能遗漏的业务风险、过度测试的地方,
以及上线前还需要确认的问题。"
模式2:故障反推视角
"请假设这个功能上线后出现严重问题,反推我现在的测试方案
可能漏掉了什么。"
模式3:资源约束视角
"测试资源有限,请评估这些用例的投入产出比,
哪些是必须测的,哪些可以简化或跳过。"
模式4:竞品对比视角
"如果竞争对手的同类功能比我们更稳定,可能是因为
他们多测了哪些我们没覆盖的场景?"
```
### 反驳检查清单
- [ ] 是否要求AI挑战你的假设?
- [ ] 是否让AI从反面看问题?
- [ ] 是否评估了投入产出比?
- [ ] 是否识别了过度测试的区域?
## 投入产出评估
### 评估维度
| 维度 | 评估标准 | 权重 |
|------|---------|------|
| 业务价值 | 影响用户数×影响程度 | 40% |
| 风险等级 | 发生概率×影响程度 | 30% |
| 测试成本 | 用例数×执行时间 | 20% |
| 自动化潜力 | 是否适合自动化 | 10% |
### 评估矩阵
| 用例类型 | 业务价值 | 风险等级 | 测试成本 | 建议 |
|---------|---------|---------|---------|------|
| P0+高风险 | 高 | 高 | 中 | 必须测试,优先自动化 |
| P0+低风险 | 高 | 低 | 低 | 必须测试,手动即可 |
| P1+高风险 | 中 | 高 | 中 | 必须测试,考虑自动化 |
| P1+低风险 | 中 | 低 | 低 | 选择性测试 |
| P2+高风险 | 低 | 高 | 中 | 评估后决定 |
| P2+低风险 | 低 | 低 | 低 | 可跳过或简化 |
### ROI计算公式
```text
ROI = (业务价值 × 风险等级) / 测试成本
示例:
用例A:业务价值=5, 风险等级=5, 测试成本=2
ROI = (5×5)/2 = 12.5 → 高ROI,优先测试
用例B:业务价值=2, 风险等级=2, 测试成本=5
ROI = (2×2)/5 = 0.8 → 低ROI,可简化
```
## 检查清单
评审完成后检查:
- [ ] 是否识别了AI的隐含假设?
- [ ] 是否评估了覆盖完整性?
- [ ] 是否检查了一致性?
- [ ] 是否评估了冗余度?
- [ ] 是否有明确的迭代方向?
- [ ] 评审报告是否可执行?
- [ ] 是否标注了降级模式(如适用)?
don't have the plugin yet? install it then click "run inline in claude" again.