Summary
在 ReviewBot Kanban 增加按固定评测窗口展示的外部对照数据,直接回答 ReviewBot/InferMatrix 相比 Claude Fable 5 和人工评审的质量与效率表现。
Parent tracking issue: #116
Motivation
现有看板已经能展示 ReviewBot 的运行指标和历史趋势,但仍难以回答:
- 相比 Fable 5 teacher baseline,ReviewBot 的有效 finding、覆盖和成本如何?
- 相比人工 review ground truth,哪些意见重合、哪些是独有发现、哪些是误报?
- 得到这些结果分别消耗多少机器时间和人工复核时间?
Proposed metrics
Quality
- 有效 finding 数/率;
- precision、recall 或可解释的覆盖率;
- severity-weighted yield;
- 与人工意见的 overlap 和 unique findings;
- unknown/未判定数量。
Efficiency
- 总耗时与首个可执行 finding 时间;
- 模型/工具调用量或成本;
- 每个有效 finding 的成本;
- 人工 adjudication 时间。
Comparison contract
- 各 arm 固定相同 base/head SHA、模型版本、环境、time budget 和评判口径。
- 始终展示 PR 数、finding 数与缺失样本,unknown 不得显示成 0。
- 不满足受控条件的比较标记为
directional case study,不得呈现为严格 A/B。
- 支持按 release/monthly evaluation window 查看,保留历史趋势。
Acceptance criteria
Related
Summary
在 ReviewBot Kanban 增加按固定评测窗口展示的外部对照数据,直接回答 ReviewBot/InferMatrix 相比 Claude Fable 5 和人工评审的质量与效率表现。
Parent tracking issue: #116
Motivation
现有看板已经能展示 ReviewBot 的运行指标和历史趋势,但仍难以回答:
Proposed metrics
Quality
Efficiency
Comparison contract
directional case study,不得呈现为严格 A/B。Acceptance criteria
Related