Skip to content

[Feature] Kanban 对比 ReviewBot、Claude Fable 5 与人工评审 #118

Description

@zengchuang-hw

Summary

在 ReviewBot Kanban 增加按固定评测窗口展示的外部对照数据,直接回答 ReviewBot/InferMatrix 相比 Claude Fable 5 和人工评审的质量与效率表现。

Parent tracking issue: #116

Motivation

现有看板已经能展示 ReviewBot 的运行指标和历史趋势,但仍难以回答:

  • 相比 Fable 5 teacher baseline,ReviewBot 的有效 finding、覆盖和成本如何?
  • 相比人工 review ground truth,哪些意见重合、哪些是独有发现、哪些是误报?
  • 得到这些结果分别消耗多少机器时间和人工复核时间?

Proposed metrics

Quality

  • 有效 finding 数/率;
  • precision、recall 或可解释的覆盖率;
  • severity-weighted yield;
  • 与人工意见的 overlap 和 unique findings;
  • unknown/未判定数量。

Efficiency

  • 总耗时与首个可执行 finding 时间;
  • 模型/工具调用量或成本;
  • 每个有效 finding 的成本;
  • 人工 adjudication 时间。

Comparison contract

  • 各 arm 固定相同 base/head SHA、模型版本、环境、time budget 和评判口径。
  • 始终展示 PR 数、finding 数与缺失样本,unknown 不得显示成 0。
  • 不满足受控条件的比较标记为 directional case study,不得呈现为严格 A/B。
  • 支持按 release/monthly evaluation window 查看,保留历史趋势。

Acceptance criteria

  • Kanban 同屏展示 ReviewBot、Claude Fable 5 和人工 ground truth 三组数据。
  • 同时展示质量、效率、样本量和可比性状态。
  • 缺失/未判定值诚实显示为 unknown,并与样本覆盖率相邻。
  • 严格对照和 directional case study 有明显视觉区分。
  • 数据可追溯到固定评测 manifest、SHA 和结果产物。
  • 桌面与移动宽度下均可阅读,空数据状态有测试。

Related

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions