Skip to content

[Feature] 性能 PR 评审增加瓶颈、价值与 A/B 消融追问 #122

Description

@zengchuang-hw

Summary

在 ReviewBot 评审性能、资源、架构优化或高成本机制 PR 时,增加简短、可执行的证据追问,重点确认性能瓶颈、实际价值以及 A/B/消融是否隔离了每个主要 claim。

Parent tracking issue: #116

Proposed review prompt

检测到性能/价值 claim 后,先提出三个问题:

  1. 当前性能瓶颈是什么,使用什么 profile/trace/分阶段数据证明?
  2. 这项改动带来的用户或系统价值是什么?
  3. 是否有同 workload、同 head/config 的 A/B 或消融,隔离每个主要 claim 的独立贡献?

问题应保持简短,不直接倾倒完整 checklist。只有回答或 PR 风险表明需要深入验证时,再展开仓库 skill 中的 performance-evidence 要求。

Evidence expectations

  • 固定 base/head SHA、硬件、模型、workload、warmup 和测量次数。
  • 报告均值/分位数及必要的不确定性,不混合 cold/warm population。
  • 性能提升必须有正确性、质量或输出等价信号。
  • 多项叠加优化尽量逐项消融,避免一个 blended delta 掩盖无效或负贡献项。
  • 端到端 claim 需要阶段归因;component microbenchmark 不能替代 e2e 结果。
  • 没有性能 claim 的 smoke/model-addition PR 按比例检查,不强制完整研究级矩阵。

可参考仓库 review skill 的 performance-evidence 规则,以及 Hongsheng 的 vllm-omni#6820;完整性能证据示例可参考 vllm-omni#6885

Acceptance criteria

  • 性能/价值 claim 能稳定触发“瓶颈、价值、A/B/消融”三类问题。
  • 评论简短、去重,并指向缺失的具体证据而不是泛泛要求 benchmark。
  • 多 claim PR 会要求可隔离的逐项对照或解释为什么无法消融。
  • ReviewBot 检查 base/head、硬件、workload、测量次数和质量等价性。
  • 按 PR claim 和风险分级,不对所有模型新增 PR 强制完整 perf suite。
  • 同一 PR/head 的同类证据问题只发布一次。

Related

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions