Summary
在 ReviewBot 评审性能、资源、架构优化或高成本机制 PR 时,增加简短、可执行的证据追问,重点确认性能瓶颈、实际价值以及 A/B/消融是否隔离了每个主要 claim。
Parent tracking issue: #116
Proposed review prompt
检测到性能/价值 claim 后,先提出三个问题:
- 当前性能瓶颈是什么,使用什么 profile/trace/分阶段数据证明?
- 这项改动带来的用户或系统价值是什么?
- 是否有同 workload、同 head/config 的 A/B 或消融,隔离每个主要 claim 的独立贡献?
问题应保持简短,不直接倾倒完整 checklist。只有回答或 PR 风险表明需要深入验证时,再展开仓库 skill 中的 performance-evidence 要求。
Evidence expectations
- 固定 base/head SHA、硬件、模型、workload、warmup 和测量次数。
- 报告均值/分位数及必要的不确定性,不混合 cold/warm population。
- 性能提升必须有正确性、质量或输出等价信号。
- 多项叠加优化尽量逐项消融,避免一个 blended delta 掩盖无效或负贡献项。
- 端到端 claim 需要阶段归因;component microbenchmark 不能替代 e2e 结果。
- 没有性能 claim 的 smoke/model-addition PR 按比例检查,不强制完整研究级矩阵。
可参考仓库 review skill 的 performance-evidence 规则,以及 Hongsheng 的 vllm-omni#6820;完整性能证据示例可参考 vllm-omni#6885。
Acceptance criteria
Related
Summary
在 ReviewBot 评审性能、资源、架构优化或高成本机制 PR 时,增加简短、可执行的证据追问,重点确认性能瓶颈、实际价值以及 A/B/消融是否隔离了每个主要 claim。
Parent tracking issue: #116
Proposed review prompt
检测到性能/价值 claim 后,先提出三个问题:
问题应保持简短,不直接倾倒完整 checklist。只有回答或 PR 风险表明需要深入验证时,再展开仓库 skill 中的 performance-evidence 要求。
Evidence expectations
可参考仓库 review skill 的 performance-evidence 规则,以及 Hongsheng 的 vllm-omni#6820;完整性能证据示例可参考 vllm-omni#6885。
Acceptance criteria
Related