为命令行 Agent Skill 和自动化项目提供确定性的评测与回归比较。
- 使用 JSON 定义评测用例
- 检查退出码、标准输出、文件存在性和禁用文件
- 检查输出文件内容
- 设置超时并记录执行时间
- 输出 JSON、Markdown、HTML 和 JUnit XML
- 与历史基线比较成功率和耗时
python scripts/evaluate_agent.py --cases examples/eval_cases.json --output_dir outputs
python scripts/compare_versions.py --baseline examples/baseline.json --candidate outputs/evaluation_results.json --output outputs/regression_report.md评测器会执行用例中的命令。请先审查 JSON 用例,不要使用生产数据或真实密钥。