离线评测用于验证 DataAgent 的字段级 Schema 检索、SQL 生成以及校验回溯效果。评测数据来自私域业务场景,公开仓库不包含原始数据库、标准 SQL 和人工标注结果,因此下列指标不能通过 GitHub Pages 样例站直接复现。
公开仓库提供可运行的 SQLite 样例、完整查询链路和自动化测试,用于验证工程机制;私域评测用于验证模型与检索策略在更大 Schema 上的效果。两类结果不能混用。
| 项目 | 条件 |
|---|---|
| Schema 规模 | 约 80~100 张业务表,每张表约 10~20 个字段,总计约 1,000~2,000 个字段 |
| 单表数据量 | 不超过 10,000 行 |
| 评测问题 | 600 条人工构建的自然语言 Query |
| 复杂问题占比 | 30%~40%,包含多表关联、聚合、排序、分组和多条件筛选 |
| Schema Ground Truth | 根据人工编写的标准 SQL 标注实际使用字段 |
| SQL Ground Truth | 执行标准 SQL 得到目标结果集,以结果集完全一致判定正确 |
字段召回率表示目标字段被召回的比例;字段准确率表示召回结果中正确字段的比例。SQL 执行准确率按结果集等价计算,不以“SQL 能成功执行”代替业务正确性。
| 指标 | 基线 | 优化后 | 说明 |
|---|---|---|---|
| 字段召回率 | 72% | 93% | 关键词与向量双路召回、RRF 融合和 Rerank 精排 |
| 字段准确率 | 18% | 43% | 候选数量优先保障召回,准确率上限受候选截断策略影响 |
| 单库 SQL 执行准确率 | 81% | 88.5% | 加入结果校验和错误反馈修复后提高 7.5 个百分点 |
| 多库 SQL 执行准确率 | 67% | 70% | 加入校验回溯后提高 3 个百分点 |
| Schema 检索延迟 | 约 100 ms | 约 400~500 ms | Rerank 增加约 300~400 ms 延迟,用于换取字段覆盖率和排序精度 |
多库结果来自私域扩展评测;公开仓库默认只注册一个只读 SQLite 执行器,不把该指标表述为 GitHub Pages 样例站的运行结果。
当前 CI 包含 13 项自动化测试:
- 4 项 Python 测试,覆盖 SQL 治理、表白名单、审计、结果校验和完整 Pipeline;
- 4 项 Java 测试,覆盖意图兜底、API Key 鉴权、DataAgent 契约和数据查询失败隔离;
- 5 项前端测试,覆盖复杂查询、写操作拦截、模型协议、结果解释和 SQL 修复。
GitHub Pages 另外提供 3 个浏览器内 SQLite 场景,用于检查关键词、Schema、计划、SQL、结果和解释的完整链路。它是工程演示,不是 600 条私域评测集的替代品。
- 对外引用指标时,应同时说明数据规模、计算方式和私域评测条件。
- 字段准确率 43% 不能脱离候选数量策略单独比较;该策略优先保证目标字段不漏召回。
- Rerank 的收益伴随额外延迟,高并发场景需要结合缓存、批处理和成本预算决定是否启用。
- 接入真实企业数据时,仍需增加数据库只读账号、行列权限、脱敏、资源配额和独立安全审计。