Skip to content

Latest commit

 

History

History
49 lines (34 loc) · 3.13 KB

File metadata and controls

49 lines (34 loc) · 3.13 KB

InsightFlow 离线评测说明

1. 评测范围

离线评测用于验证 DataAgent 的字段级 Schema 检索、SQL 生成以及校验回溯效果。评测数据来自私域业务场景,公开仓库不包含原始数据库、标准 SQL 和人工标注结果,因此下列指标不能通过 GitHub Pages 样例站直接复现。

公开仓库提供可运行的 SQLite 样例、完整查询链路和自动化测试,用于验证工程机制;私域评测用于验证模型与检索策略在更大 Schema 上的效果。两类结果不能混用。

2. 数据集与计算方式

项目 条件
Schema 规模 约 80~100 张业务表,每张表约 10~20 个字段,总计约 1,000~2,000 个字段
单表数据量 不超过 10,000 行
评测问题 600 条人工构建的自然语言 Query
复杂问题占比 30%~40%,包含多表关联、聚合、排序、分组和多条件筛选
Schema Ground Truth 根据人工编写的标准 SQL 标注实际使用字段
SQL Ground Truth 执行标准 SQL 得到目标结果集,以结果集完全一致判定正确

字段召回率表示目标字段被召回的比例;字段准确率表示召回结果中正确字段的比例。SQL 执行准确率按结果集等价计算,不以“SQL 能成功执行”代替业务正确性。

3. 评测结果

指标 基线 优化后 说明
字段召回率 72% 93% 关键词与向量双路召回、RRF 融合和 Rerank 精排
字段准确率 18% 43% 候选数量优先保障召回,准确率上限受候选截断策略影响
单库 SQL 执行准确率 81% 88.5% 加入结果校验和错误反馈修复后提高 7.5 个百分点
多库 SQL 执行准确率 67% 70% 加入校验回溯后提高 3 个百分点
Schema 检索延迟 约 100 ms 约 400~500 ms Rerank 增加约 300~400 ms 延迟,用于换取字段覆盖率和排序精度

多库结果来自私域扩展评测;公开仓库默认只注册一个只读 SQLite 执行器,不把该指标表述为 GitHub Pages 样例站的运行结果。

4. 公开仓库验证

当前 CI 包含 13 项自动化测试:

  • 4 项 Python 测试,覆盖 SQL 治理、表白名单、审计、结果校验和完整 Pipeline;
  • 4 项 Java 测试,覆盖意图兜底、API Key 鉴权、DataAgent 契约和数据查询失败隔离;
  • 5 项前端测试,覆盖复杂查询、写操作拦截、模型协议、结果解释和 SQL 修复。

GitHub Pages 另外提供 3 个浏览器内 SQLite 场景,用于检查关键词、Schema、计划、SQL、结果和解释的完整链路。它是工程演示,不是 600 条私域评测集的替代品。

5. 使用边界

  • 对外引用指标时,应同时说明数据规模、计算方式和私域评测条件。
  • 字段准确率 43% 不能脱离候选数量策略单独比较;该策略优先保证目标字段不漏召回。
  • Rerank 的收益伴随额外延迟,高并发场景需要结合缓存、批处理和成本预算决定是否启用。
  • 接入真实企业数据时,仍需增加数据库只读账号、行列权限、脱敏、资源配额和独立安全审计。