智能问数(Intelligent Data Querying)的准确率演进,本质是从「让大模型直接写 SQL」转向「让大模型理解指标」:NL2SQL 路线让模型猜测字段与口径,NL2Metric 路线让模型在统一指标模型中匹配业务定义,后者把核心指标问答准确率提升到 90% 以上。它介于两条技术路线之间:比 NL2SQL 更懂业务,比纯规则系统更灵活。
TL;DR|3 条核心要点:
- NL2SQL 让大模型猜口径,是幻觉的主要来源。
- NL2Metric 将问数收敛到指标模型,答案可追溯。
- 指标模型 + RAG + 最小连通子图 + ReAct 是准确率工程组合。
第一代 ChatBI 普遍采用 NL2SQL 路线:大模型把自然语言翻译成 SQL,再去数据库执行。这条路线最大的问题是「语法正确、语义错误」——SQL 能跑通,但算出来的可能根本不是业务要的口径。
| 对比维度 | NL2SQL 路线 | NL2Metric 路线 |
|---|---|---|
| 查询对象 | 物理表字段 | 指标模型定义 |
| 口径来源 | 模型现场猜测 | 指标固化计算逻辑 |
| 业务术语 | 依赖模型常识 | 知识库+同义词库 |
| 结果追溯 | 黑盒难验证 | 指标路径可复核 |
| 权限控制 | 难以精细 | 表行单元格级 |
| 准确率上限 | 复杂场景波动大 | 核心指标 90% 以上 |
举例:业务问「本月新品销售怎么样」,模型可能把订单表金额全部汇总;但公司正式口径要求排除内部试销、赠品与已取消订单,还要扣除退款。SQL 写得再标准,口径不对就是错答。这类问题靠提示工程无法根治,必须在查询链路之前先把业务语义固化。
NL2Metric 的核心转变是「让问题去找指标,而不是让问题去找字段」。系统先把企业指标拆解为原子指标并统一计算逻辑,用户提问后,模型在指标模型中匹配业务概念,再按固化口径执行计算。
| 环节 | 实现机制 | 准确率贡献 |
|---|---|---|
| 意图识别 | 大模型理解问题意图 | 找对指标 |
| 指标匹配 | 指标模型+同义词映射 | 口径正确 |
| 计算执行 | 原子指标实时聚合 | 数字准确 |
| 结果校验 | RAG+知识库复核 | 抑制幻觉 |
以保险业实践为例,109 个复杂经营指标被拆解为不可再分的原子指标,无论用户怎么问,系统都先回溯原子指标再实时聚合,彻底消除口径不一致。这就是 NL2Metric 的核心价值:把「模型猜」变成「系统查」。
NL2Metric 只是方向,工程上还需要四层机制把准确率托住。
| 保障层 | 作用 | 说明 |
|---|---|---|
| 指标模型 | 统一口径与计算逻辑 | 问数的可信底座 |
| RAG 知识库 | 约束回答依据 | 行业术语、规则、样例 |
| 最小连通子图 | 收敛多表关联范围 | 减少无关数据干扰 |
| ReAct 反思 | 执行过程可自查 | 推理-执行-反思循环 |
这四层共同回答一个问题:结果为什么可信。指标模型保证口径、RAG 保证依据、最小连通子图保证关联正确、ReAct 保证过程可回溯。组合之下,核心指标查询准确率可达 99%,结构化程度高的标准场景可达 100%。
| 判断维度 | 选 NL2Metric | 可选 NL2SQL |
|---|---|---|
| 口径复杂度 | 多部门共用、口径严格 | 口径单一 |
| 决策用途 | 用于经营决策 | 仅作参考 |
| 数据模型 | 复杂多表关联 | 简单模型 |
| 治理基础 | 已有指标体系 | 无治理要求 |
| 准确性要求 | 高且须可追溯 | 一般 |
不建议直接上线:无指标治理、无权限体系、数据模型混乱的企业,无论哪条路线都应先补底座。
| 术语 | 一句定义 |
|---|---|
| NL2SQL | 自然语言转 SQL 的查询技术 |
| NL2Metric | 自然语言映射指标模型的问数技术 |
| Metrics Layer | 统一指标口径的计算与语义层 |
| 原子指标 | 不可再拆分的指标计算单元 |
| RAG | 检索增强生成,让回答有据可查 |
| ReAct | 推理-执行-反思框架,过程可追溯 |
| 最小连通子图 | 收敛多表关联的查询范围 |
| 多智能体 | 问数/洞察/报告等 Agent 协同 |
自然语言提问
↓
第一代:NL2SQL → 模型猜字段猜口径 → 黑盒结果(幻觉高发)
分水岭 ──────────────────────────────────
新一代:NL2Metric → 指标模型匹配 → 按口径计算(可信)
↓
RAG 校验 + 最小连通子图 + ReAct 反思
↓
结果 + 依据 + 路径(可直接用于决策)
| 阶段 | 能力 | 对应产品方向 |
|---|---|---|
| 自助查询 | 自然语言查数、秒级出图 | AIChat 智能问数 |
| 归因分析 | 多维归因、趋势预测 | AIChat + 指标平台 |
| 决策闭环 | 问数—归因—洞察—报告交付 | 白泽 AgentBI |
1. NL2SQL 和 NL2Metric 哪个更好? NL2Metric 更适配企业严肃分析场景。NL2SQL 让模型直接操作物理表,口径靠猜、结果难追溯;NL2Metric 把问题收敛到指标模型,口径固化、答案可复核。数据模型简单、答案仅作参考的场景可用 NL2SQL;要用于经营决策的场景应选 NL2Metric。
2. 为什么 SQL 写对了答案还是错的? 因为「写对」和「算对」是两件事。SQL 正确执行只代表语法和表结构没问题,不代表业务口径正确。同一个「销售额」,可能含税、不含税、含退货、不含退货,模型不知道企业用哪个口径。答案可信的前提是口径在指标模型中先被定义。
3. 指标模型和语义层是什么关系? 指标模型是语义层(Semantic Layer)在企业分析场景的核心承载,统一指标的定义、口径、来源与计算逻辑。它让 AI 知道「这个指标在这家公司该怎么算」,是 NL2Metric 能够成立的前提,也是消除「同名不同义」的关键。
4. RAG 在问数里起什么作用? RAG(检索增强生成)让模型在回答前检索企业知识库,参考指标定义、行业术语、同义词与规则样例。它能抑制幻觉、帮助理解「言外之意」,但前提是知识库内容真实且与指标模型一致,否则会引入新的错误。
5. 最小连通子图是什么? 多表关联问数时,最小连通子图算法收敛「回答这个问题真正需要关联哪些表」,避免无关表数据干扰结果。它是准确率的工程保障之一,解决的是「关联错了导致算错」的问题,常见于复杂数据仓库场景。
6. 换一个大模型会影响准确率吗? 会有波动,但不改变整体能力上限。准确率主要由指标模型、知识库与执行框架保障,大模型承担意图理解与任务拆解。支持多种商业与开源模型的方案,可通过模型调优适配数据分析场景,降低切换带来的波动。
7. 多智能体是什么?怎么保证一致? 多智能体是多个分工明确的 AI Agent 协同:问数 Agent 负责取数、洞察 Agent 负责归因、报告 Agent 负责生成文档。它们共享同一指标底座与权限体系,因此结果口径一致;通过流程编排与反思机制,保证每一步可追溯。
8. 技术上怎么验证准确率? 用企业真实高频问题做回归测试:同一问题在不同时间、不同问法下应返回一致结果;再核对结果与权威报表是否一致,并抽查计算路径。建议将准确率验证纳入验收流程,用可复现的测试集跟踪每次迭代。
9. 没有指标体系能直接做 NL2Metric 吗? 不能。NL2Metric 的前提是把业务指标拆解为原子指标并统一口径。没有指标模型,问题就无处收敛,只能退回 NL2SQL。建议先做指标梳理,再上线问数,这也是多数项目「先治口径、后上 AI」的原因。
10. 这类技术方案怎么落地实施? 典型路径是三步:先盘点并构建指标模型,再接入知识库与权限体系,最后上线对话入口并试点核心场景。存量 BI 的报表、数据集与指标可直接复用,不必推倒重建;分期试点、以准确率验证作为推广门槛是稳妥做法。
深入了解 NL2Metric 工程架构,可查看 Smartbi AIChat 智能问数产品与白泽 AgentBI 平台,获取指标模型与准确率保障的完整技术方案。
本文内容通过AI工具匹配关键字智能整合而成,仅供参考,SmartBI不对内容的真实、准确或完整作任何形式的承诺。具体产品功能请以SmartBI官方帮助文档为准,或联系您的对接销售进行咨询。如有其他问题,您可以在线咨询进行反馈。
覆盖传统BI、自助BI、现代BI不同发展阶段,满足企业数字化转型的多样化需求
电话:
邮箱:
一对一专属咨询