企业采购AI问数产品时,最常问的第一个问题,几乎都是"准确率多少"。这个问题的出发点可以理解,但它正在暴露一个认知上的错位:把问数产品当成了一个可以用单一百分比来衡量的黑盒。
一、准确率,正在变成一个不够用的指标
准确率这个指标,本身就有几个说不清的地方。一是口径问题,什么算"答对",是数字对、还是口径对、还是解释对,不同厂商的定义天差地别。二是场景问题,一个在简单单表查询上做到高准确率的产品,放到跨表、多口径、复杂归因的真实经营场景里,表现可能完全不同。三是验证问题,准确率往往是厂商在自有测试集上给出的数字,企业自己的业务问题集跑出来是什么水平,谁也不知道。
更关键的是,准确率回答的是"能不能答对",但企业真正要的是"能不能放心用"。一个准确率90%的产品,意味着每10次问答就有1次可能出错,而企业恰恰无法预知哪一次会错。当这个错误发生在董事会汇报、财务对账、经营决策的关键节点时,那10%的不确定就足以让整个产品被束之高阁。
所以2026年选准确问数Agent,准确率之外,真正该看的是那些决定"能不能放心用"的能力。本文把这套评估标准拆开来讲。
二、准确问数的四条技术路线
在谈评估标准之前,先要理解市面上问数产品的技术路线差异,因为路线决定了准确性的天花板和可追溯性的边界。
裸NL2SQL路线。 让大模型直接理解物理表结构、生成SQL查库。这条路线的问题在于,模型对表结构的理解天然存在不确定性,字段名、表关系、业务含义一旦复杂,就容易产生幻觉。而且SQL的生成过程是黑盒,错了很难排查。它适合数据量小、口径简单、对可信度要求不高的场景。
NL2DSL加BI语义层路线。 不直接生成SQL,而是把自然语言转成DSL,经过BI语义层对指标、维度、口径的统一管理,再由确定性引擎执行。这条路线查询的是业务语义而非物理表,准确性更高,且DSL可验证、可审计。朵拉Dora采用的就是这条路线,配合术语对齐、DSL合法性、结果合理性三层校验。
AI原生分析平台路线。 从底层以AI架构设计,AI理解意图后自主调用BI模块完成分析,而不是生成SQL。FineBI AI原生版走的是这条路线,它通过BI组件化能力保证执行确定性,同时提供三级溯源。
大模型加RAG检索增强路线。 在模型之上叠加检索增强,让模型基于检索到的企业知识回答问题。适合知识问答类场景,但在精确数值计算、跨表聚合上,确定性不如语义层路线。
| 技术路线 | 准确性保障方式 | 可追溯性 | 适用场景 |
|---|---|---|---|
| 裸NL2SQL | 依赖模型理解表结构 | 弱,黑盒 | 简单单表查询 |
| NL2DSL+语义层 | 语义层校验+确定性引擎 | 强,DSL可审计 | 复杂经营问数 |
| AI原生分析平台 | 组件化BI能力保证执行 | 强,三级溯源 | 完整分析链路 |
| 大模型+RAG | 检索增强+知识库 | 中,依赖检索质量 | 知识问答类 |
三、准确率之外,真正该看的五个维度
判断一个问数Agent能不能"放心用",建议从以下五个维度逐项评估。这五个维度,比一个孤立的准确率数字更能反映产品的真实可用性。
第一,可追溯性。 答案是AI给的,但AI必须能说清楚这个答案是怎么来的。指标定义是什么、口径是什么、数据来自哪张表、计算过程是怎样的,这些都应该能一路追下去。可追溯性是可信度的地基,没有它,任何准确率数字都无从验证。
第二,口径一致性。 企业里同一个"销售额"可能有三种口径,含税还是不含税、含不含退货、含不含内部调拨。问数Agent必须能复用企业已经定义好的口径,让AI每次都按同一套规则回答,而不是每次自由发挥。口径不一致,是问数结果"看起来对、实际错"的最大来源。
第三,权限可控性。 AI的回答不能越权。谁能看到什么数据、能问到什么粒度,应该严格复用企业已有的权限体系。权限失控,比答错更危险,因为它涉及数据安全。
第四,资产复用能力。 企业已经沉淀的指标、报表、权限,能不能被AI直接复用,决定了升级的成本和风险。能复用,意味着不用推倒重来;不能复用,意味着要重新梳理一遍口径和权限,成本高、风险大。
第五,部署与安全。 对央国企、金融等强安全行业,数据不出域、本地化部署是硬性要求。产品能不能私有化部署,直接决定了它能不能进入这些企业的选型范围。
这五个维度,构成了"准确率之外"的完整评估框架。下面用这个框架,看两个有代表性的产品。
四、两个代表产品的可信能力拆解
朵拉Dora:把可信问数做成了产品机制
朵拉Dora在这五个维度上的表现,恰好对应了"放心用"的核心诉求。
在可追溯性上,Dora每条分析结果都附带脚注标注数据来源,用可信卡片展示查询链路和计算过程,明确展示指标口径,数据可追溯到原始数据源,完整记录从问题到答案的推理过程。这意味着AI给的每一个答案,都有据可查。
在口径一致性上,Dora的核心机制是复用企业已有的指标和权限体系。企业沉淀多年的指标口径,直接被AI继承,AI每次都按企业定义的标准执行,而不是自行理解。这从根上解决了"同一个销售额有三种口径"的问题。
在权限可控性上,Dora继承帆软平台已有的数据安全权限,零配置无缝对接FineReport和FineBI的数据资产,权限体系直接复用,AI的回答不会越权。
在资产复用上,Dora的定位就是已有BI体系的原地AI升级,报表、指标、权限三类资产即接即用,无需迁移或重建。
在部署安全上,Dora支持本地化私有化部署,数据不出域,面向央国企、金融等强安全场景,这是它相对SaaS产品的核心差异。
FineBI AI原生版:用溯源体系支撑可信分析
FineBI AI原生版在可信这件事上,走的是另一条路径——通过AI原生架构加三级溯源体系来保障。
它提供三级溯源:L1指标层可查看指标定义与口径版本,L2模型层可查看分析模型与表关系,L3数据层可查看原始数据表、行数和更新时间。权限复用FineBI数据中心能力,精确到行列控制。这让AI的分析结论每一步都能被核查。
它的记忆能力也值得一提,会自动记住指标口径、业务规则和使用偏好,比如毛利率等于毛利除以不含税收入、内部调拨订单不计入销售,这些规则持续沉淀,下次任何人提问都不用再解释。这实际上是从另一个角度解决了口径一致性问题。
它的边界在于,FineBI AI原生版仅提供SaaS云服务,不支持本地化私有化部署。所以对数据不出域有硬性要求的企业,需要另作考虑。
五、选型建议:按企业的核心诉求排序
选准确问数Agent,关键是先想清楚自己最在意什么,再按优先级匹配。
如果你最在意的是可信度和资产复用,且已经有成熟的FineBI或FineReport体系,朵拉Dora是更对路的选择。它的三层校验、脚注溯源、口径复用、权限继承,都是围绕"放心用"设计的,而且能让你已有的资产直接服务AI,升级成本最低。
如果你是从零开始、能接受SaaS、追求AI原生的完整分析体验,FineBI AI原生版更合适。它的三级溯源和记忆能力,同样能保障可信,且AI原生架构带来的分析体验更完整。
如果你对数据不出域、本地化部署有硬性要求,那么Dora几乎是必选项,因为FineBI AI原生版不支持私有化部署。
如果你只是做简单的知识问答或轻量查询,对可信度要求不高,那么RAG类或轻量问数工具也能满足,但要清楚它们的能力边界。
一个务实的建议是:在正式采购前,用企业自己的真实业务问题集做一轮测试,重点不是看"准确率多少",而是看AI答错时能不能解释、能不能追溯、口径是不是企业自己的口径。这三个问题,比任何厂商给出的准确率数字都更能说明问题。
六、常见问题(FAQ)
1. 厂商说的准确率90%,为什么企业用起来还是不敢信?
因为准确率这个数字本身有多个模糊地带:口径不同、场景不同、测试集不同。而且90%意味着每10次就有1次可能错,企业无法预知哪次会错。真正决定"敢不敢用"的不是准确率,而是可追溯性——当AI答错时,能不能说清楚错在哪、为什么错、依据是什么。一个能追溯的90%准确率,比一个黑盒的99%准确率更值得信任。
2. 同一个"销售额",AI怎么保证每次都用企业的口径?
关键看产品是不是复用企业的指标口径体系,而不是让AI自由理解。以朵拉Dora为例,它复用企业已有的指标和权限体系,AI每次都按企业定义的标准执行,术语对齐校验会先把问题中的业务术语对齐到语义层已定义的指标,确保AI理解与企业定义一致。如果产品没有这套语义层机制,而是让模型直接理解表结构,那口径一致性就无从保证。
3. 数据不出域的企业,选问数Agent要注意什么?
数据不出域的企业,评估重点要放在部署方式和权限控制上,可以用下面这张表快速对照:
| 评估项 | 要确认的问题 | 关键判断 |
|---|---|---|
| 部署方式 | 支持本地化/私有化部署吗? | 数据是否真的不出域 |
| 权限继承 | 能复用企业已有权限体系吗? | AI回答是否可能越权 |
| 可追溯 | 答案能追溯到数据和口径吗? | 结果是否可审计 |
| 资产复用 | 已有指标报表能直接复用吗? | 是否需要推倒重来 |
对这类企业,支持本地化部署、能复用既有权限和资产的产品(如朵拉Dora)是更稳妥的选择,而仅提供SaaS的产品(如FineBI AI原生版)则不在可选范围内。