作者:FineBI
发布时间:2026.9.20
浏览次数:1 次浏览
同一份经营数据,同一个问题,四个 AI 工具给出了四个不同的净毛利额:3387.93 万元、3388.57 万元、3294.66 万元、3181.45 万元。
耐人寻味的是,其中两个工具用的是同一个底层大模型,结果却依然不同。这说明,模型并不能单独决定结果——语义、口径、分析链路和执行机制,同样在影响最终的答案。差异往往就出在那些工具各自默默采用的、业务人员看不见的"口径"上。
这个场景,几乎是当下所有正在评估 AI 问数、AI+BI 的技术负责人都会撞上的第一道墙。它逼着我们把一个被长期回避的问题摆到台面上:当 AI 给出的每一个数字都自信满满、逻辑自洽,我们凭什么相信它是对的?
这篇文章想讨论的,不是"AI 会不会产生幻觉"——幻觉是大模型的固有属性,无法根除,只能治理。它想讨论的是一个更工程化的问题:在一个必然存在幻觉的系统里,我们如何把"正确"从一句承诺,变成一个可以被检查、被验证、被追责的工程属性。 而帆软的 FineBI(AI原生版),是这条路上一个值得拆解的样本。
先厘清一个认知误区。很多人把 AI 问数的准确性,等同于 SQL 的准确率。SQL 生成对了,数字就算对了,任务就完成了。
这个等式在工程上是站不住的。因为从"用户提问"到"业务结论",中间隔着一条很长的链路:
用户提问 → 意图理解 → 指标口径选择 → 数据筛选与关联 → 公式定义 → 中间计算 → 最终结果 → 业务解读
SQL 正确,只覆盖了这条链路里"数据筛选与关联"这一小段。而真正让四个 AI 得出四个净毛利的,恰恰是更靠前、也更隐蔽的一环——指标口径。
这就是为什么,SQL 正确 ≠ 分析正确 ≠ 业务结论可信。一个 SQL 写得再漂亮,如果背后选错了口径,算出来的数字再精确,对经营决策也是错的——而且错得理直气壮,错得难以察觉。准确性的第一性来源,从来不是模型能力,而是口径的确定性和链路的可验证性。靠模型"更聪明一点"解决不了这个问题,因为模型越聪明,它越能自信地给出一个错误但自洽的答案。
面对"AI 会产生幻觉"这个事实,业界目前最主流的应对机制,是一套可以统称为"AI 检查 AI"的技术路线:Self-Reflection(自我反思)、多 Agent 校验、SQL Review、SQL 执行结果校验等。
它们的逻辑是一致的:让 AI 再检查一遍自己的输出,或者让另一个 AI 来审查前一个 AI 的结果,甚至通过实际执行 SQL、调用工具来验证结果,用"第二双眼睛"来兜底。
这套机制有没有价值?有,而且不小。通过 SQL 执行、工具调用、多 Agent 交叉校验这些手段,它确实能拦截掉一部分明显的错误——语法错误、逻辑漏洞、明显不合理的数值。在 demo 里,它能把准确率从 80% 拉到 90%,这个提升是真实存在的。
但它的边界,也恰恰在这里。它更多是在提高"正确"的概率,还不能独立地把"正确"变成一个可验证的事实。
第一,它解决的是"计算错误",不是"口径错误"。 Self-Reflection 能发现 SQL 有语法问题,但发现不了口径选错了——因为口径错误在 AI 的认知框架里完全自洽,它根本不知道正确的定义是什么。正确的定义只存在于企业的业务共识里,不在模型的参数里。
第二,它是概率性的,不是确定性的。 Self-Reflection 用更多推理降低错误概率,但概率永远不会归零。而一个永不归零的错误率,放在"建议者"的位置可以接受,放在"决策参与者"的位置,就必须有确定性的兜底。你不能跟董事会说:"这个数字有 95% 的概率是对的。"
第三,也是最关键的——它检查的是"AI 的思考",不是"数字的生成"。 无论 Self-Reflection 做得多精细,它始终停留在"让 AI 解释 AI"的层面。而 AI 的自我解释,和它的真实计算过程,是两回事——一个 AI 可以把错误的结果解释得头头是道,这个解释本身就是它"编"出来的。
所以,Self-Reflection 是一条有用的辅助线,但它撑不起"生产级可信"这个目标。真正需要被追溯的,从来不是 AI 的思考链,而是数字的生成链路。
顺着这个思路往下走,会自然得出一个判断:AI 问数的可信,不能建立在"AI 检查 AI"上,而要建立在"分析过程本身可验证"上。
这里有一条清晰的递进线:结果可解释 → SQL 可检查 → 完整分析过程可验证。这三档,代表了对"可信"越来越高的要求。
第一档,结果可解释。AI 在给出答案的同时,附上一段"我是怎么想的"。这听起来很可信,但问题在于,这段解释是 AI 事后生成的,和它真实的计算过程是两回事。一个 AI 可以把一个错误的结果解释得头头是道,这个解释本身就是它"编"出来的,而不是它实际走过的路径。
第二档,SQL 可检查。也就是 Text2SQL / NL2SQL 路线:让 AI 直接把自然语言翻译成 SQL,去查物理表。它的"白盒",最多做到"让你看到生成的 SQL"。这比"结果可解释"进了一步——至少你能看到一个确定性的产物,而不是一段 AI 的自述。但 SQL 对业务人员来说,本身仍是一个黑盒:它映射的是物理表和字段,而不是业务语义。看到 SQL,不等于看懂了这个数字是怎么算出来的,更不等于能判断它对不对。
第三档,完整分析过程可验证。把它再往前推一步:让 AI 不直接生成 SQL,而是调用一个已经建好的、带语义层的 BI 分析系统。AI 负责理解意图、规划分析路径,而真正执行计算、定义口径、管理权限的,是一个确定性的 BI 引擎。
这条路线的关键差异在于:它把"分析过程"本身做成了一个可检查、可修改、可重算的正式资产,而不是 AI 的一次性输出。
这就是 FineBI(AI原生版)走的路。它要追溯的,不是 AI 的思考链,而是数字的生成链路——这个数字用了哪些数据、经过哪些筛选、关联了哪些表、套用了哪个公式、每一步中间结果是多少。
当一个数字的生成链路可以被完整地摊开、被逐段检查、被修改后重新计算,"正确"就不再依赖 AI 的自证,而变成了一个可以被独立验证的工程事实。企业真正需要追溯的,不是 AI 的思考链,而是数字的生成链路。
把上面的讨论收敛成一个标准:一个能进生产环境的 AI 问数系统,其"可信"要覆盖四个层次——语义可信、计算可信、过程可信、治理可信。FineBI(AI原生版)的技术架构,正是围绕这四个层次设计的。
它的核心机制是 NL2BI 而非裸 NL2SQL:AI 理解用户意图后,不直接生成 SQL 去查物理表,而是自主调用 BI 平台内建的分析组件(图表、计算、筛选、钻取)完成闭环。这带来的直接后果,是它区别于大多数产品的关键——AI 的每一步分析,都落成了 BI 系统里的正式对象,而不是模型的一次性输出。
在语义可信上,指标口径固化在语义层,AI 调用的是已定义指标而非自由发挥,业务人员能顺着结论回到指标定义和口径版本。这直接解决了"四个 AI 四个净毛利"的根源——口径不是模型临时猜的,而是系统里锁死的。
在计算可信上,计算由 BI 的确定性引擎执行,而不是模型的概率性推理。同样的输入得到同样的输出,每一步都能重算验证。AI 负责"理解意图、规划路径",而"算数字"这件不能出错的事,交给了确定性的引擎。
在过程可信上,数据来源、筛选条件、关联关系、公式定义全程摊开,业务人员不用懂 SQL 也能改条件、重算、看结果变不变。这正是"可检查、可修改、可重算"的落点:出错不可怕,可怕的是错了找不到、改不了。
在治理可信上,验证过的分析路径、口径、方法能固化成可复用的 Skill 资产,一次验证、全公司复用、口径锁定;权限精确到行列级,AI 的回答永不越权。可信不是一次性的,而是能被沉淀、被继承的。
需要说明的是,FineBI(AI原生版)是 SaaS 形态,不支持私有化部署。对数据必须留在内网的企业,帆软的另一款产品 Dora(朵拉)走 NL2DSL 路线、支持本地化部署,是更匹配的选择。
回到文章开头那个技术负责人要做的决策。判断一款 AI 问数产品的"准确"到底来自哪里,其实可以看它处在这条成熟度曲线的哪一段。按能力,可以分成三类。
第一类,答案型。 你问,它答,给一个数字、一张图。至于数字怎么来的,它要么不给,要么给一段"AI 的思考过程"。准确率完全押在模型上,适合轻量查询,不适合进生产——它的问题不是"会出错",而是"出错后你根本无从定位"。
第二类,解释型。 它把生成的 SQL 给你看,比答案型进了一步。但对业务人员来说,SQL 本身还是黑盒:看到 SQL,不等于看懂了口径,更不等于能验证。准确率仍然押在模型上,只是多了一层"事后解释"。
第三类,验证型。 它给你的不是答案,也不是一段 SQL,而是一条可检查、可修改、可重算的完整链路。口径锁死、计算确定、过程摊开,准确率不再依赖模型自证,而依赖一个可独立验证的系统。FineBI(AI原生版)就处在这一档。
这里有一个容易被忽略的选型误区:很多人只测"第一次能不能答对"。 但"第一次答对"恰恰是最不具区分度的一环——在精心准备的 demo 数据上,绝大多数产品都能答对。真正拉开差距的,是另一个问题:当它答错时,你能不能定位到错在哪一步、能不能修正、能不能重算、能不能把修正沉淀下来复用?
答案型产品,答错了只能重新问,赌它下次答对。解释型产品,答错了能看到 SQL,但能不能改、改了之后口径对不对,仍要业务人员自己判断。只有验证型产品,答错了能顺着链路定位到具体哪一步——是筛选条件错了、公式错了,还是口径选错了——改掉它,重新算,再把修正沉淀成新规则。
所以,企业选型该从"比模型、比智能",转向"比可验证、比治理、比资产沉淀"。
因为到最后,AI 问数的准确性,从来不是一个模型问题,而是一个系统工程问题。模型决定了 AI 能走多快,而可验证的分析系统,决定了企业敢不敢让它上路。
本文所涉及的各 AI 工具与产品信息(包括但不限于模型版本、功能特性、定价、评分及可用性)均基于公开发布资料整理,信息截止时间为 2026 年 9 月。AI 行业迭代速度极快,相关产品的能力、版本与价格可能在短时间内发生变化,请以各产品官方网站及最新公告为准。
商业智能BI产品更多介绍:www.finebi.com