快讯 23:56俄勒冈州数据中心耗电占比达23%,2030年或升至三成23:26智谱 MaaS 平台推出数据不留存机制,用户可申请开通23:10法拉第未来发布九款EAI机器人配置,最高售价超92万元 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期一 · 09-21 21:39 约 1 分钟读完

研究显示主流AI聊天机器人财务问答错误率高达57%

摘要

Saturn研究测试18种AI模型逾万次财务问答,发现ChatGPT、Claude、Copilot、Grok和Gemini等平均57%答案有误,付费及较新模型表现更优,最佳模型Claude Opus 5错误率仍达39%。

一项由Saturn开展的研究对当前主流AI聊天机器人的财务问答能力提出了警示。研究覆盖ChatGPT、Claude、Copilot、Grok和Gemini等模型,发现它们在回答财务相关问题时,平均有57%的答案存在错误。这一结果基于对逾百个财务问题的测试,每个问题最多重复提问五次,最终向18种AI模型提出了超过10,000个问题。

研究揭示的错误类型多样,包括计算错误、遗漏即将实施的税收政策变更,以及凭空捏造规则(即幻觉)。在最严重的情况下,依赖AI回答税务问题可能给用户带来严重的经济损失。这表明,尽管AI在通用对话中表现流畅,但在需要精确性和时效性的财务领域,其可靠性仍远未达标。

研究还对比了不同模型的表现差异。付费模型的回答准确率高于免费模型,较新的模型整体优于较旧的模型。在众多模型中,表现最好的是推理模式的Claude Opus 5,但其错误率仍高达39%,意味着即便最先进的系统,在财务问答上也有近四成的答案不可靠。

该研究提醒行业从业者,在将AI应用于财务、税务等高风险场景时,需保持审慎,并建立人工复核机制。当前AI模型在专业领域的知识更新与逻辑推理能力仍有明显短板,用户不应完全依赖其给出的财务建议。

AI聊天机器人财务问答模型评估
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
45
企业落地案例
5
完整版提示词