研究显示主流AI聊天机器人财务问答错误率高达57%
摘要
Saturn研究测试18种AI模型逾万次财务问答,发现ChatGPT、Claude、Copilot、Grok和Gemini等平均57%答案有误,付费及较新模型表现更优,最佳模型Claude Opus 5错误率仍达39%。
一项由Saturn开展的研究对当前主流AI聊天机器人的财务问答能力提出了警示。研究覆盖ChatGPT、Claude、Copilot、Grok和Gemini等模型,发现它们在回答财务相关问题时,平均有57%的答案存在错误。这一结果基于对逾百个财务问题的测试,每个问题最多重复提问五次,最终向18种AI模型提出了超过10,000个问题。
研究揭示的错误类型多样,包括计算错误、遗漏即将实施的税收政策变更,以及凭空捏造规则(即幻觉)。在最严重的情况下,依赖AI回答税务问题可能给用户带来严重的经济损失。这表明,尽管AI在通用对话中表现流畅,但在需要精确性和时效性的财务领域,其可靠性仍远未达标。
研究还对比了不同模型的表现差异。付费模型的回答准确率高于免费模型,较新的模型整体优于较旧的模型。在众多模型中,表现最好的是推理模式的Claude Opus 5,但其错误率仍高达39%,意味着即便最先进的系统,在财务问答上也有近四成的答案不可靠。
该研究提醒行业从业者,在将AI应用于财务、税务等高风险场景时,需保持审慎,并建立人工复核机制。当前AI模型在专业领域的知识更新与逻辑推理能力仍有明显短板,用户不应完全依赖其给出的财务建议。
本文由新大陆基于公开信息编辑整理
信息来源:Solidot Solidot原文 ↗