Saturn测试:AI答错57%理财问题,Bittensor(TAO)受关注

Saturn测试18个AI模型发现个人理财问题57%失败率,难题升至88%,而消费者对AI建议的信任仍在上升。

k7rq2fdm

1万条回答,57%出错

问过聊天机器人“该把钱放哪”的人,看到这组数据恐怕不会舒服:英国金融科技公司Saturn的一项测试显示,主流AI模型对个人理财问题的回答中,57%存在错误或不完整,而在更难的多步骤问题上——也就是普通家庭真实会遇到的情形——错误率升至88%。这项测试将121道问题投喂给来自ChatGPT、 Alphabet 旗下Gemini、Claude和Copilot等厂商的18个免费与付费模型,每个问题最多重复提问五次以检验一致性,共收集超过10,000条回答。只要回答中出现事实错误、遗漏关键信息,或缺少必要的风险提示,即计为失败。免费版表现最差,失败率达63%,付费版为49%;在最难的问题上,免费模型的错误率高达93%。Claude Opus 5以推理模式居首,但仍有39%的回答出错,错误类型包括算术失误、忽略税收政策变化,甚至引用根本不存在的规则。其中一条关于养老金税务的回答,可能让储户面临英国税务海关总署17,500英镑的补缴。Saturn首席执行官Amal Jolly表示:“数以百万计的人正在信任AI模型给出的理财建议,但他们拿到的错误答案可能让他们亏钱。”时机让问题更尖锐:消费者对聊天机器人理财决策的依赖显著上升,57%的错误率因此不再是实验室里的猎奇数据,而成了现实的消费者保护问题——并且直接波及加密货币领域,那里的自助型投资者长期依赖AI工具,背后没有任何受监管的咨询层兜底。

信任度却在攀升

这组数据中最刺眼的矛盾在于:工具的准确性在下滑,人们对它们的信任却在上升。安永一项覆盖全球18,000名消费者的调查显示,49%的人已用AI辅助储蓄和投资决策。英国金融监管机构8月发布报告称,五分之四的投资者新手曾借助AI进行投资,56%的受访者表示信任这类工具——高于对电视和电台的47%。同一研究还揭示了一个更令人担忧的误解:44%的受访者误以为AI生成的金融信息是受监管的。PensionBee对1,000名美国成年人的独立调查显示,近六成人会不假核实就直接采纳AI的理财建议,近四分之一的人表示聊天机器人已经给过他们错误的财务信息。接触风险也不再局限于电脑浏览器:从 Apple 的Siri到安卓端的Gemini,AI助手已经嵌入操作系统层面,覆盖所有年龄段。Jolly的结构性判断依然成立:AI理财建议处于监管范围之外,用户无法享受人类顾问所附带的赔偿权利,他已敦促英国金融监管机构尽快采取行动。 希望实时跟踪行情的读者,可在Binance查看现货与合约的实时价格。

Bittensor(TAO)与信任缺口

COINOTAG的判断是,Saturn的测试结果对加密货币中打着“机器智能”旗号的那一板块冲击最大。 Bittensor(TAO) ——这个为机器学习模型贡献者支付报酬的去中心化网络——正运行在同一条被此次测试削弱的信任曲线上:当散户发现聊天机器人答错57%的理财问题时,他们可能连带下调对AI代币叙事的估值,就像下调对闭源助手的信任一样。更深层的问题是验证:区块链预言机之所以存在,正是因为不可靠的输入会摧毁自动化资金系统,而理财聊天机器人却没有任何对等的校验机制。在模型可靠性提升、咨询缺口被监管填补之前,去中心化AI首先是一个信任故事,其次才是算力故事。

COINOTAG News Desk

COINOTAG News Desk

COINOTAG 的编辑与研究团队。

News Desk 运作方式
AI 辅助

本文由人工智能辅助生成、经 AI 审核,并在 COINOTAG 编辑监督 下发布。