来客网

研究:AI模型回答財務問題出錯率高 表現最優的是這款

声明:本文转载自 「世界日报」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

研究:AI模型回答財務問題出錯率高 表現最優的是這款

編譯湯淑君/綜合外電 2026-09-19 10:59 ET 聽新聞 test 0:00 /0:00 Your browser does not support HTML5 Audio! 😢 研究發現,AI模型回答財務問題的出錯率高,但Claude Opus 5「推論」模式表現最佳。(路透)

許多人有財務問題時,愛求助於人工智慧(AI)機器人。但研究發現,市面上的AI模型回財務相關問題時,出錯率極高。

金融時報報導,科技公司Saturn的研究發現,當前最熱門的AI模型,包括ChatGPT、Claude、Copilot、Grok和Gemini,對財務相關提問提供的答覆出錯率有57%。若是詢問較複雜的問題,比方說需要不只一次計算者,AI模型平均出錯率達88%。有些模型遇上難題時,出錯率甚至高達99%。

這項研究用超過100個錢財相關問題,來考驗免費版及付費版AI模型,受測的模型包括:ChatGPT、Claude、Copilot和Gemini。問題最多重複五遍,對18種不同的AI模型總共問了超過1萬個問題。

結果發現,AI模型的答覆充斥著錯誤,包括計算錯了、未考量將實施的稅法規定改變,或AI自己幻想出規則。

最糟的是倚賴AI回答稅務問題恐致嚴重的財務損失。Saturn執行長喬利說:「數百萬人現在靠AI模型提供財務建議,但得到的卻是錯誤答案,可能造成金錢損失。」

例如,去年推出的免費版AI模型Claude Haiku 4.5,因為弄錯退休金稅法規定,害英國一名退休金儲戶面臨得補繳17,500英鎊稅金給國稅局。另一例是,被問到學生貸款問題時,Claude竟然「自創規則」,告訴某畢業生說,移居海外可停繳學貸。

研究發現,付費版AI模型給的答案比免費版正確,較新版模型的表現也比舊版好。

根據Saturn的研究,整體來說,表現最佳的模型是Claude Opus 5「推論」模式,但回答問題的出錯率仍有39%。

投資平台AJ Bell個人理財主管柯爾絲表示,AI給的財務相關建議不可輕信,但聊天機器人在預算規劃和資料研究方面的確很有用,例如根據某人的收入和支出,點出哪些地方可能花太多錢。

精華 FAQ

  • Q1:這項研究發現AI回答財務問題的整體表現如何?

    Saturn測試超過1萬題後發現,主流AI模型回答財務相關問題的平均出錯率達57%,顯示現階段不宜把它們當成可靠的財務顧問。

  • Q2:哪些情況下AI模型的財務答覆最容易出錯?

    當問題較複雜、需要不只一次計算,或牽涉稅法與規則變動時,AI更容易答錯,平均錯誤率達88%,部分模型甚至高達99%。

  • Q3:哪一款AI模型表現最好,研究又給出什麼提醒?

    研究指出Claude Opus 5的推論模式整體表現最佳,但仍有39%出錯率。專家提醒,AI可用於預算整理與資料研究,卻不該直接取代專業財務建議。

AI ChatGPT Gemini

上一則

駁AI世界末日論 黃仁勳:應儘可能全速發展

延伸閱讀

Anthropic:曾阻止科學家用AI模型製造生物武器

安全研究人員用Anthropic的Claude駭入OpenAI內部程式碼

微軟AI負責人:缺乏防護恐出現「矽基物種」與人類競爭

AI濫用疑慮升溫 Anthropic執行長籲模型發展減速

熱門新聞

美股恐重演2018年拋售潮?Fed若升息 分析師估第一波就大跌10%

2026-09-14 19:56

華許升息 為何川普沒發飆反而力挺?「Fed傳聲筒」內幕全說了

2026-09-18 08:10

特斯拉Model Y全球最低價在日本 比勞力士手表還便宜

2026-09-18 08:39

當法荷黃金撤離北美 為何委內瑞拉擬將31公噸黃金從倫敦轉移到紐約?

2026-09-18 07:30

亞洲首富換人做 張一鳴身家飆破1055億美元登頂 靠AI比7年前爆富8倍

2026-09-16 03:40

與川普對峙?估聯準會3年多來首度升息

2026-09-15 21:50

洛杉磯住40年 他回嘉義養老:更愛台灣的「小」

主管1句話…紐約男剛找到工作 上班2.5小時就被解雇

黛妃死後 女王欲恢復她「殿下」頭銜 親弟拒絕:有什麼意義?

百餘年來首次 人類發現新貓咪物種:這麼小一隻…

習近平傳身體不適缺席金磚晚宴 前CIA情報員:習抽菸喝酒又不愛運動

评论 (0)