苹果研究人员质疑 AI 的推理能力:简单数学问题稍作改动就会答错
创始人
2024-10-12 12:55:43
0

10 月 12 日消息,近年来,人工智能(AI)在各个领域取得了显著的进展,其中大型语言模型(LLM)能够生成人类水平的文本,甚至在某些任务上超越人类的表现。然而,研究人员对 LLM 的推理能力提出了质疑,他们发现这些模型在解决简单的数学问题时,只要稍加改动,就会犯错误,这表明它们可能并不具备真正的逻辑推理能力。

图源 Pexels

周四,苹果公司的一组研究人员发布了一篇名为《理解大型语言模型中数学推理的局限性》的论文,揭示 LLM 在解决数学问题时容易受到干扰。IT之家注意到,研究人员通过对数学问题的微小改动,例如添加无关的信息,来测试 LLM 的推理能力。结果发现,这些模型在面对这样的变化时,其表现急剧下降。

例如,当研究人员给出一个简单的数学问题:“奥利弗星期五摘了 44 个奇异果,星期六摘了 58 个奇异果。星期日,他摘的奇异果是星期五的两倍。奥利弗一共摘了多少个奇异果?”时,LLM 能够正确地计算出答案。然而,当研究人员添加一个无关的细节,“星期日,他摘的奇异果是星期五的两倍,其中 5 个比平均小。”时,LLM 的回答却出现了错误。例如,GPT-o1-mini 的回答是:“... 星期日,其中 5 个奇异果比平均小。我们需要从星期日的总数中减去它们:88(星期日的奇异果) - 5(较小的奇异果) = 83 个奇异果。”

上面只是一个简单的例子,研究人员修改了数百个问题,几乎所有问题都导致模型的回答成功率大幅下降。

研究人员认为,这种现象表明 LLM 并没有真正理解数学问题,而是仅仅根据训练数据中的模式进行预测。但一旦需要真正的“推理”,例如是否计算小的奇异果,它们就会产生奇怪的、不合常理的结果。

这一发现对 AI 的发展具有重要的启示。虽然 LLM 在许多领域表现出色,但其推理能力仍然存在局限性。未来,研究人员需要进一步探索如何提高 LLM 的推理能力,使其能够更好地理解和解决复杂的问题。

【来源:IT之家】

相关内容

Flova 接入 Seed...
最近AI视频行业,有三件事值得展开说说。 第一件:安徽卫视7月22...
2026-08-11 19:50:34
中文在线携手火山引擎探索A...
观点网讯:8月10日,中文在线宣布与火山引擎达成深度业务合作。双方...
2026-08-11 19:44:25
AI安全测试正在成为新的安...
在过去几个月里,正在接受网络安全评估的AI智能体相继突破限制、访问...
2026-08-11 19:40:06
近200家硅谷初创企业反对...
钛媒体App 8月10日,美国一些高级官员公开表示拟对中国人工智能...
2026-08-11 19:35:40
智能体AI或将推动企业级A...
来自微软Azure与德克萨斯大学奥斯汀分校的研究人员指出,随着企业...
2026-08-09 16:58:37
蚂蚁百灵Ling-3.0-...
智通财经获悉,蚂蚁百灵新一代原生混合推理模型Ling-3.0-fl...
2026-08-09 03:40:12

热门资讯

全新开源项目公布,让PC Ga... IT之家 8 月 11 日消息,据外媒 TechPowerup 报道,一批曾参与开发 Heroic ...
Flova 接入 Seedan... 最近AI视频行业,有三件事值得展开说说。 第一件:安徽卫视7月22日起在晚间时段首播全AI流程制作的...
AI短剧女主“方桃子”代言美瞳... 近期AI短剧《被裁掉的女孩》女主角“方桃子”,因在短视频平台账号主页发布的作品中植入某美瞳产品广告,...
中文在线携手火山引擎探索AI与... 观点网讯:8月10日,中文在线宣布与火山引擎达成深度业务合作。双方将围绕视频生成模型Seedance...
AI安全测试正在成为新的安全隐... 在过去几个月里,正在接受网络安全评估的AI智能体相继突破限制、访问互联网,甚至在某些情况下入侵了真实...
汤臣倍健(300146)新增【... 证券之星消息,根据市场公开信息整理,8月10日汤臣倍健(300146)新增【AI智能体】概念。 新增...
近200家硅谷初创企业反对限制... 钛媒体App 8月10日,美国一些高级官员公开表示拟对中国人工智能企业开展调查并实施制裁,引起美国业...
国家机构预警Sorry勒索病毒... IT时代网8月10日消息,国家计算机病毒应急处理中心10日通报,依托国家计算机病毒协同分析平台,该中...
每周股票复盘:乐鑫科技(688... 截至2026年8月7日收盘,乐鑫科技(688018)报收于112.06元,较上周的102.7元上涨9...