AI挑战《超级马力欧兄弟》,Claude系列领先,推理模型为何落败?

加利福尼亚大学圣地亚哥分校的Hao人工智能实验室最近进行了一项别开生面的研究,他们将AI技术引入了经典游戏《超级马力欧兄弟》中,以此作为测试AI性能的独特平台。研究结果显示,在这次测试中,Anthropic公司的Claude 3.7版本AI展现出了卓越的能力,紧随其后的是Claude 3.5版本。相比之下,谷歌的Gemini 1.5 Pro和OpenAI的GPT-4o则未能达到预期表现。

值得注意的是,这次实验所用的并非1985年原版《超级马力欧兄弟》,而是在一个模拟器中运行的游戏版本。Hao人工智能实验室研发的GamingAgent框架作为桥梁,连接了AI与游戏,使AI能够操控马力欧。GamingAgent不仅向AI发出如“避开附近障碍物或敌人”等基本指令,还提供了游戏内实时截图。AI则通过生成Python代码来指挥马力欧的行动。

据实验室介绍,这种游戏环境对AI模型提出了高要求,迫使它们学习如何规划复杂的操作并制定有效的游戏策略。一个有趣的发现是,像OpenAI的o1这样的推理模型,虽然在多数基准测试中表现出色,但在此次实验中却不如“非推理”模型。研究人员指出,推理模型在实时游戏中往往因决策时间过长而表现不佳。在《超级马力欧兄弟》这样的游戏中,时机至关重要,一秒钟的延误可能导致完全不同的结果。

游戏作为衡量AI性能的工具已有数十年历史,但一些专家对此提出了质疑。他们认为,与现实世界相比,游戏环境相对抽象且简单,为AI训练提供了理论上无限的数据。这种局限性可能使得游戏基准测试结果无法全面反映AI技术的真实水平。

一些引人注目的游戏基准测试结果引发了广泛的讨论,甚至引发了OpenAI研究科学家安德烈・卡帕西的“评估危机”言论。他在一篇帖子中表示,面对众多AI指标,他感到困惑,不知道应该关注哪些。他总结道,目前难以准确评估这些AI模型的真实能力。

尽管存在这些争议和挑战,但观看AI玩《超级马力欧兄弟》仍然是一种有趣的体验。这一研究不仅展示了AI技术的潜力,也引发了人们对AI性能评估和未来发展的深入思考。

也许你还喜欢

海棠文学城小说免费阅读入口

随着互联网的发展,人们越来越喜欢通过手机、电脑等设备来阅读小说,

漫蛙2官网入口:找到最新最全的漫蛙2

漫蛙2是一款备受玩家喜爱的手机游戏,吸引了大批玩家的加入。想要畅

铜锵锵锵锵锵锵到底意味着什么?探讨

铜锵锵锵锵锵锵,这个词听起来充满了节奏感和活力,仿佛在传递着一种

热门漫画免费在线阅读指南

在当今数字化时代,漫画作为一种热门的文化形式,受到了越来越多人的

在海棠文学城小说网如何享受无弹窗

海棠文学城小说网是一个专注于提供无弹窗免费网络小说阅读的平台。这

免费观看漫画登录界面:获取最新漫画

漫画作为一种深受大众喜爱的文化形式,早已渗透到了我们生活的方方面

如何通过3DMax漫画入口享受更多优

在如今的数字时代,漫画已经成为了许多人日常生活中不可或缺的一部分

黑皮老实人与双胞胎兄弟的相遇,如何

黑皮老实人的日常生活 黑皮老实人是一个典型的好人,待人真诚,

美国和欧洲Windows使用有什么区别

在今天的数字时代,操作系统无疑是我们生活中不可或缺的一部分。尤其

海棠网站官网登录入口

海棠网站官网登录入口文章内容……海棠网站:便捷高效的在线服务平台