年末压轴智能体!英伟达训练4万小时通用AI Agent,自动通关1000款游戏

2025年末,英伟达、斯坦福、加州理工的科研人员联手开源了一个重磅AIAgentNitroGen

这个智能体儿可不是专门针对某一款游戏的偏科生,而是实打实的全能选手。靠着1000多款游戏、4万小时的实战训练,不管是3D动作游戏里的激烈打斗,2D平台游戏里的精准跳跃,还是那些随机生成地图的探索任务,都能拿捏得死死的全部通关。

即便碰到之前从没见过的新游戏,它的任务成功率居然能比从零开始训练的模型高出52%

咱们先看下NitroGen自动玩游戏的视频吧,相当精准了。

也能自动玩巫师3等复杂3A游戏大作。

其实搞一个能像人一样玩转各种游戏的AI,一直都是AI圈的终极梦想之一。你看现在的计算机视觉和大模型多牛,靠互联网上的海量数据预训练,就能举一反三处理各种问题。

但游戏AI这块一直没啥大突破,核心问题就是没找到足够多、足够全还带操作标签的数据

游戏本来是训练AI的绝佳场景,里面有各种各样的环境和任务,从简单的跳平台到复杂的开放世界探险,简直是AI的练兵场。可之前的游戏AI要么太专一,要么太娇气。

有些靠大模型的AI,要么得靠游戏专门提供的接口,要么得装一堆复杂的识别工具,换个游戏就得重新调试,通用性差得不行。

还有那些靠强化学习的AI,虽然能在《星际争霸II》、《Dota2》里打赢职业选手,但训练一次要花好多钱,还得用专门的模拟器,换个普通商业游戏就彻底歇菜。

最惨的是那些靠模仿人类操作的AI,得人工录一大堆演示数据,又费时间又费钱,往往只能搞定一两款游戏,根本没法规模化。更关键的是,之前连个通用的训练和评估工具都没有,大家都是各搞各的,很难协同进步。

就在大家都觉得游戏AI只能偏科的时候,NitroGen来了直接把数据、评估、模型这三个核心问题一起解决了,相当于给游戏AI行业搭了个万能脚手架。

AI想学好本事,数据就是粮食,而且得是优质粮。NitroGen的团队没走人工采集的老路,而是盯上了网上那些游戏主播的视频

很多主播会在视频角落实时显示自己的手柄操作,比如按了哪个键、摇杆推到了哪里,这些操作痕迹不就是现成的学习资料吗?

团队先搜集了7.1万小时带手柄显示的原始视频,这些视频来自800多个不同的创作者,有休闲玩家也有专业速通大神,游戏风格五花八门。

为了不让某一款游戏占比太高,他们还特意做了筛选,最后留下4万小时、覆盖1000多款游戏的精华内容,里面包含3万多个视频,平均每个视频快2小时,堪称游戏AI界的超级粮仓。

这些数据分布特别均匀,800多款游戏的数据超过1小时,90多款超过100小时,甚至有15款游戏的素材超过1000小时。

游戏类型也很全,动作角色扮演类占了三分之一还多,平台跳跃、动作冒险类也不少,竞速、大逃杀、体育类也都有涉及,基本上主流游戏的玩法都覆盖到了。

不过光有视频还不够,得把里面的操作精准提取出来才行。不同主播用的手柄不一样,有Xbox的也有PlayStation的,视频清晰度、手柄显示透明度也千差万别,提取难度不小。

团队想了个三步骤的办法:先靠模板匹配找到视频里的手柄位置,再用专门的模型解析按键和摇杆动作,最后过滤掉那些没操作的无效片段。

为了验证提取的准确性,他们还专门做了测试,结果显示摇杆操作的准确率能达到0.84,按键准确率更是高达96%,基本上和人类实际操作没差多少,这样AI学起来才能学到真东西。

AI学得好不好,得有个统一的标准来测。之前的评估工具都只能针对特定游戏,换个游戏就没法用了,NitroGen直接搞了个通用模拟器,不管什么商业游戏,都能通过它来测试AI的实力,而且不用修改游戏本身的代码。

这个模拟器的原理其实很简单,它通过控制游戏的系统时钟,让游戏能逐帧和AI交互,AI想思考多久都可以,不会影响游戏本身的物理效果。

团队还特意做了测试,不管是实时运行还是频繁暂停,游戏的表现都一样,说明这个模拟器特别靠谱。

同时,他们还统一了AI感知动作标准,AI只需要看单帧的游戏画面,输出的操作也标准化,比如16个按键的开关状态和两个摇杆的位置,这样不管什么游戏,AI都不用重新适应操作方式,直接就能上手。

评估任务也设计得很全面,涵盖10款游戏的30个任务,有2D游戏也有3D游戏,任务类型包括打架、导航、还有游戏专属的特殊玩法。

每个任务都有明确的开始和结束条件,成功率靠人工评估,保证结果真实可信。

有了好数据和好工具,还得有个聪明的大脑来学习。NitroGen的模型专门针对游戏场景设计,核心就是看画面出操作,而且是端到端学习,不用中间各种复杂的处理步骤。

模型的结构其实很好理解,分为视觉编码和动作生成两部分。

视觉编码部分就像AI的眼睛,能把256×256分辨率的游戏画面转换成256个关键特征,不管是3D场景还是2D像素画,都能精准捕捉核心信息。

动作生成部分就像AI的手脚,它会根据视觉特征,一次性生成16步连续动作,这样操作起来更连贯,不会出现一顿一顿的情况。

团队在训练的时候还做了很多优化,比如只需要单帧画面就能判断该怎么操作,不用看很多帧;训练时用了专门的优化器和学习率策略,还会维护模型权重的平均值,让模型更稳定、泛化能力更强

简单说,这个模型就像一个游戏天才,看一眼游戏画面,就知道接下来该按哪个键、摇杆该怎么推,而且动作流畅不卡顿,完全不像机器在操作。

通用AI的核心价值就是能快速适应新环境,NitroGen在这方面的表现堪称惊艳。团队选了两款预训练数据里很少见的游戏做测试,一款是等距视角的Roguelike游戏,另一款是3D动作角色扮演游戏。

在等距视角游戏里,分别用60小时、120小时、240小时的新数据微调,NitroGen微调后的模型表现一直比从零训练的模型好。60小时数据时领先8.3%240小时时领先10.1%,平均相对提升10%,相当于别人要花100分的力气,它只需要90分就能达到同样的效果。

3D动作角色扮演游戏里,只用30小时数据微调,效果更明显:打架任务的完成率从53%提升到81%,相对提升52%;导航任务从57.8%提升到76%,相对提升25%;就算是游戏专属任务,也从60%提升到63.3%

这说明NitroGen在预训练阶段已经学会了打架、导航这些通用技能,碰到新游戏时,只需要少量数据微调,就能快速掌握新游戏的核心玩法,不用从头开始学。

讲真NitroGen的意义不止在于它自己有多能打,更在于它的开源策略,能让整个行业都跟着受益。

现在开发团队已经把4万小时的动作标签数据集、通用模拟器和预训练模型权重都公开了,这一下就降低了通用游戏AI的研发门槛,以前科研人员得花大量时间收集数据、开发评估工具,现在这些都有现成的,能把更多精力放在算法创新和模型优化上。

开源地址:https://huggingface.co/datasets/nvidia/NitroGen

想系统掌握AI核心技能、获取行业认可资质?

CAIE注册人工智能工程师认证

助你拓宽职业赛道,成为AI领域持证实力派

返回搜狐,查看更多

平台声明:该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。
阅读 ()