“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”

“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者” – 量子位

首页

资讯

智能车

智库

活动

MEET大会

AIGC

扫码关注量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

“AlphaGo”杀进足球场!自我对弈140年,机器人成“梅西终结者”

林, 方舟

2026-09-25

21:24:20

来源:

量子位

文婷 发自 凹非寺

量子位 | 公众号 QbitAI

足球界的AlphaGo来了!

在“虚拟世界杯”自我对弈140年后,终于带着球技出山。

视频中的人形机器人“Messinator”穿着阿根廷队服,丝滑地带球过人,一脚射门:

这一成果来自

美国具身智能独角兽Skild AI

。

有网友看完忍不住感叹:

最妙的是奖励函数只给了进球,盘带、护球、倒地爬起来全是自己“悟”出来的。

AlphaGo那套self-play方法论又在物理世界又走通了一次;

虚拟世界杯踢140年,值了!

那么这个Messinator究竟是一个怎样的机器人?

造出它的Skild AI又是什么来头?

看下去就知道了。

“梅西终结者”,在虚拟世界杯苦练140年

Messinator这个名字拆开看很有意思。

它的前半截是梅西(Messi),后半截来自经典科幻电影《终结者》里的机器Terminator,把这俩合在一起就是

“梅西终结者”

。(big胆hhh)

它真正大脑是Skild AI此前推出的旗舰机器人基础模型

S1

。

而S1最核心的能力,就是让机器人像大模型一样“上下文学习”。

我们只需给它看一段任务示范视频,它就能把视频当作“提示词”,逐步理解咱们想完成什么任务,并把视频里的意图和动作转换成适合自己身体的执行方式。

最爽的是,

它碰到新任务不用回炉重造,直接就能上手。

不过,会看视频还只是第一步。

Skild AI认为,像S1这样的基础模型主要从人类数据中学习,能力上限难免受人类经验限制。

如果想继续变强,就得让机器人自己创造经验,并尝试着自己去发现人类没教过的动作。

于是,Skild AI又在S1基础上加入了

强化学习

和

self-play

,也就是自我对弈。

它的整个训练设置并不复杂,团队把机器人放进了NVIDIA Isaac Sim搭建的虚拟足球场,并只给它设定了一个最终目标:

进球,拿到高分。

然后,在整个训练过程中,没有人为盘带单独设置奖励,也没有人为护球、抢断、射门和倒地起身逐一打分。

机器人面对的对手,只是自己此前保存下来的模型版本。

通过新旧版本反复比赛,赢下来的新策略,又会成为下一轮训练中更难对付的对手。

于是,每一次进步,都会为机器人自动制造出下一道难题。

Skild AI技术博客显示,机器人刚进入虚拟球场的前几个月连走路都不利索;

但等它“长到大学生的年纪”,便自行学会了摔倒后重新站起来。

而随着对手不断变强,机器人盘带绕过防守、用身体护球、主动抢断等更复杂的行为也开始陆续出现。

全程没有工程师规定它必须这样做;

它保留下这些动作只有一个初心:

它们能帮自己赢球。

这正是self-play最迷人的地方。

当年,AlphaGo正是通过与自己对弈,逐渐发现了一些连顶尖棋手都没预料到的下法,并于2016年4:1一举击败韩国传奇棋手李世石九段,正式拉开了AI变革的序幕。

现在,Messinator也通过自我对弈、在虚拟世界踢了140年世界杯,将足球策略迁移到了真实人形机器人上。

最终,Messinator不仅能走到球前完成射门,还学会了带球、护球、抢断,并在真人对抗中调整自己的位置和动作。

Skild AI通过这场硬核的演示,充分证明了

机器人不一定都要由人类亲手教会新动作

;

它也可以自己练、自己输、自己总结,再自己变强。

而这,恰好就是Skild AI过去几年一直在押注的方向。

一颗大脑,控制所有机器人

2025年7月,Skild AI正式推出了一套能够跨硬件运行的机器人基础模型——

Skild Brain

。

它的核心主张是:

Any robot, any task, one brain.

目标是打破“一种身体配一套大脑”的行业桎梏,让不同形态的机器人执行不同任务时都可以使用同一颗大脑。

随后没过两个月,Skild又进一步公开了一组

omni-bodied训练成果

。

团队在仿真世界中生成了

约10万种

身体结构各异的机器人,让同一个模型累计训练

约1000个仿真年

。

到了测试阶段,模型还得直接接管训练时从未见过的机器人。

哪怕机器人突然断腿、关节锁死、轮子卡住,或者背上额外负重,模型也不会立刻“趴窝”,而是会根据身体状态在线调整重心和运动方式。

部分情况下,它甚至只需几秒钟的时间就能重新找回平衡,并摸索出新的移动方法。

这套omni-bodied训练体现了Skild最核心的思路:

机器人见过的身体越多,就越难靠死记硬背过关。

为了能同时控制10万种不同的身体,模型只能尝试理解平衡、关节、重心和动力之间更通用的物理规律,而不是背下一款机器人的固定步态。

如今的Messinator,正是延续了这条技术路线,并进一步叠加了self-play。

其中,

Skild Brain

负责赋予它控制身体、保持平衡和应对碰撞的基本功;

self-play

则负责让它思考“下一步该怎么做,才会更好?”。

而从10万种机器人身体,到140年的虚拟世界杯,Skild这条看似疯狂的技术路线并非横空出世。

把这些想法从论文一路推向真实机器人的,是两位在机器人学习领域深耕多年的卡内基梅隆大学教授。

两位CMU教授,联手造机器人大脑

Skild AI成立于2023年,脱胎于

卡内基梅隆大学(CMU)机器人研究体系

。

团队成员既包括来自卡内基梅隆大学、斯坦福大学、加州大学伯克利分校等高校的研究人才,也包括曾任职于Meta、Tesla、NVIDIA、Google、Amazon和Everyday Robotics等机构的研究员及工程师。

而联合创始人兼CEO

Deepak Pathak

的经历,几乎串起了Skild AI的整条技术路线。

他本科毕业于印度理工学院坎普尔校区计算机专业,后赴加州大学伯克利分校攻读计算机博士,师从计算机视觉领域知名学者Alyosha Efros和Trevor Darrell。

博士毕业后,他曾在Meta(前Facebook)AI Research从事研究工作,也曾在伯克利与机器人学习专家Pieter Abbeel合作,担任访问博士后。

此后,他进入卡内基梅隆大学,成为机器人研究所和机器学习系教授。

Deepak Pathak最具代表性的研究之一是

“好奇心驱动的探索”

。

这项研究等基本思路是,

与其让机器只能依赖人类设计的外部奖励,不如赋予它一种内在动力,让它对陌生和难以预测的现象产生“好奇”,并主动探索环境,并在探索中学会新的能力。

Deepak这套研究思路后来又延伸到自监督机器人学习、视觉模仿学习、Sim2Real和自适应控制等方向。

在创办Skild AI之前,Pathak还曾联合创立人脸识别公司VisageMap(该公司后来被FaceFirst收购)。

Skild AI的另一位联合创始人兼总裁

Abhinav Gupta

,博士毕业于马里兰大学计算机系,现任卡内基梅隆大学机器人研究所教授;

他曾参与建立Facebook AI Research匹兹堡实验室,并担任研究管理和领导职务。

并长期专注于研究大规模视觉学习、自监督学习、终身学习、机器人操作和物理常识,是早期“让机器人通过自主交互收集训练数据”路线的重要研究者。

曾获得斯隆研究奖、PAMI青年研究员奖、IAPR J.K. Aggarwal Prize等奖项。

Anyway,家人们,你们说要是哪天“Messinator”真进化到能踢世界杯,像当年AlphaGo对战柯洁那样,跟梅西来一场世纪人机对决,咱们能受的了吗?

参考链接:

[1]

https://x.com/SkildAI/status/2102807731564662797

[2]

https://www.skild.ai/blogs/physical-self-play

[3]

https://www.skild.ai/blogs/s1

[4]

https://www.skild.ai/blogs/building-the-general-purpose-robotic-brain

[5]

https://www.skild.ai/blogs/omni-bodied

[6]

https://www.cs.cmu.edu/~dpathak/

[7]

https://proceedings.mlr.press/v70/pathak17a.html

[8]

https://www.cmu.edu/news/stories/archives/2018/july/facebook-ai-research.html

[9]

https://www.cs.cmu.edu/news/2021/gupta-wins-aggarwal-prize-self-supervised-learning

版权所有,未经授权不得以任何形式转载及使用,违者必究。

机器人

林, 方舟

OpenAI闯大祸!GPT竟黑进医保系统,黄仁勋:管不住就关掉

2026-09-25

给机器人当老师,还能赚外快?“中国版Index”觅蜂派来了

2026-09-25

实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招

2026-09-16

探索RSI,生数新世界模型让机器人开始自我进化

2026-09-14

扫码分享至朋友圈

相关阅读

马斯克擎天柱机器人大秀走姿,背后大佬集体现身喊话招人

明年年底要去火星

克雷西

2025-04-03

机器人

特斯拉

马斯克

人形机器人终于学会洗碗了

没有新算法和特殊工程,只有新数据

时令

2025-09-04

机器人

宇树机器人被曝漏洞,机器人之间可相互感染,官方火速回应

双足四足都中招了

衡宇

2025-09-30

具身智能

宇树

机器人

机器狗

昆仑万维周亚辉:AGI时代也叫机器人时代,决定未来十年新首富

2023年,机器人开始真正进入人类社会

白交

2025-01-03

昆仑万维

机器人

Meta最新触觉机械手登Science子刊封面,操作未知物体精度最高提升94%

机器手可以自学操作未知物体了

奇月

2024-12-01

具身智能

机器人

机械手

本周三!机器人与数字化转型应用解析,线上研讨会诚邀你来围观

赞奇科技邀请了服务多家企业数字化转型的实战团队来分享他们在项目落地中的具体细节,诚邀你来线上围观

明敏

2025-04-22

数字化转型

机器人

线上研讨

热门文章

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

2026-09-19

白天务农晚上码农,这个斐济农民跨越一万公里来拼多多取经

2026-09-18

27B模型分分钟交付网页,Qwen 3.8还是太能了

2026-09-19

具身智能技术路线尚未定型,基础设施却先收敛

2026-09-18

“留给人类阻止AI的时间不多了”

2026-09-19

关于量子位

加入我们

寻求报道

商务合作

扫码关注量子位

追踪人工智能新趋势,报道科技行业新突破

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司

京ICP备17005886号-1


本文来源:量子位