写点什么

智元的“夺冠方法论”

  • 2026-09-01
    北京
  • 本文字数:7066 字

    阅读完需:约 23 分钟

第二届世界人形机器人运动会收官了。总奖牌榜上,智元、天工、宇树、加速进化、银河通用包揽前五名。

智元一共派出 4 款产品参赛,全部为量产产品,没有针对比赛进行特化改装,最终拿下本届比赛的金牌榜和奖牌榜第一。

50 个赛项中,智元共获得 46 枚奖牌,包括 18 金、16 银、12 铜。其中,本届新设的灵巧手专项共有 8 枚金牌,智元临界点的量产版 OmniHand 拿下其中 7 枚。场景赛共产生 12 枚金牌,智元拿到 6 枚。舞蹈、武术、乒乓等竞技项目中,智元又获得 5 枚金牌。

如果只看社交媒体,这届运动会最容易留下印象的,可能还是机器人跑得有多快、能不能跳舞、会不会打乒乓球,以及各种摔倒和翻车的瞬间。

比赛确实变得更好看了。赛项从上一届的 18 个增加到 50 个,新增举重、街舞、乒乓球、自由搏击等大量竞技项目,并且新增灵巧手类目比赛。机器人能够完成的动作越来越多。

并且,即使是在这样一场面向大众的机器人赛事中,机器人也开始被放进更真实的环境,并被要求更多地依靠自己完成任务。

从赛制上看,第二届运动会明显提高了对真实作业和自主运行能力的要求。这也是过去一年机器人能力提升之后,必须面对的进一步检验。

首先是场景更接近真实环境。2025 年的不少场景赛仍然在实验室模拟环境中完成,今年则进一步拆分出工业、生活等 12 个作业赛项,并新增 8 个灵巧手专项和 1 个综合五项。家政、消防、宾客服务等项目还直接进入体验中心、消防站和酒店等真实物理环境。

比赛对控制方式的要求也进一步收紧。2025 年,不少田径等竞技项目仍然允许遥控。今年,100 米、400 米、1500 米、4×100 米接力、跳高、跳远、足球、体操、举重等项目都要求机器人全自主完成。场景赛仍然允许自主和遥操两种方式,但遥操作的得分系数只有全自主的一半。

相比简短、吸引眼球的成功或翻车视频,这些变化,以及机器人究竟依靠什么完成这些任务,受到的关注少得多。但随着机器人开始走向真实部署,这些问题恰恰越来越重要。

**智元董事长兼 CEO 邓泰华此前将 2026 年定义为机器人从“开发态”进入“部署态”的元年。**智元自己也已经开始把机器人送进真实工厂。此前,精灵 G2 已进入龙旗南昌工厂,在 MMIT 测试工段参与平板量产质检。

真正进入部署态,机器人面对的已经不再是一次成功的演示。尤其随着自主程度提高,过去由人处理的很多问题都需要交给系统自己解决,并最终变成可以稳定运行的工程能力。机器人采用什么技术方案、如何适应现场变化,以及出了问题能不能继续完成任务,都会直接影响最终的部署效果。

沿着这些问题再看这届运动会,比赛本身也提供了一个观察机器人真实能力的窗口。

比赛结束后,智元向 InfoQ 详细拆解了不同赛项的参赛方案,包括机器人采用的控制方式、技术路线,以及开发和现场调试中遇到的具体问题。

这些方案让我们有机会看到,一批没有为比赛特化改装的量产机器人,在运动、操作和真实作业中已经走到了哪里;以及为了让机器人从“能做”走向“稳定完成”,今天究竟还需要解决什么。

机器人运控:更高、更快、更强、更自主

奥运会追求人类运动的更高、更快、更强。在人形机器人运动会上,我们也看到了类似的突破。

在舞蹈和武术等项目中,远征 A3 以全自主方式完成腾空、大角度转体、单腿长时间支撑、低重心姿态切换等动作。这些动作会不断改变机器人的支撑状态和重心,对关节输出和全身协调提出很高要求。机器人需要实时调整躯干和四肢姿态,才能连续完成整套动作。

这些能力背后,是智元的运动预训练模型和全身协同控制算法。模型从灵创平台积累的运动数据中学习运动先验,再借助 Sim2Real,将仿真环境中训练得到的策略迁移到实体机器人。

到了乒乓球赛场,机器人面对的运动目标开始实时变化,对自主性的要求也更高。

2026 年,世界人形机器人运动会首次设置乒乓球 1V1 对抗赛,并明确要求比赛全程由机器人自主运行,禁止远程操作、远程控制或任何形式的远程干预。智元派出远征 A3 参赛。

乒乓球球体小、速度快,飞行轨迹还会随着旋转和击球方式不断变化。人类运动员看到来球后,会自然地移动身体、调整球拍、完成击球。机器人需要连续完成目标感知、轨迹预测、击球决策和动作执行,留给每个环节的时间都很短。任何一步慢了,都可能错过来球。

本届运动会开幕式上,智元远征 A3 与乒乓球奥运冠军丁宁进行了一场人机互打。远征 A3 搭载智元自研的 SpikePingpong 乒乓运动控制算法,在没有预设动作脚本的情况下,自主完成来球感知、轨迹预测、击球决策和动作执行。

SpikePingpong 使用快慢视觉结合的方案捕捉高速运动的乒乓球。系统持续更新来球轨迹,判断击球位置和时机,再生成相应的全身动作。

挥拍只是最后一步。来球发生变化,机器人的站位、躯干姿态、手臂轨迹和球拍角度都要跟着调整。大幅度挥拍还会改变整机重心,需要同时处理身体平衡。

乒乓球也因此成为检验机器人自主性的关键项目。

最终,在舞蹈、武术、乒乓等竞技项目中,未经定向改造的智元远征 A3 共获得 5 枚金牌。

到了 100 米障碍赛,机器人面对的环境更加复杂。

相比 2025 年, 今年 100 米障碍赛规则明显变难。比赛限时从 15 分钟缩短到 5 分钟,所有障碍必须依次完成,不能再选择放弃部分高难度项目。对摔倒和碰触障碍的处罚也更加严格。

赛道本身同样升级了。机器人需要走过桥面只有 0.5 米宽的 S 弯桥,钻过净高只有 0.5 米的匍匐通道,翻过 1 米高的手撑跳台,还要在只有 0.6 米宽、带有台阶的 L 型通道中完成转向,并连续跨过两道 0.3 米高的栏杆。

不同障碍考验的能力也不同。直道拼速度,到了 S 弯桥,就要准确控制落脚位置和重心;进入匍匐通道后,机器人需要从双足行走切换到低姿态,通过之后重新起身;跳台和跨栏,则更考验爆发力、全身协调和落地稳定性。

难点还在于,速度和稳定很难兼得。慢下来,留给机器人的调整空间更多,但整场比赛只有 5 分钟;速度上去以后,一次落脚偏差就可能导致摔倒。一旦跌落 S 弯桥、碰倒跨栏或者在障碍中摔倒,还需要返回当前障碍起点重新挑战,计时不会停止。

最终,智元灵犀 X2 拿下 100 米障碍赛金牌。参赛的 X2 使用量产版本,本体没有针对比赛进行改装。

应对这样的复杂地形,只掌握自身的运动状态还不够。

传统的机器人运动控制通常会使用关节位置、速度、机身姿态等本体信息。这些信息可以告诉机器人腿抬到了哪里、身体是否倾斜。但到了 S 弯桥、台阶和窄通道这样的环境,机器人还需要知道前方地形是什么样,才能决定下一步怎么走。

灵犀 X2 的运动控制因此引入了视觉信息。智元自研的 AGILE(AgiBot Generative Intelligent Locomotion Engine)运动控制框架,会结合机器人自身状态和视觉获取的环境信息生成运动策略。看到前方障碍后,机器人可以相应调整落脚位置、身体姿态和动作。

从远征 A3 到灵犀 X2,今年的比赛也能看到人形机器人运控的一些变化。跑得更快、跳得更高、完成更复杂的动作仍然重要,但机器人也开始更多地利用外部环境信息,根据实时变化决定下一步怎么动。

更高、更快、更强的同时,人形机器人也在变得更加自主。

机器人全自主,发展到哪一步了?

相比单项运动能力,场景赛更接近机器人未来真正需要面对的工作环境。机器人不仅要完成一个动作,还要自己感知环境、理解任务、做出决策,并把一连串动作执行下去。

本届运动会的场景赛,智元派精灵 G2 参赛。场景赛共产生 12 枚金牌,智元拿到其中 6 枚,金牌数位居第一。参赛的精灵 G2 同样采用量产版本,没有针对比赛进行本体改装。

从今年的比赛来看,在一部分边界相对明确的场景中,机器人已经能够相对自主完成完整流程。

观察这些项目,会发现它们有一些明显的共同点。

首先是任务足够明确。机器人需要处理什么对象、执行什么操作、最终做到什么程度,都有清晰的定义。工业上下料对应搬运、抓取和装配;园林包括违禁品识别、不文明行为巡检和垃圾拾取;商超则需要完成小票解析、商品拣选、补货和错放纠正。任务可能很复杂,但大部分变化仍然发生在一个相对确定的范围内。

其次是能够获得一定的环境先验。团队可以提前建图、标定关键点位或实地踩点,了解机器人真正比赛时面对的空间。即使无法长期进入比赛场地,也可以根据已经获得的信息,在实验室复刻灯光、桌面材质、尺寸和空间布局,提前发现和解决问题。

操作对象本身也相对稳定。水瓶、书籍、货箱、钢盖等物体都有相对固定的几何形态,机器人可以据此进行抓取规划和动作控制。工业打包虽然也会遇到纸质说明书、盒盖等具有一定柔性的物体,但整体仍然处于相对可控的范围。

但这样的条件还不能覆盖所有场景。

室外应急就是一个典型例子。为了模拟真实的应急情况,比赛前,真实场地没有向参赛队伍公开,团队既不知道地图,也没有见过现场实物布局。自主方案所需要的建图、点位标定和完整流程训练都无法提前完成。

这种情况下,更现实的方案是针对灭火器搬运、阀门操作等单项能力进行训练,再由人参与完整任务的判断和执行。机器人完成已经具备把握的动作,人则负责处理现场的未知情况。

尤其在长流程、复杂场景中,一旦机器人对环境的理解出现偏差,或者某个动作执行失败,后续任务很容易随之中断。现阶段,机器人还很难自主处理所有意外情况,人的即时判断仍然可以帮助它完成调整,继续执行任务。

当任务和环境清晰,且变化可以被算法和工程手段覆盖时,人就有机会退出控制闭环。剩下那些难以预见、难以穷举,也难以在出错后自主恢复的部分,正是今天全自主机器人还未到达的边界。

实现“全自主”,模型只是其中的一部分

做到全自主,意味着机器人已经具备了一定的泛化能力。

它不能只在实验室里重复一套固定动作。到了真实场景,物体的位置会发生偏移,室外的光照、天气和路面状态会变化,货架上的商品也会出现遮挡、缺货和错放。机器人需要感知这些变化,并继续完成任务。

但从智元此次的参赛方案来看,模型能够处理变化,只是实现全自主的一部分。真正进入一个场景后,团队还需要判断哪些变化交给模型处理,哪些可以通过控制算法解决,哪些最好提前通过测试和工程手段降低影响。

在具备条件的场景中,智元采用了几种不同方式处理剩下的不确定性。

第一种,通过充分测试,把环境变化提前暴露出来。

园林场景中,室外光照、天气和路面状态都在变化。团队测试覆盖了早、中、晚以及晴天、阴天、雨天,并分别验证干燥和湿润地面的表现。由于场地预约时间有限,团队采用“白天测试、晚上优化”的方式,白天发现的问题当天晚上修改代码或参数,第二天继续验证。

智元对 InfoQ 表示,这个项目的核心难点在于系统稳定性。机械结构、传感器、电池、通信、供电、散热和底盘运动都需要持续稳定工作,其中任何一个环节出现问题,都可能让整个任务中断。

第二,利用环境结构提供一个确定性的起点,再让机器人处理局部误差。

工业上下料的钢盖装配比较典型。任务中钢盖内部高度约 35 厘米,实际留给末端执行器的操作空间只有约 20 厘米。机器人如果完全依赖固定点位,一旦现场位置出现微小偏差,就可能撞到边缘。

智元采用了“粗定位 + 精搜索”的方案。机器人先抵达预设的大致位置,再借助视觉定位和力传感器反馈调整末端姿态。到了最困难的插入环节,系统根据实际接触力不断搜索合适的位置和角度。

第三,是用大语言模型承担更难预先枚举的认知任务。

商超里的困难和工业装配不同。商品种类更多,还有遮挡、缺货、摆反等状态变化。机器人不仅要找到物体,还需要读取小票、理解任务,并判断货架当前是什么状态。

在商超项目中,智元把 SAM3 和 Qwen2.5-32B 部署到机器人端侧。前者负责目标分割和识别,后者处理小票、任务指令和场景语义,机器人无需依赖外部网络即可完成相应推理。

模型能力足够之后,现场仍然会冒出很意想不到的问题。

团队提前踩点时发现,比赛场地夜间照度很低,相机成像质量随之下降,视觉模型的识别能力也受到影响。最后,他们在机器人胸口增加了一盏补光灯。

拥有足够强的模型和算法能力,只是机器人进入场景的第一步。

真正到了部署阶段,还需要把模型能力和场景先验、传统控制、硬件设计以及大量现场测试结合起来。

“全自主”,不能套用同一个方案

拆解智元的参赛方案,会发现另一个特点。同样是让机器人自主完成任务,不同项目采用的技术路线差异很大。具体使用什么模型和算法,首先取决于这个任务需要解决什么问题。

这一点首先体现在机器人的决策和控制策略上。

商超场景需要处理的认知问题最复杂。商品种类繁多、摆放密集,还存在大量遮挡。机器人既要读取小票、理解任务,也要识别商品,判断缺货和错放状态。因此,团队在这里采用了端侧多模态大模型路线,部署 SAM3 进行零样本图像分割,并使用 Qwen2.5-32B 理解任务指令和场景语义。

到了图书馆,技术路线发生了明显变化。

图书馆同样需要机器人自主完成一系列任务,但环境相对固定,书架、路径和关键点位都可以提前确定。相比开放环境中的语义理解,这里的要求更多集中在定位精度和长流程运行的可靠性上。

团队因此没有使用大语言模型或多模态大模型作为决策核心,而是采用经典的机器人技术路线。先建立高精度地图并标定关键点位,再通过定位和 SLAM 导航计算路径,书脊标签则交给开源视觉模型识别。整套方案减少了端侧大模型带来的计算开销,也让决策链路更加确定。

投壶又是另一种情况。它对复杂语义理解的要求很低,难点集中在高速运动中的控制精度。

团队最初尝试过强化学习(RL),但实际测试发现,RL 很难同时满足投掷速度和落点精度的要求。最终,他们转向运动元(Motor Primitives),把投掷动作拆解为多个基础运动单元,再根据真实机器人的动力学特性进行组合和调整。

在工程实现中,不盲从趋势、一切以高可靠完成任务为导向的务实工程思维,贯穿了智元此次比赛。

One more thing:灵巧手的集中大考

全身运动、自主作业之外,今年的比赛还第一次把机器人的“手”单独拿出来考。

这恰好赶上了灵巧手迅速升温的一年。根据高工产业研究院(GGII)发布的《2026 年 H1 中国灵巧手行业调研报告》,2025 年中国灵巧手市场销量约 1.92 万只,2026 年预计增长至 7.02 万只,同比增长 265.63%。

产品越来越多,灵巧手到底做得怎么样,也需要更具体的标准来判断。

2026 年世界人形机器人运动会第一次单独设置灵巧手专项赛,共安排 8 个赛项:电动工具装配、粉末称量、积木搭建、钉钉固定、开瓶撬盖、拆箱拆包、镊子夹豆和线缆连接。

智元旗下临界点使用同一款量产版 OmniHand 参加全部 8 个赛项,最终获得 7 金、4 银、3 铜。除了极少数项目对手掌胶皮进行轻微调整以增加摩擦力,OmniHand 没有针对不同项目更换定制手,也没有进行本体改装。

具体来看,OmniHand 在各个赛项中均表现出色:

  • 电动工具装配:

机器人需要握住电动螺丝刀,把螺丝准确拧入预制孔。电批工作时会产生反作用力,手需要保持稳定按压,同时控制螺丝刀与螺孔的轴线对齐。位置稍有偏差,就可能出现螺丝拧歪或滑丝。

  • 粉末称量:

机器人需要用勺子舀取粉末,把重量控制在 20 克、误差不超过 0.5 克。粉末会随着舀取和倾倒不断改变状态,机器人需要根据电子秤反馈持续调整。武大智元联合赛队最终用 27 秒完成任务。

这个项目还意外检验了灵巧手的耐用性。在接近一个月的训练和正式比赛中,赛队始终使用同一只 OmniHand,没有中途更换。

  • 积木搭建:

机器人需要逐层堆叠积木,同时保证结构稳定。抓取力度过大可能带动已经摆好的积木,力度不足又容易滑落,放置时还需要准确控制积木的位置和姿态。

  • 钉钉固定:

机器人需要握住锤子,把钉子砸进软木板。每次锤击产生的冲击都会沿着锤柄传到手指、关节和传动结构,对灵巧手本身的结构和耐冲击能力提出要求。

  • 开瓶撬盖:

开瓶器平放在桌面时,留给手指介入的空间很小。机器人需要找到合适的位置把开瓶器抠起来,再调整到方便发力的姿态。

临界点在这里使用了自研 DUET 架构辅助靠近、抓取和姿态调整,将早期一分钟以上的取工具时间缩短到十几秒。

  • 拆箱拆包:

机器人需要拿起美工刀划开纸箱,同时控制刀具的运动轨迹和切入深度。切得太浅无法打开包装,过深则可能损坏箱内物品。

  • 镊子夹豆:

机器人需要先拿起医用镊子,再逐颗夹取表面光滑的黄豆。正式比赛时,碗里只剩薄薄一层黄豆,原有方案很容易夹空。临界点现场调整算法,采用“螺旋搜索”逐圈寻找黄豆。决赛中,OmniHand 自主夹起约 70 颗黄豆,最终夺冠。

  • 线缆连接:

机器人需要识别并拾取 USB、Type-C 等插头,再准确插入对应接口。线缆会随着重力和手部动作不断改变形状,插头的姿态也会随之变化,因此机器人需要在操作过程中持续判断位置和方向。

真正走向通用操作,一只灵巧手需要适应不同的工具、物体和操作方式,并在不同任务之间保持稳定表现。临界点用同一款量产 OmniHand 打完了全部 8 个项目,也由此检验了这只手面对不同任务时的泛化能力和实际可用性。

结语

本次世界人形机器人运动会中,我们看到了智元在前沿技术探索和工程落地上的积累。

过去一年,智元继续向具身智能的前沿问题推进。GO-2 开始处理长程任务中的规划与执行,Genie Envisioner 2.0 尝试用世界模型构建可以交互和训练的物理环境;AGIBOT WORLD 2026 和 Genie Sim 3.0,则继续扩充真实数据和仿真训练的基础设施。

另一边,这些技术也在更快地转化为产品,进入现场。2025 年底,智元第 5000 台量产机器人下线;半年后,这个数字已经增长到 15000 台。精灵 G2 进入龙旗南昌工厂的平板量产质检工段,机器人开始按照真实产线节拍连续运行;富临精工、上汽等工厂,也已经成为智元机器人验证和部署的场景。

金牌榜和奖牌榜双第一只是最终呈现出来的结果。更值得关注的是,智元已经开始建立一套从模型、数据、本体到工程部署的完整能力,并在越来越多的真实任务中反复验证它。

这也是机器人从“开发态”走向“部署态”需要的基础。