写点什么

Jiuwen Symbiosis 深度解析:从数字世界走向物理世界,为 Physical AI 打造 Symbiosis (共生)

  • 2026-07-22
    北京
  • 本文字数:5556 字

    阅读完需:约 18 分钟

Jiuwen Symbiosis 是一个能懂人话、看得见物理世界、控制四肢执行的 Physical AI Agent。用户不需要示教,只需像指挥一个经验丰富的工人一样,用自然语言下任务,它就能自己完成感知、理解、规划、执行。同时,对昇腾、鲲鹏算力具备天然亲和性,保障推理性能高效稳定。本文将对其技术进行详解。

GitHub: https://github.com/openJiuwen-ai/jiuwensymbiosis

GitCode: https://gitcode.com/openJiuwen/jiuwensymbiosis

AI Agent 已经能够在数字环境中展现出不错的能力,比如写代码、查资料、调用工具、整理内容等。不过,这些能力大多仍停留软件与屏幕之内,还没有真正走进物理世界。

 

下一步的重要方向,是让智能体从“数字助手”走向“物理世界的执行者”。用户只需通过自然语言下达指令,智能体就能够结合对真实环境的感知与理解,自主完成相应的物理操作,并把任务在现实场景中真正落地执行。

 

OpenJiuwen 社区近期开源的 Jiuwen Symbiosis,正是围绕这一方向展开的一套面向 Physical AI 的 Agent 框架。它的目标不是简单地让 AI"动手",而是让 AI 真正读懂物理世界、自主操控现实环境,像一个熟练工人那样听懂任务、直接上手。

这背后是一个看似简单、却很关键的转变——只告诉它做什么(What),不必教它怎么做(How)。在传统机器人系统中,要让机器真正完成一个任务,往往需要把流程拆解得非常细:通过示教器一点点记录轨迹、把动作顺序写成固定脚本,一旦任务或环境发生变化,就必须重新配置甚至重新编排整个流程。这种方式虽然可控,但泛化能力有限。

 

而在 Jiuwen Symbiosis 的设计中,这一模式正在发生变化。用户只需给出一个自然语言层面的任务指令,系统就可以在实际场景中自主完成理解与执行:它会识别环境状态、定位目标对象、进行任务分解与规划,并在执行过程中根据反馈动态调整。如果出现抓取偏移、放置不准确等情况,也能够进行纠正和再尝试,而不是严格依赖预先写死的步骤。

 

从使用体验上看,用户不再需要关心中间的执行细节,只需要表达最终目标,其余的理解、规划与控制过程由 Agent 自主完成。这种从“单向指令执行”到“任务协同完成”的变化,也正是 “Symbiosis(共生)”这一命名所表达的核心含义——人类与智能体在同一目标下分工协作,而不是简单的控制与被控制关系。

 

“人说一句,机器就把活干完”——要让这件事在真实世界里既稳定又安全地落地,究竟该如何实现?直接训练一个足够强的大模型,将感知理解、任务规划与动作执行全部交由单一模型来完成,是否就足以解决问题?

为什么不把所有能力交给单一端到端大模型

 

先说结论:并不足以解决问题。将“感知理解 → 任务规划 → 动作执行”完整压缩进一个 Transformer,并通过端到端方式直接输出关节位姿,看起来是一条足够优雅的路线,但在真实机器人系统中仍然面临几个绕不开的关键挑战:

 

· 跨本体、跨环境与跨任务的泛化能力有限。 当前主流端到端具身模型(如 VLA)通常与特定机器人形态和训练场景强耦合。一旦更换硬件平台或部署环境,甚至面对分布外的任务变体,往往需要重新采集数据并重新训练,导致整体成本高、迁移效率低,难以支撑规模化落地。

· 长程复合任务能力不足。 在多步骤、长时序任务中,单一端到端模型往往缺乏显式的任务分解与子任务编排能力,也难以进行中途纠错与策略回退。本质上更多是在学习“轨迹模仿”,而不是具备在线规划与决策能力。

· 成功率低、稳定性差。 当前具身端到端基础模型为典型的黑盒结构,直接输出关节位姿,大模型兼顾认知决策与运动控制,整体训练难度大,在真实物理系统中往往表现为稳定性不足、任务成功率低。

 

针对上述三大核心痛点,Jiuwen Symbiosis 提出以端到端智能体(Agent)系统替代传统单一端到端模型。两者的核心区别在于:该方案不再依赖一个黑盒模型统一完成感知、规划与动作执行,而是转向一种分层解耦的系统设计范式,具体而言:

· 一是解耦本体、环境与动作执行模块,使系统在硬件形态或场景环境发生变化时,仍能稳定泛化迁移。

· 搭建原子化工具库(Tool Library),通过工具组合完成复杂任务,依托组合泛化能力适配各类长时序复合作业;

· 将感知、规划、执行拆分为独立可解释显式模块,统一运行于具备态势感知(Situation Awareness)的智能体循环链路中,内置实时视觉反馈与动态任务重规划机制。模块解耦使得端到端优化难度降低,显著提升系统稳定性与任务成功率。

技术核心:态势感知循环(Situation Awareness Loop)

 

物理 AI 与数字 AI 之间存在本质差异。在数字世界中,即便对话或决策出现偏差,也可以通过撤回、追问或重新生成来修正结果;但在真实物理环境中,机器人一旦执行错误,轻则导致操作失败或路径偏移,重则可能造成设备损坏、生产中断,甚至引发安全事故。

 

更关键的是,物理世界本身是持续变化且不可完全回放的:物体可能被意外扰动,场景状态随时发生变化,机械臂也可能因为累积误差而无法精确到位……这些不确定性是常态,而非例外。

 

因此,Physical Agent 不能依赖“预先规划完整流程并一次性执行”的开环模式,而必须构建一个持续运行的闭环系统。在这一框架下,系统需要不断在“感知—执行”之间循环迭代:实时获取环境状态、推理并生成下一步动作、执行物理交互、再对执行结果进行校验与修正,并基于反馈持续更新后续决策。

 

这一闭环机制,正是 Jiuwen Symbiosis 的核心设计之一——态势感知循环(Situation Awareness Loop,简称 SA Loop)。整套系统通过多个关键环节首尾衔接、持续迭代,使智能体能够在物理世界中保持稳定运行与自适应能力,其完整流程如下:

 

九问物理感知→ 安全规划 → 物理执行 → 状态观察 → 观测反馈 →(回到感知)

 

下文将依次拆解各环节的核心功能与运行逻辑。

 

一、九问物理感知(Jiuwen Physical Perception):先看懂现场,听懂指令,输出结构化场景状态

 

本环节是 Agent 的感知器官,接收视觉、文本、语音等多模态输入,负责将非结构化的物理现场转化为结构化的世界状态,为规划层意图推理、任务编排与技能构建提供标准环境依据。除了进行场景理解、目标检测,感知模块还需要承担所有空间解算工作,输出可直接复用的标准化技能参数,使规划层无需开展任何空间推算与数值解算,仅负责逻辑决策与技能组装,实现感知与规划的彻底解耦。

 

在感知流程上,系统并行处理两个关键问题:看什么,与怎么看。相机同步获取 RGB 与深度信息,为空间解算提供高精度数据基础。与此同时,物体检测摒弃了传统的硬编码类别清单,转而采用开放词汇范式:只需将目标描述(如“黑色盒子”)以纯文本形式输入感知模型,即可完成定位与识别,检测对象完全由用户指令动态指定。

 

面向机器人实操场景,本模块统一将目标坐标投影至机械臂基座坐标系,自动解算抓取高度、接近位置、放置点位等核心参数,最终整合形成包含目标语义、位姿、置信度与可执行参数的结构化状态。感知层仅负责环境感知与参数输出,为规划层动态组装技能、校验方案可行性提供完备的前置输入。

 

二、安全规划(Safe Planning):大脑任务规划,安全校验

 

该模块定位为 Agent 的规划大脑,专注高层语义决策与任务编排,不参与任何空间解算。模块统一读取:用户自然语言指令、感知模块输出的结构化场景参数,以及系统内置的标准化 Skill 技能模板。首先在意图解析与任务拆解阶段,模块精准理解用户高层指令,将复杂任务目标拆解为逻辑闭环、时序有序的子任务技能序列。 

 

然后进行动态技能构建:以通用 Skill 模板为基础,直接复用感知已解算完毕的位姿、抓取高度、放置点位等精确执行参数,将静态技能模板与当前环境、任务需求动态绑定,自动组装生成完整、带参的可执行技能指令,完成从 “通用技能模板” 到 “场景专属可执行技能” 的转化。 

在此基础上,规划层同时内置物理约束与安全边界校检,对组装后的技能方案做可行性筛查,从源头过滤越界、碰撞、不合物理逻辑的无效动作。

 

这也是 Jiuwen Symbiosis 架构“扬长避短”的关键落点。若缺少感知模块的前置解算,规划层将被迫直接处理视觉空间信息,只能依赖通用视觉语言模型——而 VLM 在空间计算精度上存在天然短板,且鲁棒性弱于纯大语言模型。为此,架构采取了彻底的前置分离策略:将高精度几何测算工作完全剥离并交予感知模块,规划层由此从底层坐标运算中彻底解放,只需复用既定空间参数进行纯逻辑推演。这不仅从源头规避了大模型空间幻觉导致的误操作,更让规划层得以采用更为鲁棒的纯 LLM,而非受限于 VLM,进一步提升了决策稳定性。

 

三、物理执行(Physical Action):把规划平稳落地

 

该模块定位为 Agent 的“执行小脑”。规划通过了安全检查,就进入执行 —— 按 Skill 调用一个个 Action Tool 原子能力(位移、抓取、放置),把规划变成连续可控的物理运动:运动到位、闭合夹爪、抓起、放下。

 

其中 Action Tool 所有动作均以原子化函数形式封装(如 move_to_xyzr()、gripper_open()),每个动作独立、与环境解耦、与本体解耦,可自由组合为任意操作序列。相比端到端的小脑模型,原子化函数在执行层面具备更高的确定性、稳定性与成功率。

 

执行层的稳定性还来自两项设计约束。其一,能力与动作严格匹配:机器人实际具备的操作,行动能力以显式接口形式对外暴露,系统只会调用真实存在的硬件能力——一个吸盘机器人永远不会被指派“闭合夹爪”这类不存在的动作,从机制上杜绝了指令与硬件不匹配的风险。其二,异常状态可恢复:得益于原子化动作的独立性与解耦设计,任何一步抛出异常时,系统可精确回退至上一个稳态节点,自动将机械臂带回 Home 位、松开夹具,确保下一步始终从确定的起始位姿开始,而非悬停在不可预知的中间位置。

 

此外,为增强系统兼容性,Action Tool 也不仅限于原子动作函数,也支持将 VLA 等小脑模型封装为统一的工具接口,由系统按需调度,在保持架构不变的前提下灵活适配不同执行策略。

 

四、状态观察与观测反馈(Observation & Feedback):看着结果,闭合回路

 

动作执行完毕不代表任务结束——这正是闭环系统与开环脚本的本质区别。本环节负责将执行结果重新采集为结构化观测,并以此驱动下一步决策,让 Agent 始终基于真实世界状态行动,而非预设的时间线。

 

具体而言,机器人每完成一轮操作后回到固定的观测位,通过相机画面进行状态判稳:若目标物体已到达指定位置,则任务完成;若物体中途滑落、被碰走或未被成功抓取,则触发重抓或补偿动作。这一判稳逻辑不依赖视觉反馈模型输出精确空间坐标,只需回答二值问题——“抓住了还是滑掉了”、“放上去了还是没放上去”、“任务完成了还是没有”。这大幅降低了对模型空间理解能力的要求,使 VLM 也能可靠地承担闭环判稳角色。

 

在判据实现上,系统采用几何判断与视觉语言模型(VLM)双轨制:默认基于物体是否进入目标区域的空间范围做快速判定,也可直接向 VLM 提问(例如“黑色盒子是否已放置在白盒子上?”),并在后者不可用时自动回退至几何判据,确保判稳逻辑在任何情况下都不降级。

 

观测结果同步回传至规划模块:成功则推进下一任务节点,失败则根据异常类型触发局部重规划或参数修正,形成“观察-判定-调整”的持续闭环。

 

同时,无论成功与否,本轮执行已改变了物理世界的状态。下一轮循环开始时,感知模块将重新采集现场、刷新世界状态——物体在哪、还剩几步、环境有无变化——一切回到事实层面,而非基于上一轮的推测。至此,执行结果转化为新一轮感知的起点,循环闭合,Agent 进入下一轮完整周期。

端云协同:模型按需上云,框架端侧闭环

 

Jiuwen Symbiosis 的 Agent 框架始终保持端侧闭环运行,含整个感知-规划-执行-反馈的完整回路。在模型部署上采用端云协同的分层策略,核心原则是按算力需求做差异化部署:

 

· 云侧:承载大参数量的复杂模型,包括用于意图解析与任务拆解的大语言模型(LLM),以及用于视觉反馈模块的视觉语言模型(VLM)。

 

· 端侧:部署轻量化的实时多模态感知模型。这些模型直接提供本地感知 server 服务,确保机器人对环境的快速响应。

 

在此基础上,Jiuwen Symbiosis 原生对接昇腾、鲲鹏国产化算力生态,形成“端云异构、分层承载”的算力底座。其中,昇腾 NPU 统一承载端侧与云侧的 AI 推理负载,覆盖视觉检测、多模态感知及大脑模型规划等高频重算任务;鲲鹏 CPU 则专职负责流程调度、设备状态管理与底层运动控制逻辑。通过将异构算力与业务类型精准匹配,系统有效避免了单一计算单元因并发任务争抢资源而导致的性能瓶颈,充分发挥了不同芯片在各自擅长领域的算力特长。

LOOP 之外:本体解耦,支持不同构型本体的适配

 

Jiuwen Symbiosis 通过能力织入 (Capability Mixin) + 适配器 (Adapter) 模式支持任意构型、末端执行器及传感器形态。只需实现 6 个文件(配置、驱动、环境、接口、会话、YAML)即可完成新硬件接入,无需修改核心智能体逻辑。

 

于是"换一台机器人"从"重写一套 Agent",变成"写一个适配器、其余照旧"。对想把 Jiuwen Symbiosis 用进真实场景的团队,这往往比"支持了多少种机器人"更重要。

怎么用:一句话指挥

 

这套基于态势感知 Loop(感知-规划-执行-反馈)的 Jiuwen Symbiosis 智能体,层层闭环,环环相扣,但对使用者来说,入口只有一个——自然语言。

 

用户只需下达任务指令,比如“把黑色盒子放到白盒子上”。机器人自行通过视觉感知识别目标,自主规划每一步操作,完成抓取、搬运、放置,跑完整个闭环。若需换一个任务,则只需换一句话(任务指令)。代码不改,配置不动,技能自动复用,流程照旧运转。它自己认、自己规划、自己执行。用户只告诉它“干什么”,不用教它“怎么干”。

 

整个系统对用户的要求只有一件事:像指挥一位经验丰富的工人那样,说清楚想让它实现什么目标。剩下的——从感知物理世界,到大脑任务规划,到安全动手执行,再到确认活干完了——全部交给 Jiuwen Symbiosis。