AI大模型是人形机器人的"大脑",决定了机器人从"能走"到"能干活"的核心能力。2026年,VLA(Vision-Language-Action)模型已成为人形机器人的标配架构,据Robotics Center统计2026年新部署机器人VLA采用率约40%,双系统(System 1快回路+System 2慢推理)成为主流范式。全球具身智能AI软件市场2025年约44亿美元,预计2030年达230亿美元(CAGR 39%)。端侧算力方面,NVIDIA Jetson Thor T5000提供1035 INT8 TOPS(130W),特斯拉自研AI5达2250 TOPS,国产地平线、沐曦+优必选等加速追赶。单台人形机器人AI系统(算力芯片+存储+算法软件)占BOM的12%-16%,价值量约1.5-2.5万元。训练数据是最大瓶颈:全球高质量物理交互数据仅约50万小时,需求千万-亿小时级,缺口超99%;遥操作采集成本约118美元/小时,仿真合成数据边际成本近零。竞争格局上,NVIDIA凭借"GR00T模型+Jetson芯片+Isaac仿真"全栈生态占据主导,谷歌DeepMind、特斯拉、Figure各有特色;国内智元GO-1、阿里灵曦(1300亿参数开源)、宇树UnifoLM等快速跟进。整体来看,AI大模型赋能正处于"模型开源化、算力端侧化、数据仿真化"的关键窗口期。
如果说减速器、丝杠、伺服电机是人形机器人的"肢体",视觉传感器是"眼睛",那么AI大模型就是机器人的"大脑"——负责感知理解、任务规划、运动控制和自主决策。2026年,人形机器人行业正经历从"硬件驱动"到"软件定义"的权力转移:当双腿能稳稳行走、双手可以灵巧抓握后,能否在真实场景中自主完成复杂任务,成为区分机器人能力的核心分水岭。
2026年上半年,国内具身智能赛道融资近440亿元,其中超过一半涌向"大脑派"(AI模型/算法公司),而机器人本体厂商拿到的资金不到20%。这一结构性变化标志着行业竞争焦点正从硬件制造转向智能能力。
人形机器人智能架构经历了三代演进:
System 1(快回路/反射系统):参数量80M-300M,控制频率100-200Hz,负责实时运动控制、平衡维持、接触力调节,类似人类的"本能反应"。
System 2(慢回路/推理系统):参数量2B-130B,控制频率5-20Hz,负责任务规划、语义理解、场景推理、长程决策,类似人类的"深度思考"。
双系统协同:System 2输出高层指令,System 1将指令转化为毫秒级运动控制,既保证了智能性又满足了实时性。代表模型:NVIDIA GR00T(双系统)、Figure Helix(S1+S2)、智元GO-1(ViLLA架构)。
| 模型 | 开发机构 | 发布时间 | 参数规模 | 控制频率 | 开源 | 核心架构/特点 |
|---|---|---|---|---|---|---|
| GR00T N1.7 | NVIDIA | 2026.08 | 3B+小模型 | S2:~15Hz S1:200+Hz | 是 | 双系统VLM+DiT,Cosmos-Reason2骨干,全栈生态绑定 |
| Helix (S1+S2) | Figure AI | 2025.02 | 7B+80M | 200Hz | 否 | 双系统,7B System2+80M System1,Figure本体专用 |
| π0.5 | Physical Intelligence | 2025.04 | 3.3B | 50Hz | 是 | Flow Matching连续动作,精细操作强(openpi开源) |
| OpenVLA | 斯坦福/伯克利 | 2024.06 | 7B | ~10Hz | 是 | 自回归离散动作,学术基准,社区活跃 |
| GO-1 | 智元机器人 | 2025.03 | ~3B | 60Hz | 是 | ViLLA架构(VLM+MoE),预训练GPU时长仅OpenVLA的1/20 |
| 灵曦 | 阿里巴巴 | 2026.06 | 130B | ~15Hz | 是 | 国内首个开源千亿参数VLA,含操作/移动/世界三模型 |
| RT-X 第三代 | 谷歌DeepMind | 2026 | ~55B | ~20Hz | 否 | 支持17种机器人本体、2000+技能,跨机型通用 |
| FSD迁移模型 | 特斯拉 | 2026 | 未公开 | 未公开 | 否 | 端到端"输入像素输出控制",与自动驾驶FSD同源 |
NVIDIA是唯一提供"模型+芯片+仿真+工具链"全栈解决方案的厂商。GR00T N1.7(3B参数,开源)+ Jetson Thor芯片 + Isaac Sim/Lab仿真平台 + Cosmos世界模型,形成完整闭环。GR00T已支持Fourier、1X、Agility、Sanctuary等多家人形机器人本体,是目前生态最完善的方案。
特斯拉Optimus采用与FSD自动驾驶相同的端到端战略——"输入像素,输出控制指令",放弃分层架构,采用单一巨大神经网络,依托Dojo超算和海量真实数据闭环。Figure AI的Helix模型(7B+80M双系统)与OpenAI深度合作,仅用于Figure本体,在BMW工厂试点已进入第三期。
谷歌DeepMind RT-X系列支持跨机型通用(17种本体、2000+技能),是学术研究的标杆。阿里灵曦(1300亿参数)是国内首个开源千亿VLA,包含操作模型Qwen-RobotManip、移动模型Qwen-RobotNav、世界模型Qwen-RobotWorld三大组件。智元GO-1采用ViLLA架构,训练效率大幅提升,已在自家远征系列机器人上量产部署。
人形机器人对端侧算力有特殊要求:低延迟(控制回路需毫秒级响应)、低功耗(电池供电)、高并发(同时处理14路以上摄像头/激光雷达数据流)。2026年主流方案的算力需求在200-2000 INT8 TOPS之间,功耗控制在30-130W。
| 芯片/平台 | 厂商 | INT8算力 | 功耗 | 内存 | 量产价格 | 定位 |
|---|---|---|---|---|---|---|
| Jetson Thor T5000 | NVIDIA | 1035 TOPS | 130W | 128GB | ~$3499 | 高端人形旗舰 |
| Jetson Thor T4000 | NVIDIA | 600 TOPS | 70W | 64GB | ~$2999 | 中高端人形 |
| Jetson Thor T3000 | NVIDIA | 432 TOPS | 50W | 32GB | ~$1800 | 主流人形/协作 |
| Jetson AGX Orin | NVIDIA | 275 TOPS | 60W | 64GB | ~$2000 | 上一代主力 |
| AI5(自研) | 特斯拉 | ~2250 TOPS | ~100W | 128GB+ (网传规格) | 自研不外卖 | Optimus专用 |
| RDK S100 | 地平线 | 128 TOPS | 30W | 16GB | ~¥3000 | 国产中低端 |
| RK3588 | 瑞芯微 | 6 TOPS | 8W | 8GB | ~¥500 | 入门/教育 |
NVIDIA Jetson AGX Thor基于Blackwell GPU架构,2026年全面上市。T5000提供2070 FP4 TFLOPS(约1035 INT8 TOPS),配备128GB LPDDR5X内存,功耗130W,性能是上一代Orin的7.5倍(按FP4峰值计;INT8对INT8约3.8倍)、能效3.5倍。可同时处理14路摄像头/激光雷达数据流,本地运行70B级大模型。开发套件售价约48999元人民币,量产模组T5000约$2999(千片量)。
目前宇树、智元、Figure等多家具厂已宣布部署Jetson Thor,使其成为2026年高端人形机器人的事实标准算力平台。
国产端侧AI芯片正加速追赶:
国产芯片在中低端领域已具备性价比优势,但高端大模型推理的软件生态(CUDA兼容、模型优化工具链)仍有明显差距。
如果说大语言模型的基础是万亿级文本语料,那么具身智能的基础就是物理交互数据。然而,截至2026年初,全球可用的高质量物理交互数据总量仅约50万小时,而训练具备通用泛化能力的具身基座模型需要千万甚至亿小时级数据,缺口超过99%。与大语言模型动辄万亿token的训练规模相比,具身智能的数据基础仍处于极早期阶段。
1. 采集成本高:遥操作采集约118美元/小时(2026年,较2024年的340美元已大幅下降),且受限于人类操作速度(平均每分钟1条示范)。
2. 数据多样性差:现有数据集中在少数任务场景(如抓取、搬运),开放世界的长尾任务数据极度稀缺。
3. 跨本体迁移难:不同机器人本体的动作空间不同,数据难以直接复用,Open X-Embodiment等开源数据集(100万+轨迹)正在缓解这一问题。
为解决数据荒,仿真合成数据成为核心方向。通过高保真物理引擎和域随机化技术,可以在虚拟世界中低成本生成海量训练数据:
仿真数据的边际成本接近零(仅需GPU算力),单条数据成本约为真机采集的万分之一。但Sim-to-Real Gap(仿真到现实的性能落差)仍是核心挑战,域随机化、系统辨识、真实数据微调是主要应对手段。
| 数据来源 | 占比 | 成本 | 质量 | 典型用途 |
|---|---|---|---|---|
| 仿真合成数据 | ~55% | 近零边际成本 | 中(有Sim2Real Gap) | 预训练、长尾场景覆盖、罕见/危险任务 |
| 遥操作采集 | ~20% | ~$118/小时 | 高(真实物理) | 高价值任务精调、关键技能示范 |
| 互联网视频 | ~12% | ~$0.5/小时 | 低-中(无动作标签) | 视觉表征预训练、任务理解 |
| 真机自采 | ~8% | 中(含硬件折旧) | 高(真实交互) | 部署后持续学习、数据闭环 |
| 公开数据集 | ~5% | 免费 | 参差不齐 | 基准测试、跨本体研究 |
全球具身智能AI软件市场(含大模型授权、训练算力服务、仿真平台、端侧推理软件,不含硬件芯片)2025年约44亿美元,预计2030年达230亿美元,2025-2030年复合增长率约39%。其中:
中国市场方面,2026年国内人形机器人出货量约10万台,单台AI系统(算力芯片+存储+算法软件)价值量约1.5-2.5万元,对应硬件+软件市场约15-25亿元。若计入训练服务、仿真平台和云算力,整体AI赋能市场约30-40亿元人民币。中国机器人产业整体市场(含传统工业机器人等所有品类)2025年约9150亿元,2026年预计突破1万亿元,但人形机器人专用AI软件仍是其中增速最快的细分领域。
以2026年量产目标价(整机BOM约11-12万元)为基准,AI系统(算力芯片+算法软件+存储)价值量分布如下:
| 细分部件 | 典型配置 | 单价(元) | 单台价值(万元) | 占AI系统 | 占整机BOM |
|---|---|---|---|---|---|
| 端侧AI算力芯片 | Jetson Thor T3000(主流量产) | 9000-13000 | ~1.1 | 57% | ~9% |
| 内存/存储 | LPDDR5X 32-64GB + eMMC | 1500-3000 | ~0.25 | 13% | ~2% |
| 算法软件授权 | VLA模型+SDK+工具链 | 2000-5000 | ~0.35 | 18% | ~3% |
| 辅助MCU/控制板 | 关节控制、电源管理 | 1000-2000 | ~0.15 | 8% | ~1.2% |
| 其他(散热、接口等) | — | 500-1000 | ~0.08 | 4% | ~0.7% |
| AI系统合计 | ~1.93 | 100% | ~16% | ||
参照手机和汽车行业的成熟经验,芯片成本占整机比例在5%-10%区间。人形机器人当前处于早期,AI算力芯片占比偏高(约9%),随着量产规模扩大和芯片降本,预计2028-2030年将降至5%-7%。算法软件授权(约3%)则可能随着模型标准化和开源化而下降,但增值服务(数据闭环、OTA升级)占比可能提升。
NVIDIA是唯一覆盖"模型(GR00T)+芯片(Jetson Thor)+仿真(Isaac Sim/Lab)+世界模型(Cosmos)+数据生成(GR00T Blueprint)"全链路的厂商。GR00T N1.7已开源,支持多家人形本体,Jetson Thor成为高端算力事实标准。NVIDIA的核心壁垒不是单一产品,而是CUDA生态+全栈工具链的锁定效应。
RT-X系列是跨机型通用VLA的先驱,第三代支持17种机器人本体、2000+技能。2026年8月发布Gemini Robotics 2全身智能模型,可在数小时内适配全新机器人硬件。谷歌的优势在于基础研究深度和数据积累,但商业化落地节奏慢于NVIDIA。
特斯拉Optimus采用与FSD同源的端到端神经网络,依托Dojo超算(2026年功耗规模从250MW扩至500MW,对应算力同步翻倍)和工厂真实数据闭环。自研AI5芯片(3nm/2nm,2250 TOPS)不外卖,形成完整的自研闭环。马斯克明确表示放弃分层架构,采用"输入像素,输出控制"的单一巨大神经网络。
Figure的Helix模型(7B System2+80M System1,200Hz)与OpenAI深度合作,Figure 02在BMW美国工厂试点已进入第三期,2026年产能目标12000台。Figure是"模型+本体"垂直整合的代表,数据自闭环速度最快。
智元GO-1是全球首个采用ViLLA(Vision-Language-Latent-Action)架构的通用具身模型,预训练GPU时长仅为OpenVLA的1/20,LIBERO-Goal基准(10%数据)达62.4%(业界基准11.6%)。2026年3月累计下线10000台(远征A3),目标积累1000万小时数据,是国内量产和数据闭环的领先者。
2026年6月发布千问具身智能大模型Qwen-Robot系列(灵曦),包含VLA操作模型Qwen-RobotManip、VLN移动模型Qwen-RobotNav、世界模型Qwen-RobotWorld三大模型,1300亿参数开源,是国内首个完整的具身智能模型矩阵。阿里的优势在于通义大模型基座和云算力基础设施。
宇树自研UnifoLM大模型,结合其高性价比本体(G1/H1),在消费级和教育市场占据优势。宇树是NVIDIA Jetson Thor的首批部署厂商之一,也是奥比中光3D视觉的核心客户。
| 厂商 | 核心布局 | 核心优势 |
|---|---|---|
| 华为 | 昇腾算力+盘古具身大模型 | 国产算力全栈,昇腾310/910,盘古大模型基座 |
| 百度 | 文心具身智能+ Apollo技术迁移 | 自动驾驶技术向机器人迁移,文心大模型 |
| 商汤/旷视 | 视觉大模型+机器人感知 | 计算机视觉积累深厚,感知算法强 |
| 银河通用 | 通用人形机器人+自研VLA | 天准科技域控制器合作,本体+模型垂直整合 |
| Physical Intelligence (π) | π0/π0.5通用操作模型 | Flow Matching精细操作,openpi开源,谷歌投资 |
| OpenAI | GPT系列向物理世界迁移 | 与Figure深度合作,机器人+AGI联合团队 |
System 1(快回路)和System 2(慢推理)的协同是核心难点:两者的频率差异(200Hz vs 10Hz)、动作空间统一、延迟控制、安全切换都需要精细设计。目前仅GR00T、Helix、GO-1等少数模型实现了成熟的双系统协同。
"收拾房间"等复杂任务需要多步推理和全身协同控制,涉及操作(手臂)+移动(腿部)+平衡(全身)的联合优化。谷歌Gemini Robotics 2和特斯拉端到端模型在这方面领先,但仍是行业级难题。
数据是具身智能的核心资产。特斯拉(工厂真实数据)、Figure(BMW工厂试点)、智元(万台量产)拥有数据自闭环优势,而纯模型公司缺乏真机数据,只能依赖仿真和公开数据集。"产能即数据"是2026年的核心逻辑——量产能力直接决定数据积累速度。
仿真数据虽然成本低,但与真实环境存在物理差距(摩擦力、柔性物体、光照等)。域随机化、系统辨识、真实数据微调是主要手段,但Sim-to-Real Gap仍是制约仿真数据大规模应用的核心瓶颈。
在功耗限制(30-130W)下运行2B-7B甚至更大的VLA模型,需要模型量化(INT4/FP4)、剪枝、蒸馏、KV Cache优化等技术。NVIDIA TensorRT和CUDA生态在这方面积累深厚,国产芯片的软件栈仍需追赶。
GR00T N1.7、π0.5(openpi)、GO-1、阿里灵曦等主流模型已开源,VLA基座模型正走向"免费开源+增值服务"的商业模式。未来竞争焦点将从模型本身转向数据闭环、场景适配和商业化落地。开源模型将大幅降低中小厂商的研发门槛,加速行业普及。
人形机器人AI推理正从"云端+边缘"向"纯端侧"迁移,以降低延迟和保护隐私。NVIDIA Jetson Thor已实现端侧70B级模型推理,特斯拉AI5、沐曦+优必选合资芯片等专用方案加速落地。预计2027-2028年,端侧专用AI芯片将成为人形机器人的标配。
仿真合成数据占比已达55%,且持续提升。NVIDIA Cosmos、阿里Qwen-RobotWorld等世界模型可从文本/图像生成物理一致的仿真环境和运动轨迹,大幅降低数据成本。世界模型+VLA的结合,有望在2027-2028年实现"零样本"新任务泛化。