ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

软银60亿美元押注1X:人形机器人具身智能技术路线与开发实践

软银60亿美元押注1X:人形机器人具身智能技术路线与开发实践 一笔60亿美元的投资把已经持续火热的人形机器人赛道又一次推向舆论高点。软银创始人孙正义通过旗下基金大手笔押注挪威机器人公司1X Technologies外界的第一反应往往是“资本又回来了”。但如果你只把这当成一条融资新闻就会错过真正重要的信号孙正义押注的并不是某个具体的机器人型号而是一条“先场景、后形态、再AI大脑”的具身智能商业化路线。这篇文章不打算讨论谁赚谁亏而是想从技术开发者的视角拆解几个更实际的问题1X到底做了什么让老辣的孙正义愿意掏出真金白银它和波士顿动力、特斯拉Optimus的技术路线差异在哪如果你是一位机器人工程师或AI开发者现在入局人形机器人应该先补哪些技能、跑通哪些流程、避开哪些坑读完这篇文章你能对人形机器人行业的技术栈建立一份比较完整的判断框架也可以直接照着后半部分的示例在本地搭建一个最小可用的具身智能开发环境。1. 这笔投资到底投了什么人形机器人的技术分水岭先从新闻本身说起。据多家媒体报道软银在本轮融资中投入约60亿美元直接推动1X Technologies的估值进入百亿美元俱乐部。公开资料显示1X Technologies成立于2014年总部在挪威前身是Halodi Robotics。这家公司早期做过远程操作机器人后来逐步转向自主具身智能方向旗下两条产品线分别是轮式机器人EVE和双足人形机器人NEO。EVE定位非常明确它没有双腿而是采用轮式底盘主要面向安保巡逻、仓储物流、远程巡检等商业场景已经有实际客户落地使用。NEO则是在2024年8月发布的双足人形机器人2025年推出面向家庭场景的NEO Home版本希望通过订阅制模式进入消费者市场。从公开信息看1X还搭建了名为1X World的机器人数据平台并推出了MindStudio技能训练平台。简单说EVE负责在真实世界里跑业务、攒数据NEO负责探索家庭场景的长期想象力1X World和MindStudio负责把这些数据变成可复用的机器人技能。这笔投资真正值得关注的地方不是“孙正义又回来了”而是它确认了一个技术判断人形机器人的竞争已经从“谁的关节电机更厉害”转向“谁的AI数据飞轮转得更快”。如果只看硬件参数1X未必比波士顿动力Atlas更惊艳但如果看商业化路径和数据闭环1X选择的路线可能是目前最接近“可真实落地”的一种。对普通开发者来说这条新闻意味着两件事。第一人形机器人不再只是实验室里的运动控制难题而是变成了一个“AI模型机器人硬件数据平台”的复合工程问题。第二这个赛道正在从“少数巨头玩得起”变成“有AI和机器人基础的人都能参与”的技术生态1X World、MindStudio这类平台的出现本质上是在降低开发门槛。2. 1X的技术路线为什么它和波士顿动力、特斯拉不一样要理解1X的差异化最好的方式是把头部人形机器人公司放在一起横向对比。公司/产品代表产品技术侧重点商业化方向波士顿动力Atlas运动控制、动态平衡、液压/电驱偏研究展示早期军事/工业探索特斯拉Optimus纯电驱、依托车企供应链、FSD自动驾驶技术迁移工厂搬运、家庭服务FigureFigure 02OpenAI大模型接入、通用对话与规划工业仓储、通用任务1X TechnologiesEVE、NEO轮式先商用、双足后家庭、云端数据平台安保、仓储、家庭订阅波士顿动力代表了“运动能力优先”的路线他们在双足动态行走、翻滚、跳跃等极限运动控制上积累了深厚壁垒但商业化始终是难题。特斯拉Optimus最大的优势在于工程化成本和供应链能力希望用造车的思路把机器人成本打下来。Figure选择了更激烈的“大模型通用人形”路线直接接入OpenAI生态强调机器人的理解与对话能力。1X的路线和以上几家都不太一样它的核心思路可以概括为“场景优先级”。第一先用轮式机器人EVE进入安保、仓储、巡逻这类任务边界相对清晰、安全性容易控制的场景在真实环境中积累运行数据第二在EVE跑通商业闭环后再去攻克双足人形NEO的家庭场景第三用1X World集采全球机器人数据通过MindStudio训练和迭代技能形成一个持续增强的数据飞轮。如果只看产品形态很多人会误以为“1X做不出好的双足才先用轮式”。实际上这个顺序背后有非常现实的技术逻辑轮式方案在稳定性、能耗、安全性上远优于双足能更快在真实场景部署而真实场景的数据恰恰是训练复杂任务能力最稀缺的资源。1X先选场景再选形态最后围绕场景搭AI能力这条顺序和“先做双足机器人再去找应用场景”的传统思路完全相反。这里还要澄清一个常见误解大模型在1X机器人中的作用并不是让机器人“自己思考”那么简单。NEO和EVE接入OpenAI模型后主要解决的是任务理解、子任务拆解和对话交互的问题底层运动控制仍然依赖经典的机器人控制算法和强化学习策略。大模型更像是机器人的“大脑皮层”负责把模糊的自然语言命令翻译成可执行的技能序列而具体的关节控制、路径规划依然是机器人工程师熟悉的控制框架。3. “大脑”才是核心具身智能在人形机器人中的真实工作流程“具身智能”这四个字最近被反复提起但它到底在机器人里怎么工作很多开发者还只有一个模糊的概念。通俗地说具身智能就是让AI模型不再停留在文字和图片里而是进入一个能感知、能行动、能反馈的物理身体中。在1X机器人这类产品中一条典型的工作流程是这样的第一多模态感知。机器人通过摄像头、深度传感器、关节角度编码器、触觉传感器等硬件获取周围环境的空间信息、物体位置、自身姿态和受力情况。第二任务理解。用户通过自然语言发出指令比如“把桌子上的杯子拿到厨房台面”大模型接收文本和视觉信息后理解当前场景并将任务拆解成“导航到桌子”“识别杯子”“抓取杯子”“移动到厨房”“放下杯子”等子任务。第三技能调用。每个子任务对应一个经过训练的动作技能这些技能可能来自仿真训练也可能来自1X World平台收集的真实遥操作数据。第四运动执行。机器人控制器根据技能库的指令结合当前传感器状态实时生成关节运动轨迹并通过电驱系统执行。第五失败反馈与重规划。如果抓取失败或物体突然移动机器人需要重新感知环境调整动作策略而不是机械地重复原计划。这和传统工业机器人的开发方式有本质区别。传统方式下开发人员需要为每个动作编写明确的规则和路径机器人几乎没有环境适应能力。而具身智能模式下开发者只需要提供足够多的示教数据和任务描述大模型负责泛化理解技能库负责提供可复用的动作能力整个系统可以在新任务上更快适应。但这条路也远没有宣传中那么成熟。模型幻觉在机器人上同样存在大模型可能错误地理解物理规则比如认为杯子可以穿过墙壁、认为抓取易碎品可以用蛮力真实场景的数据采集成本极高遥操作虽然能采集数据但速度和效率远远不能满足大规模训练需求还有安全性问题家庭环境里存在大量非结构化因素一个动作失误可能造成财产损失甚至人身伤害。这些挑战在1X World和MindStudio的架构里得到了一定程度的缓解但并没有完全消除。从工程角度看具身智能的瓶颈通常不在模型层而在数据闭环。模型参数可以快速迭代但真实机器人数据的采集、清洗、标注、增强、训练、部署是一个极其漫长的工程链路。1X选择让EVE先在实际商用场景中跑起来本质上是想用商业收入来补贴数据采集成本让数据飞轮先转起来。4. 为什么是现在资本、大模型与机器人硬件的交汇点人形机器人并不是一个新概念。过去二十年里这个赛道经历过好几轮资本热潮也倒下过一批公司核心原因无外乎三个成本太高、场景太窄、AI泛化能力不足。很多原型机器人能走出实验室却无法在真实环境中稳定工作最终只能停留在展示阶段。那为什么偏偏是现在资本开始大规模回归根本原因是三个技术变量的同时成熟。第一大模型让机器人有了任务理解能力。过去机器人只能执行程序员预先定义好的指令。现在VLM视觉语言模型和LLM大语言模型可以让机器人理解自然语言、识别视觉场景、推理任务步骤。这意味着机器人不再需要为每一个新任务重新编写逻辑泛化能力有了质的提升。第二硬件成本快速下降。电机、减速器、传感器、电池等核心部件的成本在过去几年持续下降尤其是国内供应链的成熟让人形机器人的硬件成本从“百万级”逐步逼近“十万级”。第三仿真到真实迁移技术逐渐可用。Isaac Sim、MuJoCo等仿真平台让开发者可以在虚拟环境中大量训练技能再通过域随机化等技术迁移到真实机器人上大幅降低了训练成本。从资本端看孙正义的逻辑不难理解。他早年投资OpenAI深知模型能力的价值现在他把注意力转向机器人本质上是想找一个新的“AI载体”。手机是移动互联网的入口汽车是自动驾驶的入口而人形机器人有可能成为具身智能时代的物理入口。软银同时投资AI模型公司和人形机器人公司就是想在这个入口上占据位置。这并不意味着高估值等于技术成熟。从1X的公开演示看NEO Home确实展示了叠衣服、煮咖啡、物品整理等家庭任务但视频展示距离规模化量产还有相当距离。行业里也有不少质疑声音认为人形机器人的商业化仍然面临安全性、成本、可靠性等多重障碍。资本可以买来迭代时间但买不来商业化的确定性。5. 开发者视角从零开始入局人形机器人需要掌握的技能栈如果看完前面的分析你决定开始关注或入局人形机器人开发那么真正的问题来了该从哪里开始从技术架构上看人形机器人开发可以分成五个层次第一层AI模型层。这一层负责感知、理解、规划常用工具包括OpenCV、PyTorch、HuggingFace Transformers等需要掌握LLM/VLM的基础调用和微调方法。第二层机器人中间件层。ROS 2是目前机器人领域事实上的中间件标准负责进程通信、数据分发、节点管理。第三层控制层。负责关节控制、运动规划、碰撞检测常用工具包括ROS 2 Controller Manager、MoveIt 2等。第四层仿真层。在部署到真实硬件之前先用仿真环境跑通流程常用工具包括MuJoCo、NVIDIA Isaac Sim、Gazebo等。第五层硬件层。包括电机、传感器、嵌入式开发常用工具包括Arduino、STM32、CAN总线调试工具等。对新手来说最友好的入局路径不是直接买一台人形机器人而是先用ROS 2搭建一个仿真工作环境跑通“感知-规划-控制”的标准流程。原因很简单人形机器人平台价格高、维护复杂、安全要求高直接在真机上调试的试错成本太大。而仿真环境可以让你快速理解机器人系统的数据流和控制流等基础扎实后再迁移到真机上。编程语言方面Python和C是两大主力。Python适合算法原型、AI模型调用、数据脚本处理C适合底层控制、实时通信和高性能模块。建议先掌握Python再根据项目需要补充C。如果目标是进入像1X这样的具身智能公司最值钱的技能其实不是单一算法而是理解“数据链路”的能力。从传感器数据采集、数据标注到模型训练、仿真验证再到真机部署和反馈闭环这整条链路你都应该能跑通。6. 一条完整的技术链路感知、规划、执行与验证示例这一节用一个最小可运行的示例演示人形机器人技能开发过程中的数据流和控制流思路。需要说明的是这个示例不是1X官方SDK的用法而是以通用机器人开发流程为骨架帮助你理解系统架构。实际项目中你需要替换成具体平台的接口和业务逻辑。6.1 示例一ROS 2 最小工作空间搭建ROS 2是当前多数机器人项目的首选中间件。开始之前请先确认已经安装好ROS 2Humble或Jazzy版本均可本文示例以Humble写命令。如果还没有安装可以参照ROS 2官方安装文档完成基础安装。新建工作空间并编译# 创建ROS 2工作空间 mkdir -p ~/humanoid_ws/src cd ~/humanoid_ws # 编译工作空间 colcon build # 加载环境变量 source install/setup.bash这一步成功之后说明你的机器人开发基础环境已经可用。src目录用来放功能包install目录存放编译产物。在实际项目中你会把感知、规划、控制等模块拆分成不同的功能包放在src目录下统一维护。6.2 示例二感知-决策-控制流程骨架下面是一个简单的Python示例演示了感知、决策、控制三个模块的低耦合设计思路。文件路径为~/humanoid_ws/src/skill_demo/skill_demo/skill_loop.py#!/usr/bin/env python3 import rclpy from rclpy.node import Node from sensor_msgs.msg import Image from geometry_msgs.msg import PoseStamped class PerceptionModule: 感知模块负责从传感器数据中提取环境信息 def get_object_pose(self, image_msg): # 在实际项目中这里会调用视觉模型得到目标物体的位置 # 这里仅返回一个示例位姿 pose PoseStamped() pose.header.frame_id camera_link pose.pose.position.x 0.5 pose.pose.position.y 0.1 pose.pose.position.z 0.8 return pose class DecisionModule: 决策模块根据任务指令和感知结果生成技能序列 def __init__(self, llm_clientNone): # llm_client可以是任意大模型接口实际项目中可注入 self.llm_client llm_client def plan_skill_sequence(self, task_desc, object_pose): # 在实际项目中这里会调用大模型将自然语言任务拆解为技能序列 skills [navigate_to_table, grasp_cup, move_to_kitchen, place_cup] return skills class ControlModule: 控制模块执行单个技能并返回执行结果 def execute_skill(self, skill_name, object_pose): # 在实际项目中这里会调用运动控制接口执行动作 print(fExecuting skill: {skill_name}) return True class SkillLoopNode(Node): def __init__(self): super().__init__(skill_loop_node) self.perception PerceptionModule() self.decision DecisionModule() self.control ControlModule() def run_task(self, task_desc, image_msg): # 1. 感知 object_pose self.perception.get_object_pose(image_msg) # 2. 决策 skills self.decision.plan_skill_sequence(task_desc, object_pose) # 3. 执行 for skill in skills: success self.control.execute_skill(skill, object_pose) if not success: self.get_logger().warn(fSkill failed: {skill}) break def main(argsNone): rclpy.init(argsargs) node SkillLoopNode() rclpy.spin(node) rclpy.shutdown() if __name__ __main__: main()这段代码把整个流程分成了三个独立模块。PerceptionModule负责把图像数据转换成物体位姿DecisionModule负责根据任务描述和感知结果生成技能序列实际项目中这里会接入LLM/VLMControlModule负责逐个执行技能并返回结果。这样的分层设计让你能在不改变整体架构的前提下更换某个模块的具体实现。6.3 示例三配置文件与仿真验证在实际项目中机器人参数通常通过配置文件管理。创建一个robot_skill.yamlrobot: name: neodemo max_linear_speed: 0.5 # m/s max_arm_force: 40.0 # N gripper_timeout: 3.0 # s skill_grasp: approach_height: 0.15 # m pre_grasp_distance: 0.10 # m force_threshold: 8.0 # N在仿真环境里运行时可以用ros2 param load加载配置并用ros2 topic echo确认感知数据是否正常发布# 加载配置文件实际项目中需配合param server使用 ros2 param load /skill_loop_node robot_skill.yaml # 查看感知话题的消息频率确认传感器数据流正常 ros2 topic hz /camera/image_raw # 查看规划结果指令是否正常下发 ros2 topic echo /skill_loop_node/skill_command如果仿真环境里任务执行正常就可以将这个流程迁移到真实机器人平台上。需要提醒的是仿真到真实的迁移过程中环境的物理差异往往会造成很大的性能落差这一步是实际开发中最容易踩坑的地方。7. 常见开发问题与排查方法人形机器人开发过程中的问题远比普通软件项目复杂因为问题可能出现在硬件、控制、AI、通信任意一层。下面列出几个高频问题以及对应的排查思路。问题现象可能原因排查方式解决方案仿真中动作流畅真机执行失败仿真与真实环境差距较大sim-to-real gap对比仿真模型与真实机器人物理参数增加域随机化用真实遥操作数据微调大模型给出错误的任务拆解提示词设计不合理或视觉上下文缺失记录输入输出日志检查视觉输入是否完整补充多模态信息使用few-shot示例增加规则约束ROS 2节点间通信延迟高DDS配置不当、网络带宽不足查看ros2 topic hz和节点CPU占用调整QoS策略降低传感器频率优化网络配置机器人安全停靠异常碰撞检测阈值设置不合理检查传感器原始数据确认急停逻辑设置多级安全阈值确保硬件急停优先级最高数据采集效率低依赖人工遥操作数据速度慢统计采集数量和耗时引入半自动采集、合成数据增强、自动标注工具排查这类问题时最重要的习惯是“分层定位”。先确认底层硬件和传感器正常再检查中间件通信最后再看AI模型逻辑。不要一上来就怀疑模型的问题很多时候系统的根因可能只是一个角度编码器校准错误。8. 最佳实践与工程建议结合1X的技术路线和行业通用经验这里整理几条对实际项目有帮助的建议。第一场景优先先选场景再选形态。不要为了“像人”而做双足轮式、履带式、四足方案在很多场景里都比双足更稳定、更便宜、更安全。1X先做轮式EVE再上双足NEO就是这个逻辑。第二尽早建立数据飞轮。机器人项目的核心竞争力不是某一次训练的loss降了多少而是能否持续获取真实场景数据并在数据闭环中不断迭代技能。第三安全冗余永远放在第一位。人形机器人要进入家庭和商业场景硬件急停、软限位、力控阈值、碰撞检测这些环节不能有侥幸心理。第四重视日志和可观测性。用ROS 2的bag工具记录所有传感器数据和控制指令出现问题时可以回放分析这对排查复杂问题非常重要。第五做好版本管理。机器人项目涉及模型、代码、硬件配置、仿真环境等多个维度建议使用Docker封装开发环境用Git管理代码用配置文件统一管理参数。对团队协作来说建议按AI模型组、控制算法组、硬件驱动组、数据平台组划分职责并在交付节点用统一仿真环境做集成测试。大型机器人项目里最怕的是各个模块各自开发、最后联调时出现问题导致责任边界模糊。9. 总结与后续行动建议孙正义60亿美元押注1X表面上是资本对一家机器人公司的认可本质上是对“具身智能数据飞轮”路线的投票。1X用EVE证明了轮式机器人可以先商业化用NEO展示了双足人形机器人的家庭场景想象力用1X World和MindStudio搭建了数据训练平台。这三件事组合起来形成了一个闭环商业场景产生数据数据训练技能技能反哺产品。这种模式能否跑通还需要时间和市场验证但至少从技术演进方向看它比“先造一个完美双足机器人”更务实、更可落地。如果你看完这篇文章决定开始动手我的建议是这周先在本地装好ROS 2跑通一个机器人仿真环境完成一次最简单的物体识别和运动规划。然后试着把自己的视觉语言模型接入到一个仿真机器人上让它理解自然语言指令并完成任务拆解。之后再去关注像1X、宇树、智元、Figure这样的公司发布的技术公开资料。人形机器人的核心技术栈归根结底还是AI、控制和系统工程三件事把这三件事打扎实无论行业风向怎么变你都不会落后。建议收藏这篇文章后续上手的时候可以作为一份技术路线参考。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进