ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

人形机器人技术评估指南:从运动控制到量产交付的横评方法论

人形机器人技术评估指南:从运动控制到量产交付的横评方法论 人形机器人赛道正处在“宣传声量”与“技术成熟度”明显错位的阶段。国内头部厂商宇树和优必选的一举一动都会进入行业新闻而“谁是全球第一”也被频繁讨论。但真实的工程问题不是口号能解决的一台人形机器人能不能稳定行走、能不能在复杂场景里完成任务、能不能持续量产都需要一层层拆开看。这里不打算替任何一家厂商下结论而是提供一套可复用的技术坐标系把“全球第一”的争论转换成技术验证问题。看完这篇文章你会理解为什么出货量、市占率、股价波动都不能直接等于技术实力也会拿到一份可以自己执行的人形机器人横评与排查清单。1. 为什么人形机器人行业的“全球第一”很难直接比较1.1 “销量”和“市占率”背后的统计口径差异人形机器人不是手机。手机销量看激活量但人形机器人的“销量”可能按发货量、订单量、合同金额甚至演示场次来统计。不同统计口径下同一家公司的“第一”可以得出完全相反的结果。在行业交流中经常会出现几种口径统计口径常见含义容易被忽略的问题出货量实际交付到客户手中的数量没有区分科研机、演示机、准量产机订单量双方签约但未必交付的数量可能包含样机、合作意向、可撤销订单合同金额含设备、服务、系统集成的总金额人形机器人常以项目制交付金额差异极大媒体声量发布会观看量、讨论热度、演示视频播放量与量产能力、稳定性没有直接关系研发实力论文、专利、技术报告数量数量不等于工程转化能力所以当看到“出货量第一”“市占率第一”这类表述时第一反应应该是追问统计范围是什么统计时间是什么统计对象是整机、关节模组还是包含服务项目这一追问能避开大部分宣传口径陷阱。1.2 当前人形机器人的三类真实形态另一个“难比较”的原因是人形机器人市场里同时存在三种形态差异巨大的产品。展示原型主要出现在发布会、展会和宣传视频中。它证明的是技术可行性不是稳定交付能力。开发平台面向高校、研究机构和企业实验室核心价值是开放 SDK、调试工具和底层接口强调“能二次开发”。准量产产品已经有一定规模交付能在限定场景中执行任务但距离消费电子产品那样的一致性和可靠性还有很远的距离。这三类形态对应完全不同的考核指标。拿展示原型的 demo 去对比准量产产品的交付能力本身就不公平。反过来拿量产产品的稳定性要求去约束一台实验室原型机也不合理。产品形态目标用户交付物考核重点展示原型媒体、投资人、行业展会演示视频、现场表演动作复杂度、展示效果开发平台高校、研究所、算法团队整机、SDK、技术文档、仿真环境开放性、调试效率、软硬件接口准量产产品企业客户、集成商、试点场景整机、售后、培训、运维方案可靠性、连续运行时间、故障恢复1.3 “第一”取决于你问的是哪一个维度同一家公司在不同维度下的位次可能完全不同。比如甲公司在四足机器人领域积累了很久它的人形产品可能更强调成本控制和批量交付乙公司长期做全尺寸人形机器人它可能更强调商用场景和整体交付能力。二者谁更“第一”取决于你关心的是科研开发效率、商用项目完整性还是短期资本关注度。二级市场的估值波动反映的是资本市场对远期空间的预期修正与当前产品真实能力并不完全同步。把股价和“全球第一”画等号很容易得出失真结论。判断一家机器人公司是否领先不要只读发布会材料要落到具体技术层和可复现实验上。2. 把“全球第一”拉回到技术坐标系五层技术栈拆解人形机器人是一个复杂的软硬件系统。要比较首先要拆解。结合行业通用做法可以把它分为五层本体结构、关节执行器、运动控制、感知与定位、具身智能决策。2.1 本体结构自由度数量只是起点自由度DoFDegrees of Freedom经常被当作宣传点比如“这款机器人有 40 个自由度”。但自由度数量不等于智能化程度。真正关键的是自由度分布。一条 1.2 米高的人形机器人腿部可能占 12 到 14 个自由度手臂可能占 12 个自由度腰部、头部再各占一部分。自由度分布不合理会出现“手臂灵活但走路摇摆”的情况。在项目中描述机器人结构时可以用结构化数据来管理自由度配置。下面是一个简化的机器人自由度描述示例{ robot: humanoid-eval-01, version: 0.1.0, legs: { left: { hip_yaw: 1, hip_roll: 1, hip_pitch: 1, knee_pitch: 1, ankle_pitch: 1, ankle_roll: 1 }, right: { hip_yaw: 1, hip_roll: 1, hip_pitch: 1, knee_pitch: 1, ankle_pitch: 1, ankle_roll: 1 } }, arms: { left: { shoulder_pitch: 1, shoulder_roll: 1, shoulder_yaw: 1, elbow_pitch: 1, wrist_pitch: 1, wrist_yaw: 1 }, right: { shoulder_pitch: 1, shoulder_roll: 1, shoulder_yaw: 1, elbow_pitch: 1, wrist_pitch: 1, wrist_yaw: 1 } }, waist: { yaw: 1, pitch: 1 }, neck: { yaw: 1, pitch: 1 } }这段 JSON 表达的核心信息是自由度不仅要有数量还要有“怎么分配”的计划。在评估一台人形机器人时要先看它是为行走优化、上肢操作优化还是两者兼顾。2.2 关节执行器机器人的“肌肉”比自由度更关键关节执行器通常由电机、减速器、编码器、驱动器组成。它决定机器人能不能输出足够的力、够不够稳、会不会发热。评估关节执行器时重点看几个参数参数含义对整机的影响峰值扭矩短时间能输出的最大扭矩决定跳跃、快速蹲起、冲击场景能力连续扭矩长时间稳定输出的扭矩决定持续行走、搬运等真实任务能力力矩控制精度输出力矩与目标力矩的误差影响柔顺控制、抗扰能力关节带宽力矩响应速度影响动态动作的执行质量一个常见误区是只看峰值扭矩不看连续扭矩。峰值扭矩高只能说明关节“能冲一下”如果散热不行连续工作几分钟后力矩就会明显衰减。这也是很多原型机“演示时很强连续运行时掉链子”的原因之一。2.3 运动控制决定能不能走稳的核心层运动控制层负责把上层规划出的动作指令转换成关节力矩。人形机器人双足行走在控制上比轮式机器人复杂得多因为系统是欠驱动的、不稳定的且容易受到地面接触变化影响。常见的控制思路包括逆运动学IKInverse Kinematics根据末端目标位置计算关节角度。模型预测控制MPC在有限时间窗口内求解最优控制输入。全身控制WBCWhole-Body Control综合所有关节约束分配接触力。强化学习RL让策略网络通过仿真和实机学习行走与操作策略。下面是一个简化版的逆运动学求解示意用来理解“末端位置到关节角度”的计算过程import numpy as np def solve_ik_leg(target_position, leg_lengths, initial_angles, max_iter100, tol1e-6): 简化腿部逆运动学求解示例。 target_position: 脚踝目标位置 [x, y, z] leg_lengths: 大腿、小腿长度 initial_angles: 髋、膝、踝初始角度 theta np.array(initial_angles, dtypefloat) l_thigh, l_shank leg_lengths for _ in range(max_iter): # 根据当前关节角计算脚踝位置简化几何模型 x l_thigh * np.sin(theta[0]) l_shank * np.sin(theta[0] theta[1]) y 0.0 # 简化忽略侧摆 z - (l_thigh * np.cos(theta[0]) l_shank * np.cos(theta[0] theta[1])) # 当前误差 err np.array([x, y, z]) - np.array(target_position, dtypefloat) if np.linalg.norm(err) tol: return theta # 简化雅可比矩阵仅用于说明 J np.array([ [l_thigh * np.cos(theta[0]) l_shank * np.cos(theta[0] theta[1]), l_shank * np.cos(theta[0] theta[1]), 0], [0, 0, 1], [l_thigh * np.sin(theta[0]) l_shank * np.sin(theta[0] theta[1]), l_shank * np.sin(theta[0] theta[1]), 0] ]) # 伪逆更新 delta_theta np.linalg.pinv(J) err theta delta_theta return None # 未收敛表示目标位置可能超出工作空间 result solve_ik_leg( target_position[0.2, 0.0, -0.5], leg_lengths[0.4, 0.4], initial_angles[0.3, 0.6, 0.0] ) print(result)这段代码描述的不是完整机器人控制方案而是运动控制层最常见的起点。实际项目中IK 只是第一步后面还要考虑力矩约束、接触力约束、地面反作用力等。也就是说“能算出关节角度”和“机器人走得稳”之间隔着很多工程细节。2.4 感知与定位机器人必须知道“自己在哪”人形机器人要在真实环境中工作必须知道自己在哪里、周围有什么。这个任务由激光雷达、深度相机、IMU惯性测量单元、关节编码器等传感器共同完成。传感器数据的质量直接影响控制效果。比如 IMU 的噪声参数如果设置不正确滤波器可能会发散导致机器人对自身姿态估计失真进而产生错误控制指令。下面是一个典型的状态估计参数示例imu: accel_noise_density: 0.001 accel_random_walk: 0.0002 gyro_noise_density: 0.0001 gyro_random_walk: 0.00001 update_rate_hz: 200 lidar: range_min_m: 0.1 range_max_m: 20.0 update_rate_hz: 10 slam: map_frame: map odom_frame: odom base_frame: base_link对这些参数要有一个基本概念噪声密度越小传感器数据越“干净”随机游走越大零偏漂移越难估计。实际部署时这些参数需要通过标定实验获得不能直接照搬配置文件。2.5 具身智能决策大模型接入只是最后一块拼图近两年大模型和具身智能结合成为焦点。机器人接入大模型后可以理解“帮我把桌上的杯子拿过来”这类自然语言指令并规划出大致动作序列。但这里有一个重要区分大模型负责的是任务规划不完全负责底层的电机控制。真实的人形机器人执行任务还要通过一个完整链路感知环境构建物体位置和空间关系。大模型或规则系统生成任务序列。规划器把任务分解为动作轨迹。运动控制层把轨迹转换为关节力矩。传感器反馈执行结果系统闭环修正。如果只看“机器人接入了大模型”这一点忽略感知、控制、闭环修正和数据闭环很容易被演示效果误导。评估具身智能能力更应该看任务失败后能否自动恢复数据回传是否完整策略是否能在同一场景中稳定复现3. 宇树与优必选的技术路线差异值得拆开看回到标题中的两家公司。对外界来说宇树和优必选经常被放在同一个“全球第一”话题下比较。但从产品形态和技术基因来看两家公司并不完全处于同一条路线上。3.1 宇树四足基因走性价比和量产路线宇树从四足机器人进入机器人市场在人形产品上沿用了相对务实的技术策略强调关键零部件自研、成本控制、批量交付和开发接口开放。这种路线带来的影响是产品价格更容易下探硬件架构较为紧凑适合高校、研究机构和中小团队作为二次开发平台使用。从技术影响来看这类产品的优势在于自研关节模组迭代速度快成本可控。软件和接口相对开放适合把算法团队自己的控制栈接进去。供应链管理经验可以从四足产品线迁移到人形产品。需要留意的部分是更开放的平台往往意味着客户需要自己集成更多环节现场服务和技术支持不一定像完整方案那样“交钥匙”。3.2 优必选全尺寸人形机器人深耕商业化场景优必选长期围绕全尺寸人形机器人做产品迭代重视商业化应用与产业生态合作。它的人形产品线通常尺寸更大、形态更接近“通用服务机器人”的设想适合展厅、导览、活动、教育展示等需要视觉冲击力的场景。这类路线的优势在于整机完整度高更接近“买回去就能用”的交付模式。面向商业用户的系统集成、售后和场景适配经验更丰富。大尺寸整机在演示、商业活动中更容易形成品牌效应。需要留意的部分是全尺寸人形机器人整机更大功耗、散热、制造成本和运输难度都会上升对现场运维要求也更高。3.3 两条路线对“谁更强”判断的影响如果按“科研二次开发易用性”来评价宇树这类开放平台往往更有优势因为研究团队希望拿到足够底层的接口来验证自己的算法。如果按“商业活动整体交付”来评价优必选这类全尺寸整机方案更完整客户不需要自己从零搭建系统。所以“全球第一”不能脱离场景来回答。一个合理的判断方式是先明确自己的需求是研发探索、商业展示、教育科研还是工业试点再带着需求去跑同一套评测清单。不要用产品发布会上的宣传定位替代自己的技术评估公开产品资料只代表厂商想让你看到的那一面。4. 建立一套可复用的人形机器人横评清单如果你需要在几个方案之间做选择或者只是想判断一家厂商的真实技术水位可以建立一套自己的横评清单。把“谁更强”这个模糊问题转化成可记录、可重复、可比较的数据表。4.1 横评维度从参数到实测的映射以下维度覆盖了从硬件到软件再到交付能力的主要环节。每一项都要记录“厂商宣传值”和“现场实测值”。维度关键指标获取方式注意事项本体结构自由度数量与分布查看规格书、询问自由度分配记录各部位自由度分布不只记总数关节执行器峰值扭矩、连续扭矩规格书、现场电流监控重点看连续扭矩和热性能运动控制控制频率、行走速度、抗扰能力现场实验让厂商在同样测试条件下复现感知能力传感器型号、点云精度、定位误差现场跑 SLAM 地图同一房间跑多次对比地图一致性决策能力任务成功率、恢复能力设计固定任务记录失败后是否能自动恢复开发接口SDK、ROS 2 支持、文档完整度查看文档、跑示例程序确认是否开放底层控制指令可靠性与维护平均无故障时间、维修方式询问客户案例关注现场运维响应时间成本整机价格、配件价格、服务费用询价对比时区分一次性费用和持续费用4.2 最小可执行的现场验证实验只看规格书远远不够。可以设计一组最小实验在厂商现场或自己的测试场地执行静态站立测试机器人空载站立 10 分钟观察有无明显漂移、抖动、关节过热报警。蹲起测试连续蹲起 10 次记录每次成功/失败以及关节温度变化。平地往返行走在固定距离内往返行走 5 次记录轨迹误差和行走耗时。抗扰测试在静止和行走状态下对机器人施加固定方向推力观察恢复能力。避障测试在路径上放置固定障碍物记录能否识别并绕行。每次测试都记录结构化数据方便横向比较timestamp,task,attempt,success,error_cm,power_w,joint_temp_c 2025-06-01T10:00:01Z,static_stand,1,true,0,420,38 2025-06-01T10:05:22Z,squat,1,true,1,510,42 2025-06-01T10:06:15Z,squat,2,false,3,530,444.3 仿真与实机结合验证人形机器人方案最好先在仿真环境里建立基线再迁移到实机。仿真能快速验证算法逻辑是否成立但仿真和实机之间存在 model gap。推荐做法是把同一套策略先在仿真环境里跑一遍记录成功率数据再在实机环境跑同样任务记录数据两组数据放一起对比能直观看出 sim-to-real 差距。如果仿真成功率高但实机成功率明显下降先检查系统辨识和传感器噪声参数而不是立刻调整控制策略。这在人形机器人项目中是常见的排查路径。5. 评估人形机器人时最常踩的四个误区这里补充一个更系统的排查视角。很多团队、投资人或采购方在对人形机器人做判断时会掉进几个重复出现的误区。| 误区 | 典型现象 | 真正原因 | 检查方式 | 处理建议 | | --- | --- | --- | --- | --- | --- | | 自由度越多越强 | “40 个自由度所以更先进” | 自由度分布不合理控制难度反而更高 | 查看各部位自由度分布图问是否支持力控 | 按任务需求匹配自由度配置 | | Demo 视频等于成熟度 | 发布会视频很流畅现场演示失败 | 展示环境受控可能经过多次编排或剪辑 | 要求现场复现并索要连续运行日志 | 制定明确验收标准按标准测试 | | 仿真跑通等于实机可用 | 仿真稳定实机抖动或摔倒 | 模型参数、时延、噪声、执行器饱和未对齐 | 对比仿真与实机日志中力矩输出 | 先做系统辨识再迁移模型 | | 接入大模型等于具身智能完成 | “接上大模型后机器人什么都能干” | 大模型做任务规划底层运动控制仍需闭环 | 设计失败恢复任务观察闭环能力 | 把大模型和控制系统分开验证 |5.1 误区一自由度越多越强自由度多确实可能让动作更灵活但也意味着成本更高、控制算法更复杂、故障点更多。一台 20 个自由度的机器人如果能稳定走完 100 米比一台 40 个自由度但只能演示 10 秒动作的机器人更接近实用。检查时先让厂商提供自由度分布表再对比关节类型和执行器指标。同一个部位的多个自由度如果都用低成本舵机实现和用高性能力矩电机实现完全不是一个等级。5.2 误区二Demo 视频等价于成熟度展示视频天然会选择最有冲击力的动作而且不展示失败镜头。评估前要在合同或验收标准里写明测试条件比如地面材质、负载重量、运行时长、环境光照和最大允许误差。“现场能不能完整复现一遍”是过滤 demo 视频最有效的问题。5.3 误区三仿真跑通等于实机可迁移仿真环境里的物理模型大多经过理想化处理摩擦、间隙、噪声、通信时延都被简化。迁移到实机时需要先做系统辨识测量实际关节的时延、摩擦系数、电机饱和区间、传感器噪声分布。一旦仿真实机差异明显优先检查物理参数是否与实际一致。控制频率是否一致。传感器噪声是否建模。电机力矩饱和是否限制。实机通信时延是否在控制环路内被建模。5.4 误区四接入大模型就是具身智能完成大模型能理解语义、生成计划但机器人能不能把计划变成可靠动作仍然依赖感知、规划、控制、反馈的完整闭环。评估时可以把“大模型计划能力”和“底层执行能力”分开测试先问大模型能不能给出合理任务序列再测运动控制层能不能稳定执行。如果机器人只在接到指令后按预置动画执行一次没有感知反馈和失败恢复那还只是“语音控制播放动作”距离具身智能还差得很远。6. 从实验室到现场工程化落地还要补哪些课做技术开发可以只看算法指标但把人形机器人放进展厅、园区或工厂会遇到完全不同的工程问题。6.1 功耗、散热与连续运行时间人形机器人的功耗通常较高尤其在行走、蹲起、搬运等重负载任务中关节会迅速发热。如果散热设计不足机器人可能工作十几分钟就必须停歇降温这在现场是致命问题。落地评估时要记录待机功耗。空载行走功耗。负载工作功耗。关节温度从常温到报警的时间。降温到安全温度所需时间。如果厂商没有这些数据可以自己实测或者要求对方提供同场景客户案例。6.2 数据接口与二次开发能力人形机器人不是家电很多场景需要二次开发。要关注是否提供 SDK 或 API。是否支持 ROS 2 生态。关键传感器数据是否可读。底层控制指令是否开放。文档是否完整。下面是一个 ROS 2 启动示例实际项目中需要根据厂商发布包调整ros2 launch humanoid_bringup base.launch.py ros2 topic list ros2 topic echo /robot/state/joint_states能实时读取关节状态是后期调试、故障排查、算法开发的基础。如果接口只开放高层功能无法读取底层状态很多优化工作都做不了。6.3 安全策略与现场可维护性人形机器人是强动力设备进入人员密集场景前必须评估安全机制碰撞检测响应时间是多少。是否有多级急停。断电时关节是否具备自锁或缓冲。维修时关键模块是否模块化更换。是否有远程诊断和日志回放功能。这些内容直接决定现场出事后的止损能力。把“展会上没撞到人”当作安全证明风险很高。6.4 可复用落地检查清单下面这份清单可以用于选型或验收阶段自由度和关节类型是否匹配任务需求。连续工作 1 小时以上是否不出现过热降载。平地行走轨迹误差是否在可接受范围。环境变化后能否重新建图并定位。任务失败后能否自动恢复或安全停止。是否提供完整 SDK、文档和示例程序。是否开放底层数据读取接口。是否有急停、碰撞检测和断电保护。关键部件是否模块化支持现场更换。厂商是否有真实客户案例且案例场景与自己的需求接近。7. 想进入这个领域可以从哪些层面开始学习对于刚接触人形机器人的人来说直接买一台整机成本太高也不是唯一路径。可以从仿真和运动控制小闭环开始。7.1 没有实体机器人时先从仿真入手人形机器人避不开刚体动力学、接触力和优化控制。可以先在仿真环境里理解这些概念再尝试把训练好的策略迁移到实机。常见的开源/学术工具有 MuJoCo、Gazebo、Isaac Lab 等具体选型要看团队熟悉的技术栈。基于仿真环境可以完成一个最小强化学习训练流程创建一个人形机器人模型。定义行走方向奖励、姿态稳定奖励、能耗惩罚。用强化学习训练策略。在仿真中验证站立、行走成功率和抗扰能力。记录训练曲线和失败样本。下面是一个简化训练循环示例for epoch in range(1000): obs env.reset() done False total_reward 0.0 while not done: action policy(obs) obs, reward, done, info env.step(action) total_reward reward if epoch % 100 0: print(fepoch{epoch}, reward{total_reward:.2f}) # 这里省略了策略梯度更新、经验回放、熵正则等细节这类代码说明的不是某个具体框架的用法而是“训练、验证、记录”这个闭环的重要性。真正落地时还要补充策略网络结构、奖励函数调参、仿真域随机化和实机迁移等步骤。7.2 先跑通一个运动控制小闭环比训练完整行走策略更基础的是跑通“状态读取-控制器输出-执行-状态更新”的控制闭环。可以用一个简化的单腿或摆杆模型来理解读取关节角度和 IMU 姿态。用 PID 或简单状态反馈计算目标力矩。将力矩指令发送给执行器。等待下一帧状态重复循环。下面是一个控制循环示例import time def control_loop(robot, frequency500): dt 1.0 / frequency while robot.is_running(): # 1. 读取状态 joint_state robot.read_joint_state() imu_state robot.read_imu() # 2. 计算力矩指令 torque_cmd compute_torque(joint_state, imu_state) # 3. 下发指令 robot.send_torque(torque_cmd) # 4. 等待下一帧 time.sleep(dt)这里的核心不是 PID 参数而是理解控制频率、状态读取和指令下发之间的时序关系。控制频率太低很多算法无法收敛控制频率太高通信和计算会成为瓶颈。常见人形机器人控制频率在 200Hz 到 1000Hz 之间。7.3 记录和回放数据是基本功人形机器人调试时最怕的是“不知道怎么摔倒的”。解决方法是把每次运行的状态都记录下来回放时逐帧分析。建议每一帧都记录时间戳、关节角度、关节速度、力矩指令、IMU 数据、控制模式。示例日志结构如下{ timestamp: 1717000001.232, mode: walk, joints: { left_hip_pitch: { angle_rad: 0.12, velocity_rad_s: 0.02, torque_cmd_nm: 8.3, temperature_c: 40.1 } }, imu: { roll: 0.001, pitch: -0.004, yaw: 0.0, accel_x: 0.12, accel_y: 0.02, accel_z: 9.81 }, safety: { e_stop: false, collision_detected: false } }有了这类数据排查问题时就不是靠猜而是靠回放缩小范围。这也是仿真和实机对比的基础。7.4 从仿真迈向实机时的风险控制清单如果团队已经具备仿真基础准备在实机上验证这里有几条必须遵守的安全顺序先空载再负载。先弱力矩模式再满力矩模式。先开环测试再闭环测试。先低速测试再高速测试。先固定安全绳再完全自由运行。每轮测试前检查急停按钮和碰撞检测。每次测试后导出日志即使成功也要记录。这套顺序能显著降低实机测试阶段的设备损坏风险也能帮助团队在故障发生时获得完整数据。回到最初的问题宇树和优必选谁是全球第一这个答案取决于你问的是“谁的出货量更高”“谁的开发平台更容易上手”“谁在商业场景里交付更完整”还是“谁在某个技术指标上暂时领先”。对于计划评估、采购、研发或者学习者来说比较好的做法不是直接相信某一句宣传而是把人形机器人拆成五层技术栈逐层记录数据、设置验证实验用同一套横评清单去判断。把“全球第一”的争论还原成可以验证的工程问题这比口号更接近真实答案。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进