ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

物理AI从概念到基础设施,算力、机器人与仿真闭环是关键

物理AI从概念到基础设施,算力、机器人与仿真闭环是关键 1. 第十届ICT峰会现场物理AI如何从概念变成基础设施我在第十届全球ICT峰会现场待了三天最大的感受是物理AI这个词的火爆程度几乎超过了AI本身。前两年大家聊生成式AI、聊大模型聊的都是数字世界里发生的事——文字、图片、代码、视频。今年风向变了会场里所有人都在问同一个问题AI怎么走出屏幕去操作机器人、控制产线、驱动自动驾驶这正是物理AI的定义。简单说数字AI处理的是符号和信息物理AI处理的是空间、力、运动和约束。你可以把物理AI理解成一套感觉—决策—执行的闭环系统传感器感知物理世界模型在毫秒级做决策执行机构在真实环境中完成动作。它和传统AI最大的区别在于每一个动作都受物理规律约束。你不能凭空加速不能让机械臂超过关节限位不能忽略摩擦力和重力。就像会场里一位做机器人控制的老工程师说的大模型答错题顶多扣分机器人走错一步就是撞机报废。这次峰会上ICT的含义也在被重新定义。过去ICT是信息通信技术涵盖网络、基站、光模块和服务器现在ICT被越来越多的从业者解读为Information, Computing and Things——信息、计算和万物。峰会主论坛上几大厂商不约而同地把展台重心从网络设备挪到了算力机器人仿真的组合方案上。这背后不是简单的产品线扩张而是一个产业逻辑的变化通信网络正在变成物理AI的传输神经算力中心是大脑机器人是手脚仿真是试验场。对从业者来说最值得关注的是这次峰会释放出的信号物理AI已经不是实验室里的小众方向而是被纳入了真正的产业叙事。一个细节很能说明问题——今年的峰会议题设置里单纯讲网络协议的场次明显减少取而代之的是机器人操作系统数字孪生与自动化端侧推理与具身智能这类交叉议题。连专门做通信设备的厂商也在自己展台摆了一排协作机械臂演示通过网络把机器人的实时状态上传到云端再在云端做路径规划下发回来。当然热闹归热闹冷静下来看物理AI要真正定义下一个十年面前还横着四道坎算力够不够、机器人靠不靠得住、仿真准不准、资本有没有耐心。接下来我结合峰会上的实际讨论一条一条拆开说。2. 算力底座GPU集群、稀疏算力与内存墙的连锁反应2.1 物理AI对算力的需求和ChatGPT完全不是一个逻辑峰会上算力专场人满为患我听下来最核心的一个观点是物理AI对算力的需求曲线比大模型时代陡峭得多。大模型的算力消耗集中在训练阶段推理阶段虽然也吃算力但从架构上看相对固定。物理AI不一样它每一时刻都要做实时推理。一台自动驾驶汽车同时跑着感知、规划、控制三套模型每秒要处理几十帧点云和图像数据一台人形机器人全身几十个关节每个关节都是一个控制回路再加上视觉伺服、力控、避障计算任务几乎是并行爆发的。峰会的一位演讲嘉宾算过一笔账单个通用人形机器人如果在真实环境里做复杂操作任务按当前主流模型算单台机器人的实时算力需求接近一台8卡GPU服务器的算力。注意这还只是单台不是单条产线。所以为了充分发挥GPU算力而设计系统这句话在物理AI的语境下已经成了标配思维。过去我们为一个模型买GPU现在是为一个机器人本体实时反馈循环买GPU。这个变化带来的是基础设施设计思路的转变算力不再是一个集中式的资源池而是要被压到边缘侧、端侧形成一套分布式部署。2.2 算力网络与稀疏算力一种更务实的资源调度思路峰会上另一个高频词是算力网络。我理解这套东西的核心逻辑其实很朴素算力就像电力用户不应该关心电是哪个电厂发的只用关心插座有没有电。在我们做工程落地的人看来算力网络解决的是资源找任务的问题——某个时间点云端训练集群有空闲GPU边缘推理服务器却满负荷通过统一的调度层把训练任务切一部分到云端把推理任务本地化整体资源利用率能提高不少。更值得关注的是稀疏算力这个概念。传统GPU渲染和AI推理都是稠密计算每个计算单元都必须同步运转但在物理AI的场景里很多计算天然是稀疏的。比如一张巡检机器人回传的图像大部分区域是静止的墙面和地面真正需要模型关注的只有管道接口和仪表盘那一小块。如果整张图都跑一个高分辨率大模型纯属浪费。稀疏算力的思路是通过算法先快速定位感兴趣区域再把高密度计算集中到那些区域上其他区域用轻量网络扫一遍就行。实测下来这种方案在机器人视觉场景里能把单帧处理延迟降一个数量级GPU利用率还更健康。这种稀疏思路在仿真端同样适用。物理仿真里的刚体碰撞检测、流体粒子计算真正需要高精度计算的往往只是局部区域全局统一仿真要么慢、要么发散。后面我会专门讲仿真发散的问题这里先记住一句话不是所有算力需求都应该被无脑满足先把张量砍掉稀疏的部分再谈扩展。2.3 API密钥权限与平台化算力既是资源也是管理问题峰会展区讨论环节有个做机器人开发的小团队问我搭算力平台的建议一上来就说自己的问题不是缺GPU而是算力接口的权限管理太乱了。这其实是很多团队都会踩的坑。当你开始把算力当成平台来用首先要解决的往往不是模型而是API密钥权限体系。机器人的各个模块——视觉组、控制组、导航组——都要调算力服务如果所有模块共用一个密钥权限边界就消失了视觉组写了个死循环误调了大量推理接口控制组的任务全被挤掉产线直接停摆。我自己的做法是给每个模块配独立的密钥或子账号设定独立的配额和速率上限计费也按模块分摊这样哪块超标一眼就能看出来。峰会上几家云平台厂商也都在推细粒度的API权限方案本质上就是想把算力变成像水电一样按需供给同时按户收费的服务。AutoDL这类算力云平台之所以在开发者圈子里流行也是因为它把租GPU这件事的门槛降到了极低按小时计费、支持镜像保存、数据盘可持久化特别适合机器人算法团队做频繁的实验迭代。不过要提醒一句云平台上练出来的模型最终还是要落到真实的机器人本体上跑。所以算力规划的终点不是云而是云边端三者怎么分配。3. 机器人本体从发那科到宇树离随手可用还差多远3.1 工业机器人老将稳定性足够但智能化才刚刚开始峰会现场发那科、库卡、ABB、埃夫特这些工业机器人厂商的展台前人头攒动但细看你会发现大家关注的重点不再是机械臂本身的负载和重复定位精度——这些参数几十年前就解决了——大家问得最多的是能不能和AI框架打通。传统工业机器人的痛点非常真实你把一台发那科机器人买回来产线工程师要用专门的示教器手动拖动或按键编程工艺文件完全封闭在厂商的体系里。想用AI视觉识别工件的位置再动态调整机器人的轨迹对不起你得先过一遍机器人厂家的专用接口再把视觉系统的输出转换到机器人坐标系里用起来非常别扭。峰会上有工程师吐槽库卡机器人的仿真软件和现场控制器之间的行为经常对不上在仿真里跑得好好的程序一上真机就撞限位排查半天才发现是仿真环境和控制器参数不一致。这背后其实是一个老问题工业机器人厂商把控制系统做成了安全优先、稳定优先的黑盒这保证了几十年的安全生产但也阻碍了新AI算法快速接入。ABB和库卡这两年的动作很明确都在推自己的开放式控制平台把AI推理能力以插件的形式放进控制器生态。但说实话步子还是不够大离随便一个算法工程师都能上手的距离还相当远。3.2 移动机器人与导航SLAM、ROS2和VDA5050标准化的意义在移动机器人方向今年峰会的重点词是标准化。SLAM技术其实已经成熟了很多年激光雷达视觉融合的定位方案在室内场景能做到厘米级在园区、仓库场景也能稳定工作。但移动机器人真正难的不是自己知道自己在哪而是多台机器人之间怎么协同、怎么和调度系统对话。这就要说到VDA5050。这是一个由德国汽车工业协会推动的接口标准相当于给AGV/AMR统一了一门普通话。过去做仓储物流自动化每用一家机器人厂商就要单独开发一套调度对接程序现在行业里越来越多人达成共识机器人必须原生支持VDA5050标准的接口调度系统按统一的消息格式下发任务、接收状态换供应商只需要改配置不用改代码。峰会上有集成商分享了一个数据采用VDA5050标准后多品牌AGV混跑的现场调试时间从原来的三到四周压缩到了一周以内。这组数字很能说明标准化的价值。ROS2作为机器人软件开发的事实标准在峰会上的存在感也比往年强得多。很多台机器人方案直接用ROS2做中间件再叠加自己的算法模块比起在裸机上从零开始做通信、驱动、状态管理效率高太多。我记得有个演示项目用的是TurtleBot3这样的入门级底盘但在ROS2框架下导航、避障、视觉跟随这些功能跑得非常顺——这其实是个信号软件开发工具链的成熟正在把机器人开发的门槛从硬件大厂专属拉低到小团队也能做。3.3 人形机器人热度最高争议最大宇树机器人两周蒸发2000亿市值的新闻在峰会现场被反复讨论。平心而论宇树在硬件上的进步是有目共睹的——电机、关节、结构设计尤其是他家的无框力矩电机和灵巧手已经从能演示进化到了能小规模出货。但资本市场短期波动大本质上是大家对人形机器人的落地节奏产生了分歧。分歧的焦点在于人形机器人到底能不能在五年内形成规模化商业场景乐观派认为工厂搬运、巡检、零售服务这些场景在三年内会跑通悲观派算了一笔账一台人形机器人成本目前仍在20万到50万之间就算量产降到10万回本周期也太长远不如专门化的AGV和机械臂划算。我的判断是人形机器人的价值不能只按替代人工成本来算。它更大的意义在于提供了通用操作能力的载体——同一台机器今天在A工厂搬箱子明天改一改末端执行器就能去B工厂拧螺丝。这种泛化能力一旦实现商业模型是完全不同的。所以现在所有关于人形机器人的估值争论本质上都在赌软件泛化能不能跑通。硬件是骨架软件才是灵魂而软件泛化依赖的恰恰是海量数据——这又回到了算力和仿真的话题。3.4 执行器细节音圈电机、视觉引导与终端操作的隐性门槛峰会展区里最容易被忽略、却最能体现技术含量的展品是各种末端执行器。机器人做得再聪明最后干活还是靠手。机械夹爪、吸盘、灵巧手这些末端工具的精度和力控能力直接决定任务能不能完成。音圈电机在末端执行器里扮演的角色非常微妙。它的特点是行程短、响应快、精度极高特别适合需要快速微动和精确力控的场景比如芯片分拣、精密装配、医疗手术辅助。很多团队做机器人精细操作任务发现光靠关节电机根本做不出那种秒级响应微米级定位的手感最后都是靠给末端加音圈电机模块才解决。峰会上有位做半导体设备的老兄说得直白关节电机管位置末端音圈电机管手感两者配合好机器人才能像人一样有轻重缓急。视觉引导机器人TVA也是明星技术。过去机器人抓取靠盲抓或固定点位现在TVA通过2D/3D视觉识别工件的位姿实时调整机械臂路径。但工程上有个坑视觉模型在仿真里训得很好一到真实产线就会出问题定位偏差突然飙到几厘米。原因多半是仿真里的光照、反光、遮挡没有建模模型学会了看特征却没见过真实世界的脏乱差。这也是为什么物理AI不能只靠硬件和算法仿真环节必须跟上来。4. 仿真与数据闭环物理AI在真实世界里的考场4.1 仿真不是给机器人画饼而是要当训练场这次峰会有一个专场专门聊仿真软件和数字孪生我在那儿听了一下午最深的感触是仿真在物理AI链条里的地位比大多数人想象的重要得多。想想机器人训练的逻辑。如果每一轮策略迭代都要在真实机器人上跑成本高不说还危险——一次控制策略失误机械臂可能直接撞坏自己或周围的设备。仿真环境的价值在于你可以用很小的代价让机器人在虚拟世界里反复试错今天跑一万次抓取明天跑一万次避障模型收敛了再部署到真机。这就是仿真驱动的具身智能的核心思想。但仿真有个致命的隐患——仿真发散。这个词我在会场上听了好几次通俗讲就是在仿真环境里训练好的模型拿到真实环境里突然全部失灵输出结果完全离谱。原因是仿真永远无法百分百还原真实物理世界摩擦系数、延迟、传感器噪声、材料形变这些细节差一点累积起来就是灾难。仿真发散是所有做sim-to-real仿真到现实迁移的团队都必须面对的坎。怎么治我的经验是三条第一仿真环境里一定要做域随机化把摩擦、负重、光照、传感器噪声这些参数在一个合理范围内随机扰动让模型见识更多变化而不是死记一组仿真参数第二仿真和真机之间要做系统辨识拿真机跑一组标准动作把仿真模型的参数调到和真机行为尽量一致第三建立闭环验证流程模型在仿真里提升一段后必须定期回到真机做小规模评测用真机的评测结果反过来指导仿真模型修正。没有这套闭环仿真练得再好也是纸上谈兵。4.2 从Factory IO到Sigrity不同层级的仿真各有分工仿真工具的选型取决于你仿真的是什么尺度的问题。峰会上被反复提到的Factory IO是做产线级逻辑仿真的入门工具它把传感器、传送带、机械臂、分拣机构这些单元拖拽成产线模型用来验证PLC逻辑和调度算法非常直观。我们做AGV调度演示时经常先用Factory IO做一套虚拟产线把VDA5050的调度消息流程跑通再上手真实设备。往下一层是结构件和热设计的仿真。像SolidWorks里的热仿真插件就可以用来分析机器人关节电机长时间运行后的温升判断散热方案是否够用。别小看这个机器人关节里面空间极度有限功率稍大电机就过热扭矩直接衰减最后表现为动作变形。我见过一个案例某团队的机械臂在仿真里规划路径一切正常上了真机跑了半小时6轴开始抖动排查到最后发现是6轴电机过热导致电流波动——这问题如果在设计阶段用热仿真提前发现改版成本会低得多。再往下一层是硬件电路级的仿真。峰会上讨论比较多的是ADS里的EM模型与EMCoSim联合仿真。理解这个东西先要知道一件事高频电路里芯片引脚出来的信号要经过封装、走线、过孔才能到连接器每一段都是传输线都会带来寄生效应信号到了模拟器里可能已经变了形状。EM仿真用电磁场数值算法比如矩量法算出真实走线结构的S参数EMCoSim再把S参数嵌入到整个原理图系统里做协同仿真。对做机器人通信板卡、高速数据传输接口的人来说这个流程能提前暴露信号完整性问题。同样做PCB板级验证的人经常用Sigrity跑TDR仿真看阻抗连续性和反射位置。这些都属于物理AI底层的隐形功臣——机器人再智能通信信号一旦出问题一切都白搭。仿真工具的选型有个递进关系先做系统级逻辑仿真比如Factory IO再做多体动力学和有限元仿真比如机械结构强度、热分布最后做电磁/信号完整性仿真。每一层解决的问题不同能省下的成本也完全不同。最怕的是上来就看最精的仿真工具结果连系统逻辑都没跑通纯属自嗨。4.3 物理约束下的智能体AI仿真模型的灵魂最后说一下物理约束这个概念。很多做AI的人接触机器人时会犯一个错误把一个在标准强化学习环境里训练好的策略直接套到真实机器人身上结果系统很快就发散或震荡。原因在于标准RL环境里的智能体没有物理约束——它可以瞬间加速、瞬间转向、可以穿透任何障碍物。但真实的机器人有质量、有惯量、有关节限位、有执行器带宽你把一个不遵守物理规则的策略给它等于让一个以为自己会飞的鸡去做老鹰的动作。所以现在做物理AI的人越来越强调物理约束下的智能体AI在训练环境里显式地把动力学方程写进去把关节限速、电机扭矩上限、加速度限制都建模到reward和state里。这种方法的效果非常直接——策略在训练阶段就会避免超出物理极限的动作迁到真机上自然就稳定得多。峰会上好几个团队分享的经验都指向同一件事物理约束不是限制而是给AI戴上安全帽让它在虚拟世界学会什么是不能做的真机阶段的风险和调试成本会大幅下降。5. 资本与生态过去十年看通信未来十年看融合5.1 热钱退潮后资本开始挑有闭环的团队峰会最后一天有个圆桌主题是物理AI的资本周期。台上几位投资人的观点高度一致现在资本对纯概念阶段的项目已经非常谨慎大家更看重的是有没有形成数据闭环——也就是说你的方案能不能实实在在拿到真实场景里的数据再反哺模型迭代。这一点在宇树市值大幅回调的事件里体现得很明显资本市场不是不认可人形机器人而是不想为一个短期故事付过高的溢价。对比过去十年资本曾经非常偏爱通信基础设施——基站、光模块、交换机因为一旦建好就有稳定的流量和营收。而物理AI完全不同它的商业闭环链条更长算力投入、仿真平台、机器人本体、场景集成、后期运维每一个环节都在烧钱回报周期却被拉得很长。所以现在的投资人更看重三件事第一团队有没有真正的硬件和算法结合能力而不是光有模型第二有没有健康度很高的仿真真机验证闭环而不是只靠PPT里跑出来的曲线第三能不能绑定一个刚需场景比如新能源产线、物流分拣、医疗手术辅助先产生现金流让技术持续滚动发展。资本退潮算不上坏事。过去一年很多靠PPT融资的机器人公司已经消失剩下的团队会把更多精力放在产品打磨和场景打磨上。我在峰会上和几个创业团队聊下来感触最深的是大家已经从我要做一个通用人形机器人的宏大叙事转向我先在某个细分场景做到比人更稳定、更便宜、更安全的务实路线。5.2 谁在定义物理AI的下一个十年我的结论回到最开始那个问题算力、机器人、仿真、资本到底谁在定义物理AI的下一个十年这场峰会看下来我的判断是单靠任何一方都不行真正的定义权掌握在能把四件事捏成一个闭环的人手里。算力提供了原材料但它不定义场景机器人本体提供了载体但它的泛化能力受数据和模型限制仿真提供了训练场但它只是工具仿不好还会把你带沟里资本提供燃料但资本没有耐心等你二十年。真正定义下一个十年的是那些理解物理约束、能设计出高效训练闭环、能把算法部署到真实机器人上持续迭代的团队。ICT峰会这个平台最大的价值就是让通信人、算力人、机器人和投资人在同一个场子里互相碰撞——碰撞出来的才是物理AI真正意义上的基础设施。我个人在峰会现场的一个直观感受是过去大家聊物理AI像在聊一个遥远的科幻设定今年聊物理AI是在聊一条条明确的供应链、一份份真实的集成合同、一笔笔要精打细算的预算。这说明行业正在变实也说明接下来的竞争拼的不是谁故事讲得好而是谁的闭环跑得最稳、最快。如果你正准备进入这个方向我给三条朴素建议先把仿真环境的物理约束做扎实再往里投钱买算力先在一个垂直场景里跑通数据闭环再想着做通用平台先从现成的ROS2和标准接口比如VDA5050起步别一上来就自己造轮子。物理AI的十年不是被某个单一技术或资本力量定义的十年而是被整个产业协作效率定义的十年。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进