ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

工业视觉踩坑实录(番外篇):数博会归来,一个AI落地者的冷思考

工业视觉踩坑实录(番外篇):数博会归来,一个AI落地者的冷思考 工业视觉踩坑实录番外篇数博会归来一个AI落地者的冷思考关于作者我接触视觉整整10 年。机器视觉、烟草、煤矿等行业都有深度开发经验。从硬件选型、算法开发、模型训练到上位机开发及部署都在一线磨过。之前是多家公司人工智能团队的技术负责人。现在自己创业了还在继续做视觉落地这件事。作者说公众号停更了两周。原因是8月底数博会在贵阳开——就在我家门口。作为一个base贵阳、做工业AI落地的人这种会不去说不过去。我本来打算去看一天展览就回来写代码结果展览没看多少交流活动倒是一场接一场地泡。泡完之后有些话不吐不快。系列文章先往后放放这篇插播一个番外聊聊我在数博会上听到的三组概念——数据编织、数据运河还有具身智能阵营口中的Scaling Law和模型母机——以及它们是怎么把这几年做SOP行为检测的感受突然串起来的。先说结论大会讲的是数据要素价值释放而我这一年干的其实就是这件事的最小可行版本。只是以前没人这么告诉过我。01 我去数博会干什么先交代背景。2026数博会8月28日到30日贵阳主题是——词元数据要素价值释放新路径。“词元就是Token大模型处理世界的最小单位。把数据要素的价值释放比作把数据变成词元”这个主题定得很聪明后面我会专门讲。数博会的规格不用我多说国家数据局主办、贵州省政府承办6万平方米展馆、300多家参展企业华为首发了智能体设施和数智工厂还有各种签约、发布、路演热闹得很。但我这次的身份有点不一样——我是以嘉宾身份、代表公司去参会的。接到邀请的时候还挺高兴毕竟以前都是隔着屏幕看别人的演讲这次终于能坐进现场。所以展览我反而看得不多。机器人咖啡、无人驾驶巴士这些体验项目路过看一眼就走了。我大部分时间泡在交流活动上。道理很简单展台上站着的是销售讲台上站着的是把一件事想透了的人。我这样天天蹲车间的人最缺的就是把行业大势想透的机会——人是会蹲窄的。好几场听下来印象最深的有两场。一场是8月27日下午的大模型与数据智能创新国际合作交流活动贵阳国际生态会议中心舞阳厅。两位讲者的内容我记了整整三页笔记一位是云基华海的张宝龙讲数据编织。一位是澳琴数据运河实验室的王岩讲数据运河。另一场是人工智能数据工厂创新发展交流活动主题是建设数据工厂释放数据价值。这场谈的是数据怎么生产——具身智能的两位大佬穹彻智能的卢策吾和智平方的郭彦东讲的东西让我这个做视觉的老兵既看到了行业下一个十年的方向也照见了自己的位置。一个编一个运一个生。这篇就围绕这三个字展开。02 张宝龙的「数据编织」原来我在工厂里干的就是这件事张宝龙是云基华海的联合创始人、常务副总裁那天的演讲题目是《数据编织面向AI的新型数据基座》。他先讲行业痛点存算成本高、治理难度大、多模态兼容难这些挑战正在倒逼数据架构变革。然后抛出数据编织带来的两个根本性转变一、从控制数据位置到协调数据关系二、从先汇聚后使用到先需求后服务。最后是那句我记到笔记本第一页的话数据编织的核心价值在于将分散在各系统的数据和知识编织成一张Agent可直接消费的实时语义网让AI智能体既有感知能力、又懂业务知识推理。说实话前五分钟我以为这就是又一套数据中台的新包装——我们做乙方的见过的XX中台XX底座太多了PPT都长得差不多。但听到Agent可直接消费的实时语义网这句我在台下坐直了。这不就是我在车间里干的事吗你们回想一下第6篇讲的SOP行为检测系统。摄像头对着工位抽帧、检测、姿态估计最后进状态机。状态机干什么就是把一串冷冰冰的关键点坐标翻译成一句人话“3号工位第5步扭矩确认被跳过操作工张三14:32:17。”你看我的车间里散落着多少种数据工位摄像头的视频流、扭矩扳手的读数、PLC的节拍信号、贴在墙上塑封的SOP卡。这些数据各有各的格式、各有各的归属谁也不认识谁。我那套系统干的事情本质上就是把这些散落的数据编织成一条状态机驱动的语义流水线——视频帧变成关键点关键点变成动作动作变成SOP步骤SOP步骤变成告警语义。那行推给班长的告警信息就是Agent可直接消费的东西。班长消费它质量追溯消费它月度的合规报表也消费它。数据编织的术语我在车间里的对应物分散在各系统的数据摄像头流、扳手读数、PLC信号、SOP卡实时语义网状态机的步骤转移判定Agent可直接消费推给班长的「跳步告警」那一行字先需求后服务先定义跳步检测再倒推要采什么数据张宝龙讲的是给大企业和政府做的新型数据基座我做的是给一条装配线装的行为检测。规模差了一万倍但思想是同一个别想着把数据都搬到一个池子里而是让数据保持原地在它们之上建立关系和语义让消费者直接消费语义而不是消费原始数据。还有一句是会后我翻报道看到的。张宝龙在第二天另一场圆桌对话里说大模型卷参数的架构红利正在收敛真正拉开差距的是数据质量。这句话我在之前文章里其实写过一个大白话版本工业AI的核心竞争力不是算法有多新而是工程化能力有多强。一个讲的是数据一个讲的是工程化其实是同一枚硬币的两面。模型是买得到的数据质量买不到。人体检测、姿态估计、状态机全是成熟得不能再成熟的技术我拿它们拼出了能上线运行的系统——真正值钱的不是这些组件是每个车间里那堆乱七八糟、没有结构、没人整理的现场数据和现场知识。大会台上台下隔着规格、规模和一万倍的项目金额我们在同一件事上达成了共识。这是数博会给我的第一个收获。03 王岩的「数据运河」修运河的人和我有什么关系第二位让我记了三页笔记的是澳琴数据运河实验室副主任王岩讲数据运河。先简单复述一下这个概念。澳琴就是澳门横琴。他们要建一个数字贸易国际枢纽港核心架构是一条数据运河两个数据中心四大体系按照多级提升、分段设计的原则把境内外的数据分类导入不同的安全可信数据空间再统一调度连接境内外两个数据中心——相当于在数字世界里挖一条巴拿马运河让数据安全合规地过境。下一步以中国—巴西合作共建为切入口向葡语、西语国家推广。坦白讲听完的第一反应是这是国家战略层面的大工程跟我一个在贵阳蹲车间做落地的人有关系吗关系约等于零。我在台下甚至有点走神想起了我自己的数据跨境问题。7月份那个项目给我的教训之一就是工厂数据出域比跨境还难。车间的视频流涉及生产安全、工艺机密药企车间还涉及GMP合规审计——客户的数据你根本拿不出来。我以前总想着把数据拿出来拿到自己环境里标注、训练、调模型结果发现每一步都在跟客户的安全部门掰扯。后来我的做法彻底反过来数据不动我动。模型部署进厂就在客户那台工控机上跑数据出厂不出门甚至不出那个车间。标注在客户现场做训练的增量也在现场闭环。然后我翻资料的时候看到张宝龙在圆桌上也有一句话数据不动模型动。以可信数据空间保障数据主权以数据编织技术实现逻辑集中在保障数据安全的同时满足模型训练需求。你看“运河的智慧其实就三条数据分类分级、分段提升、逻辑集中物理不动。这跟一个车间里的现实是完全同构的——GMP车间的数据管理本身就像一套境内关外”原始记录必须留在企业内部满足审计追溯但它的语义比如这批次的灯检工序合规可以流出去给监管、给客户、给供应链上下游消费。运河是为大船修的但运河修通之后最先活起来的是运河边的小码头。数据基础设施这场大建设——可信数据空间、数据编织、数据运河——最终会把数据语义化、语义可流通变成一种行业常识。到那一天我跟小企业老板解释检测记录怎么留痕、告警语义怎么对接你的质量追溯系统教育成本会比今天低得多。大厂们正在替我把什么是数据要素、为什么要语义化这门课给全国的客户上完。这是我这个层面能从数据运河里捞到的东西不是生意本身是市场认知的水位。04 万亿赛道的机器人卡在我天天面对的问题上从运数据到生产数据是我听「人工智能数据工厂创新发展」交流活动时的感受。这场活动8月29日举行主题建设数据工厂释放数据价值来的是国家工业信息安全发展研究中心、中国电信这些国家队讲的是怎么把数据资源标准化、规模化地加工生产。但真正让我这个做视觉的老兵心里一动的是具身智能阵营的两位穹彻智能联合创始人卢策吾上海交大人工智能学院副院长和智平方创始人郭彦东。先交代一个行业背景具身智能就是给AI装上身体——让机器人不只会聊天还会干活。2026年被称为具身智能规模化落地的部署态元年中国具身智能市场规模今年预计冲到1.09万亿。数博会展区里机器人弹钢琴、做咖啡、做调酒观众里三层外三层。按理说做具身智能的和我是同行——都是用AI改造物理世界这一波的。但坐在台下听他们讲我的心情经历了三个阶段好奇、危机感、然后是踏实。过程我慢慢说。第一个阶段好奇——他们的技术源头我居然认识。卢策吾的题目是《具身智能的前沿研究与产业化》。他往台上站的时候我在心里笑这位的来头做视觉的都知道。他是AlphaPose的作者——那个曾经全网最流行的人体姿态估计开源框架还有GraspNet机器人抓取系统。而我第6篇写的SOP行为检测第二层就是姿态估计从技术谱系上讲我算是在消费他们团队十年前种下的树。他这次讲的东西很硬。两个本质两个观点我一个做工程的人听得手心发热——不是因为技术多炫而是因为每一条我都能在自己那一亩三分地里找到对照物。本质一Scaling Law已在具身智能领域被证实。喂给模型多少有效数据就得多少智能。观点1行业的核心指标是——单位成本的有效数据、单位数据的模型能力增长。说白了拼的不是谁家模型大而是花一块钱能搞到多少有效数据喂进去一斤数据能长出几两智能。跟张宝龙那句大模型卷参数的架构红利正在收敛真正拉开差距的是数据质量也是同一个意思的三种说法。台上台下、万亿赛道和车间里的落地者在数据决定智能这件事上认知完全收敛了。那有效数据从哪来卢策吾接着给了他们的解法——一个「数据平衡点」配方人类真实第一视角数据为辅 UMI海量穿戴式数据为主 落地时少量遥操作数据纠正。拆开看这是一张严格按单位成本有效数据设计的饲料配方表第一视角真实数据最真、信息最全但靠人一天天地采成本高、量上不去——所以为辅当种子、定基准线UMI穿戴式数据采集员戴上装着相机的手持夹爪人正常干活第一视角的演示数据顺手就采下来了成本极低、可以海量铺开——所以为主当主粮遥操作纠正数据机器人真下场干活暴露出的毛病遥操作补一小批针对性数据药到病除——少量、按需、点对点。单一数据源要么贵、要么糙、要么偏。不是越真越好也不是越多越好是按成本和用途配平了才好。我在台下听着又想笑——这套配方我熟啊。第6篇写过我们的SOP定义流程是先用摄像头录几天视频人工标注一遍操作流程再跟客户一起确认SOP定义卢策吾的配方我在车间里的配方第一视角真实数据为辅定基准跟客户逐帧确认SOP定义贵但定调子UMI海量穿戴数据为主喂模型车间监控里几天几夜的历史视频海量、近乎免费遥操作纠正数据少量治大病现场调试针对误报补标的那几十张图又对上了。这张配方后来被他收进数据工艺这个词里——而数据工艺怎么和训练、评估串成一条线就要说到他讲的第二个本质了。本质二模型是冰山一角冰山底座是模型母机——模型的生产流水线。观点2单个模型不重要关键是模型母机生成线——数据工艺-训练Infra-评估系统一体化核心指标是单位时间证明或证伪一个算法架构的效率。这条更狠直接命中了我这十年最痛的领悟。什么是模型母机就是生产模型的机器。不是那个checkpoint文件而是围绕它的一整套流水线数据怎么采、怎么标、怎么清洗数据工艺怎么训练、怎么部署训练Infra怎么评估、怎么回归评估系统。卢策吾说单个模型不重要——重要的单位时间里你能证明或者证伪多少个算法架构。翻译成人话比的不是谁的模型聪明是谁的迭代速度快。我第6篇讲的YAML配置化本质就是这个。客户的SOP从6步改成5步别人改代码、重新测试、重新部署一周起步我改配置5分钟重启。为什么因为我的数据工艺-检测流水线-告警评估是一体化的新流程进来当天就能证明行不行、哪里不行。我这套系统其实也是一台小号的模型母机——只是以前我不知道它叫这个名字。一个工厂里的SOP检测系统和一台万亿赛道的机器人底层方法论竟然是同一套。宇宙的尽头是流水线智能的尽头也是流水线。这是数博会给我的第二个惊喜。第二个阶段危机感——郭彦东的一句话让我后背发凉。智平方的郭彦东在交流活动上提了一个观点让1万个机器人拧100万次螺丝不如让1万个机器人分别完成100种不同的任务。这句是讲数据哲学的重复一万次的单一动作数据不如多样化任务数据对智能的推动力强。真实场景的多样性才是智能演进的燃料。对机器人行业这是数据策略。但落到我耳朵里是另一番滋味——我做的SOP行为检测客户最常问的第二个问题就是第一个是多少钱能不能顺便检测机器人干活干得对不对以前我会说目前主要检测人。但今年的风向变了数博会现场四足巡检机器人已经干活了南方电网的机械狗能负重200公斤爬60度坡进高危环境具身智能白酒检测机器人几秒完成基酒液位计量。机器人上岗之后SOP合规检测的对象就不再只是人还有机器。而郭彦东那句话反过来读就是**机器人恰恰是在多样化的真实场景里变强的。**它今天在展会上拉花咖啡明天就可能站上装配线。检测人是否合规这套系统未来要不要检测机器人是否合规我的状态机、我的ROI、我的告警语义对象从人换成机械臂骨架还能用几成说实话坐在台下那一刻我想起十年前深度学习刚起来时有人说传统算法工程师要失业。后来没失业是因为我们学会了往前站半步。这次也一样——与其等机器人来抢SOP检测的活儿不如想清楚机器人执行SOP的检测标准谁来定危机感这一段的心路怎么变成踏实得等我讲完这场会给我的最大启发——它跟前面两场竟然是通的具身智能行业最缺的恰恰是操作数据。卢策吾为什么把单位成本的有效数据当核心指标因为机器人干活的知识在互联网上根本不存在——这些知识只能去真实场景里采。于是行业里出现了数据工厂贵州首个具身智能数据工厂这次也在数博会宣布投用搭了16个全真模拟场景专门给机器人采集干活的数据——截至今年6月底全国已建成超70家具身智能训练场。你看绕了一大圈——机器人行业终于也承认智能的天花板卡在具体场景的高质量数据上。这跟张宝龙说的拉开差距的是数据质量跟我的死数据变活词元是同一件事的三种说法。用一句话总结这场会的感受具身智能不是来抢我饭碗的它是来验证我的饭碗价值的——它证明把物理世界翻译成可计算的数据这件事值一万亿。至于踏实——一个万亿赛道、融了几轮、估值百亿的机器人公司今天最缺的不是算力、不是模型架构而是愿意一个场景一个场景去抠数据的人。这事我干了十年很熟很熟。我的危机感到这就转变成了踏实。05 「词元」这个词戳中了我再回头说大会主题——词元。做过大模型的都知道词元Token是模型消化文本的最小单位。你输入一句话模型先把它切成一个个词元再逐个处理。一篇文章对模型来说不是一篇文章是几千个词元的序列。本届数博会把词元当主题用意很明显数据要素的价值最终要以能被AI消化的形态来计量和释放。发布会上有一组数字截至目前全国智算总规模240万PFlops八大国家算力枢纽建成的智算规模占比超80%6月份全国已建成高质量数据集超12万个总体量超过1565PB。数字很震撼。但我坐在台下脑子里浮现的是另一组没有出现在任何PPT上的数字我跑过的那些中小工厂里DVR硬盘上躺着的、没人看的监控录像随便一家就是几十个TB。它们是死数据——没有标签没有结构没有语义没有消费者。录完就躺在那直到硬盘录满被循环覆盖。工厂老板以为自己装了摄像头就是数字化了其实他只是把没人看变成了录下来也没人看。这就是我理解的AI落地最后一百米算力是国家的事模型是大厂的事而把一个具体场景里的死数据变成活词元是我的事。车间的一段视频是死数据“14:32:173号工位跳过扭矩确认”——这是活词元。从前者到后者需要有人去现场装相机、避频闪、标ROI、写状态机、对着视频一帧帧确认动作定义。这活儿没有发布会没有大屏没有路演只有车间。词元是数据要素价值的计量单位但每一个有效词元都是有人在具体场景里一个一个抠出来的。06 冷思考落地者的位置数博会三天收获很大但我必须把话说全——回来冷静下来有几件事要想清楚。第一热闹是大厂的场景是没人做的。展馆里最亮的展台属于华为、曙光这些头部发布的是智能体、数智工厂、十万卡超集群。这些是基座。但基座之上贵州165家药企每家车间布局不同、每份SOP不同、每个工序的判定规则不同——这部分工作大厂不会做也做不了。它太碎、太具体、太没有规模效应。它只能由懂算法、又肯蹲现场的人一家一家去做。郭彦东那句1万个机器人做100种任务还提醒了我另一件事连万亿赛道的机器人公司都放下身段去追多样性的真实场景了我一个做场景落地的人更没有资格只守着一两个熟悉的行业吃老本。具身智能那章说的踏实答案其实也在这——我的壁垒从来不是某个算法是愿意钻进下一个具体场景的意愿本身。第二我的壁垒不是模型是母机。卢策吾那句单个模型不重要还有后半句的分量既然模型会过时、架构会迭代那攒下的一堆checkpoint三年后一文不值但养一台自己的模型母机——一套采数、标注、部署、评估的流水线——它能生出一代又一代的模型。我这一年看似在交付几个项目实际上在攒的就是这条流水线。落地者的复利不在项目数在母机的转速。第三我这种小厂打法反而踩中了标准的要害。去年那个大项目让我最痛的一点甲方自己都没有检测标准精度要求从95%一路漂到99.5%需求没有边界。今年我转向医药GMP车间最舒服的一点恰恰相反GMP法规就是一份现成的、成文的、不容扯皮的标准词元表。哪些工序必须留痕、哪些行为必须合规白纸黑字写在法规里。标准不由客户口头定义而由外部法规定义——这一条够小厂吃十年。第四政策窗口是真的但不等人。贵州安全生产治本攻坚2024-2026满打满算还剩一年多。数博会在家门口连开三天等于把本地工厂老板集体数字化教育了一遍——认知水位在涨这是红利。但窗口期就是窗口期过了这个村预算和注意力都会去别的地方。所以数博会归来我的战略没变战术上更笃定了大厂修运河我守码头。基座他们建运河他们挖标准国家定。我就守着贵阳周边这些具体的车间——把每一套SOP检测系统交付好把每一段死视频变成可追溯的活词元让每一个跳步都有据可查。这条路走得稳。写在最后总结一下这篇番外的四个收获数据编织让我确认了自己做的事情在行业坐标系里的位置——SOP状态机就是车间里最小号的语义网散装数据编织成Agent可直接消费的告警语义数据运河让我看清了大基建和小场景的关系——运河是给大船修的小厂的活路在码头而且大基建正在替我们抬高市场的认知水位具身智能让我看清了对手盘也看清了同行者——Scaling Law、模型母机、场景多样性三句话背后是同一个事实具体场景的活儿永远缺人干词元让我把AI落地最后一百米这件事想得更透了——算力是国家的模型是大厂的把死数据变成活词元是落地者的。如果你也是在做AI落地——不管是在大厂带场景团队还是在一线自己扛项目——我想说的还是那句多去听听把事情想透了的人讲话比刷十篇公众号有用。但听完记得回来车间里的活儿不会自己干完。最后打个不太硬的广告如果你手上有SOP行为检测相关的项目想做——医药GMP车间合规、装配工序防错、安全生产行为监管这类场景——欢迎找我聊聊。我目前base贵阳主要做贵州本地及周边的中小工厂可以到现场看工位、评可行性。你只需要给我三样东西一段脱敏后的工位操作视频现有的SOP步骤文档最想防止发生的一种操作错误。我先帮你判断相机能不能看见、系统能不能判断、出了问题能不能形成证据闭环。能做从哪个工位、哪种错误切入最合适暂时做不了卡在哪里我也会直接告诉你——不浪费彼此时间。评论区留言或私信都行。作者晟妙智能系列专栏工业视觉踩坑实录如果觉得有用点赞关注不迷路
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进