ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

室内导航定位技术全解析:从UWB到多源融合的工程实践

室内导航定位技术全解析:从UWB到多源融合的工程实践 室内导航定位技术这个领域在行业里混久了会发现一个很反直觉的事实我们拿着手机在户外靠卫星定位能精确到几米但走进一座大型商场、地下车库、机场航站楼想搞清楚自己到底站在哪一层、该往哪个方向走反而成了难题。室外定位的答案写在天空里室内定位的答案却藏在房间的墙壁、货架、电磁干扰和人群移动之间。这篇内容不打算写成教材式的综述想按我从项目评审、现场实施到算法调试这几年的实际接触把室内导航定位技术的研究进展、主流流派、工程落地和未来方向一次说清楚也把那些厂商宣传里不会写的坑一并交代了。1. 为什么室内定位比户外导航难这么多1.1 卫星信号在室内失效的物理原因很多人有个朴素疑问GPS在室外都这么成熟了搬进室内用不就行了答案是物理上就过不去。卫星信号传到地面时本身已经很微弱几十厘米厚的混凝土楼板、金属玻璃幕墙、密集钢筋网会把信号衰减到完全不可用的程度。即便你站在窗边侥幸收到一两颗卫星的信号接收机也解不出稳定的位置因为定位解算需要至少四颗卫星同时可视室内绝大部分区域根本不满足这个条件。我在一个地下停车场的项目里实测过贴着出入口坡道能搜到五六颗卫星但定位点会在几十米范围内乱跳看起来比随机数还随机。这说明把卫星定位当作室内定位的兜底方案完全不现实。业内常讲室内外无缝切换实际做起来室外交给GNSS到了出入口就是灰色地带室内必须有自己的一套定位基础设施而不是指望卫星信号穿透进来。1.2 多径效应才是真正的头号敌人室内定位真正难的地方不是没有信号而是信号太脏。无论是Wi-Fi、蓝牙还是UWB信号从发射端到接收端除了直射路径还会经过墙壁、地面、金属货架、人体反复反射形成大量延迟到达的反射副本。接收端收到的是直射信号和一堆反射信号叠加后的混合体测出来的距离和到达角天然带偏差这就是多径效应。多径效应的影响有多大我在一个贴满金属货架的仓库里做过蓝牙测距测试直线距离6米的两个点RSSI换算出来的距离可以达到15米以上。这种环境下所有依赖信号强度的定位算法都会失灵不是算法不好而是前端的物理量已经失真。所以业内做室内定位的第一课不是学算法而是先学会勘察环境——什么地方信号能直射什么地方必然被遮挡反射这些判断直接决定方案选型。1.3 定位精度这个指标业内怎么定义和度量研究进展综述绕不开一个问题精度到底怎么算很多论文写平均精度1米但你要看他用的是均方根误差RMSE、第50百分位误差P50、还是第95百分位误差P95。这三个口径差异非常大。一套系统P50是1米P95可能就变成3米甚至5米因为少数离群点会狠狠拉高尾部误差。厂商宣传时最喜欢挑最好看的口径报而实际业务场景里恰恰是那个最差的P95决定用户体验——用户不会管你90%的时间有多准只记得那10%的时间把他导偏了。我在下面的章节里提到任何精度数字都会默认说明是典型环境下的P50/P95范围而不是实验室理想环境里的单点最优值。这一点也是所有做技术选型的人必须先对齐的认知不然后面所有对比都是鸡同鸭讲。2. 主流室内定位技术流派逐个拆开看2.1 WiFi与蓝牙靠指纹和测距撑起的大多数方案Wi-Fi和蓝牙是当前普及度最高的两类室内定位载体原因很直接手机里就有这些模块基础设施在很多场所本来就有改造成本相对可控。Wi-Fi定位的主流做法有两种一种是信号指纹法另一种是三角定位法。指纹法的逻辑有点像给环境拍一张信号照片。先在目标区域按网格采集每个点收到的各AP信号强度存成指纹库定位时把手机当前收到的信号向量拿进去比对找到最相似的指纹点作为位置估计。这种方法在Wi-Fi信号覆盖密集的商场、写字楼里能做到3到8米的典型精度优点是不需要额外硬件拓扑缺点是建库费人力、环境一变指纹就失效。蓝牙方案分两类阵营。一类走iBeacon类的广播信标RSSI指纹/三角定位精度和Wi-Fi指纹差不多3到5米另一类是蓝牙5.1之后新增的到达角AoA能力通过阵列天线测量信号到达的角度配合已知位置的信标做角度交汇在理想条件下能做到亚米级。AoA的代价是接收端要布阵列天线发射标签也要单独设计成本比普通信标高不少。我在一个厂区实验里测过蓝牙AoA空旷通道上P50大概0.8米但一进走廊拐角或有人群经过P95立刻掉到3米开外角度测量对遮挡极其敏感。2.2 UWB时间测距把精度推向厘米级超宽带UWB是近几年室内定位里最出圈的技术手机厂商从iPhone 11开始陆续内置U1芯片让大众第一次在精确查找功能里体会到厘米级定位。UWB的原理和信号强度法完全不同它不靠RSSI猜距离而是靠测量信号飞行时间ToF。UWB脉冲非常窄、带宽很大时间分辨率高所以测距误差能控制在10厘米量级比蓝牙/Wi-Fi的RSSI测距高一个数量级。工程上UWB常用TDOA到达时间差或者ToF测距三边定位两种模式。TDOA适合标签多、基站少的场景比如人员定位、物资追踪双向测距TWR适合点对点精度要求高的场景。我在一个电力管廊项目里用了TDOA模式30个基站覆盖约1.2万平方米的地下空间标签定位P95稳定在20厘米以内这个精度是Wi-Fi和蓝牙完全够不着的。UWB的问题也很现实成本高、功耗高、部署密度要求不低。一颗定位基站几百到上千元标签也要几十到上百元而且UWB信号对金属遮挡同样敏感墙角拐弯处性能下降明显。它适合的是精度必须到厘米/分米级且愿意为此付费的场景比如AGV小车调度、机械加工刀具管理、人员高危区域管控而不是商场导购这种对几米精度已经够用的场景。2.3 惯性导航与PDR不依赖基础设施的自足定位惯性导航INS和行人航位推算PDR是另一条技术路线。它的核心逻辑是我不需要外部基站靠自身传感器来数步子。手机或工牌里的加速度计检测每一步的迈步和步幅陀螺仪判断方向变化磁力计辅助修正航向然后从已知起点开始一步一步推算出当前位置。PDR的最大优势是自主性强地下、室内、无信号环境都能跑短期几百米内的相对精度可以做得不错典型漂移约1%到3%——走100米可能偏1到3米。但致命缺陷也来自相对二字航向误差会持续累积磁力计在钢筋、电机、金属货架附近会被严重干扰走一个L形路径可能把方向转错步长估计因人而异跑步、慢走、上下楼梯都会带来额外误差。所以纯惯性方案在工程上几乎没人单独用它更多是和其他定位源做融合——信号方案突然失效的几十秒内靠PDR桥接过去。我在写字楼项目里用过手机PDR做电梯内和地下连廊的定位补充效果是能用但不惊艳。出电梯后PDR推算的位置和真实位置差了大约4米靠蓝牙信号重新收敛到2米以内花了大概10秒。这说明PDR不是用来替代主定位源的它是用来填坑的。2.4 视觉与激光SLAM眼见为实的定位方式视觉定位和激光SLAM近些年在机器人领域非常成熟也开始往手机端渗透。视觉SLAM的基本逻辑是让设备看着环境走路——通过摄像头连续采集图像帧提取特征点、跟踪特征点运动在运动中反推出自身的位移和姿态同时增量式构建环境的地图。手机端已经有ARKit、ARCore这类系统级的视觉定位能力配合云端的视觉特征库甚至能实现拍一张照片就知道自己在哪的视觉重定位。视觉方案在纹理丰富、光照稳定的环境里精度非常可观特征点跟踪好的情况下里程计漂移率可以控制在1%以内视觉重定位也可以做到亚米级。但它对环境的洁癖很严重大面积白墙、玻璃幕墙、暗光环境会让特征点直接消失移动人群会遮挡特征视角变化太大时重定位会失效。激光SLAM则主要用在AGV、服务机器人身上。激光雷达测距不受光照影响建图和定位精度都很高但单线激光雷达本身不便宜而且依赖环境几何特征——一条两侧完全一样的超长走廊激光SLAM也会迷路这在行业里叫走廊退化问题。所以视觉和激光路线擅长的是机器人该往哪走而不是手机用户站在哪这类轻量需求两者场景定位不同。2.5 地磁、可见光、声学等其他流派除了上面四大流派还有一些在特定场景有价值的方案。地磁定位利用的是建筑物内钢筋结构产生的天然磁场异常场像指纹一样每个位置的磁场特征理论上不同。它的优点是不需要部署任何基站手机自带的磁力计就能采数据成本极低缺点是磁场特征受环境内铁磁性物体影响大移动货架、金属门开关都会改变局部分布而且地磁指纹的空间区分度并不总够高容易出现相似磁场区域导致的误匹配。我见过几个地磁定位的demo空旷区域能到2到3米但一进机房、车间这类金属密集区误差直接失去参考意义。可见光定位VLC的思路是让LED灯具以肉眼不可见的高频闪烁编码发送位置信息手机摄像头接收解码。理论上每盏灯就是一个定位锚点位置信息天然稳定精度取决于灯间距。这个方向在学术圈很热但落地最大障碍是现有的普通LED灯不支持这种调制必须更换专用灯具改造成本吓退了一大批潜在客户。声学定位分为主动和被动两类主动方案利用扬声器发出人耳不易察觉的超声波/声波信号做ToF测距手机麦克风接收被动方案则是用环境声音特征做指纹。声学方案在特定封闭空间可以做但噪音干扰、多径反射、设备兼容性都让人头疼目前多用于研究和小众场景。3. 各方案放在同一张桌上比一比精度、成本、适用场景3.1 一张表看清核心参数做技术选型时我习惯把方案的核心参数摆在一张表里比虽然每个项目都有特殊性但量级判断不会错。技术方案典型精度P50/P95基础成本部署难度主要适用场景Wi-Fi RSSI指纹3-8米 / 8-15米低复用现有AP低商场、写字楼、人员区域统计蓝牙RSSI信标3-5米 / 6-10米中低低商场导购、展馆、医院蓝牙5.1 AoA0.5-2米 / 3-5米中高中仓储管理、高精度人流统计UWB TDOA0.1-0.3米 / 0.3-0.5米高中高工厂人员定位、AGV、高危区管控PDR惯性推算相对精度1-3%漂移低依赖手机传感器低隧道、信号盲区桥接视觉SLAM/定位0.1-1米环境依赖强中中机器人导航、AR辅助地磁指纹2-5米 / 5-10米极低低轻量级大众场景气压计测楼层楼层准确率90%极低无楼层识别辅助这张表里的精度数字都是典型环境真实项目里浮动很大尤其P95那列环境恶劣时翻倍都不是新闻。所以表格只用来做方向判断用来写验收标准会出事。3.2 选型思路需求决定技术而不是技术决定需求我参与过的项目里最常犯的选型错误是拿着UWB的指标去套商场的需求。商场要的是用户在哪层、在哪个区域、该往哪走3到5米的蓝牙方案已经完全够用UWB的高精度不仅浪费部署成本还让项目预算直接失控。反过来工厂里要管一个工人在不在危险区域蓝牙3米的误差意味着安全围栏边界模糊根本没法通过安全验收这时候必须上UWB。所以选型的真正顺序应该是先定义业务要什么级别的精度和可靠性再反推技术路线。如果是找到停车场自己那辆车蓝牙AoA或者融合方案就够了如果是手术室里医疗设备精准定位UWB几乎是唯一现实选择如果只是想做个楼层级的人员热力图Wi-Fi指纹就行连额外硬件都不用买。技术没有绝对的好坏只有适配不适配。4. 工程实现中的融合思路与典型系统架构4.1 为什么单一方案撑不住全场景看了上面的对比你会发现每类单一技术都有自己的短板Wi-Fi/蓝牙精度不够稳、UWB贵且怕遮挡、PDR漂移、视觉怕暗怕白墙。实际室内环境是复杂的一个地下停车场可能同时有金属立柱、坡道、电梯井、人车混行没有任何单一方案能全场景兼顾。所以业界早就形成共识多源融合是答案而不是可选项。融合的经典框架是卡尔曼滤波家族。简单的场景用互补滤波或者扩展卡尔曼滤波EKF把UWB测距、蓝牙指纹、PDR位移、气压计高度按不同置信度融合到一个状态估计里。每一轮更新里PDR负责短时间内的平滑运动UWB/蓝牙负责把长期漂移拉回来气压计负责楼层跳变最终输出的轨迹比任何单一源都平滑、稳定。我在融合UWB和PDR时实测过一个很好的效果UWB单独跑在某些墙角会有0.5秒左右的抖动跳变但融合PDR之后轨迹会沿惯性方向平滑过渡定位点反而更接近真实行走路径。4.2 从坐标定位到可用的室内导航定位和导航之间还隔着一层地图和路径规划。拿到坐标只是知道我在哪导航还得知道目标在哪、怎么走。一个可用的室内导航系统至少包含四层位置感知层融合各定位源输出连续坐标和楼层。地图数据层室内地图矢量数据包含墙体、通道、电梯、扶梯、门、POI等语义信息。路径规划层在路网图上做最短路径/无障碍路径计算跨楼层要考虑电梯和扶梯。交互呈现层把路线渲染到2D地图或AR实景上并提供转向提示。很多项目死在第二层以为买个定位引擎就完事了结果发现室内地图要自己画、路网要自己建、POI要自己标。这项工作的人工成本往往比定位设备本身还高而且很多人忽略了室内地图的语义属性——不是画几条线就行电梯口、楼梯口、柱子、玻璃门这些障碍物和通行点必须标注清楚否则路径规划会给出穿墙路线。4.3 一个典型融合系统的工作流从工程实现角度一个常规的多源融合室内定位系统大致是这个流程信号采集各基站/信标持续广播或接收信号手机或标签采集RSSI、ToF、AoA、IMU原始数据。数据预处理滤波去噪、异常值剔除、信号平滑。单源定位各定位源分别解算初步位置Wi-Fi指纹匹配、UWB三边定位、PDR积分。融合解算EKF/粒子滤波器融合各源输出结合地图约束不能穿墙和运动约束人不能瞬移。输出与修正输出最终坐标并周期性通过已知点或信标修正累积误差。这套流程说起来简单调试时每一环都可能出问题。我在一个厂房项目里遇到过融合后定位点穿墙的情况——UWB和PDR解算都在墙外但融合结果也跑到墙外后来发现是地图约束在滤波预测阶段没生效只有当定位结果落在墙内时才做投影修正。这类细节问题论文里不会写只有现场反复调参才能发现。5. 深度学习进来之后哪些问题真的被改变了5.1 指纹库的建库和维护成本被AI大幅压缩传统指纹定位最劝退的点就是建库和更新。几百上千平米的场地按1米网格逐点采集Wi-Fi/蓝牙指纹一个熟练工一天顶多采几百个点商场这种动辄几万平米的场地光采集就要数周更致命的是环境一变挪货架、增减AP指纹库就过期维护是无底洞。这两年最实用的进展是用众包加深度学习来生成指纹。思路是普通人正常行走时手机不断记录Wi-Fi/蓝牙信号序列和IMU数据通过SLAM或者PDR推出相对轨迹再把轨迹上的信号和位置配对自动构建指纹库。配合深度生成模型可以在稀疏采集点之间插值出稠密指纹场大幅减少人工采集量。众包加融合的思路让指纹库能持续自更新我把这看成Wi-Fi/蓝牙定位在过去五年里最重要的一次工程化进步。5.2 信号特征学习与端到端定位深度学习在定位另一侧的玩法是端到端学习把多通道的RSSI、AoA、IMU、气压数据直接输入神经网络输出坐标或者楼层。这类方法在竞赛数据集上常能刷出比传统算法更低的误差因为它能自动学习信号间的非线性关系和环境的隐式特征不需要人工设计复杂的信号模型。实际落地效果则没那么神。深度模型极依赖训练数据的覆盖度换一个楼层、换一批AP、换一种手机品牌误差可能立刻变差——泛化性问题是神经网络的通病。我的建议是深度学习适合做特征融合层而不是完整定位引擎前面还是用UWB/蓝牙/PDR做物理可靠的主定位深度模型负责在角落里做指纹匹配修正或者活动类型识别这样工程师能控制风险模型也只在它擅长的局部范围起作用。5.3 对AI贡献的冷静评价如果只让我说一句人话AI确实解决了指纹维护和复杂场景特征提取这两个老大难但别指望它凭空变出高精度。物理层信号质量不行再强的模型也救不回来。UWB的厘米级靠的是物理带宽和信号设计深度学习没有点石成金的本事。真正务实的姿势是——让AI做它擅长的事模式识别、插值、众包数据融合让物理测量体系做它擅长的事高精度测距谁也别抢谁的活。6. 从实验室走向现场最容易踩的坑6.1 宣传精度和实测精度的差距这是采购方和供应商最容易扯皮的点。供应商说系统精度1米你没问清楚这1米是在什么环境、用什么统计口径测的进场实测时发现实际场景里P95是4米甚至更差。我的经验是合同里一定要写清楚验收条件是典型业务区域内、正常运营状态下、P95垂直误差不超过X米并在甲乙方都在场的情况下做随机抽测而不是让供应商自己挑点位测。定位系统特别擅长选点挑几个信号好的位置侧给你看结果全屋开门红这坑不能踩。6.2 部署成本的大头往往不是设备很多项目预算表里设备费占了大半真正进场才发现供电布线、网络回传、遮挡处理、设备固定、地图采集、系统联调这些看不见的钱才是大头。蓝牙信标一颗几十块看着便宜但每颗都要装电池、考虑位置、定期巡检一个五百颗信标的项目光后期运维就够呛。UWB基站更夸张要布网线要供电一个车间十几颗基站拉出来的线缆和施工工时常常比基站本身还贵。做方案预算时请把部署、运维、地图三件事的预算单列不然项目做到中途肯定超支。6.3 环境动态变化导致的性能衰减这也是最考验现场功力的部分。我在一个物流仓库调试蓝牙定位时白天和晚上P95能差出两倍多——因为白天有员工走动、叉车移动、卷帘门开合全是遮挡和反射。更麻烦的是货物区域会定期重新划分货架一挪信号传播路径全变原有指纹库立刻失真。解决办法是在方案设计阶段就预留定期校准机制比如布设少量固定参考节点持续监测信号变化或者用众包数据自动更新指纹库而不是把系统交付后就撒手不管。7. 未来走向从定位到感知的室内导航7.1 室内外无缝衔接会成为标配未来用户不会关心自己用的是GPS还是蓝牙还是UWB他们要的是一个连续的、跨场景的导航体验从室外走到室内大厅再下到地下车库全程不用切换App、不用重新搜索信号。这个目标的实现靠的是分层融合——室外用GNSS/基站/惯性导航出入口过渡区域用传感器桥接室内用Wi-Fi/蓝牙/UWB/气压计组合所有源统一进同一个融合框架。5G网络里也引入了专门面向室内定位的定位参考信号设计蜂窝网络在室内定位里的角色会从备用方案逐渐变成广覆盖兜底。7.2 与AR、物联网和数据平台融合室内导航的下半场不只是把人带到目的地而是成为整个空间智能的一部分。AR导航可以把箭头直接叠加在真实路面上这在机场、博物馆、医院里已经开始落地定位数据结合物联网设备能实现人到灯亮人到电梯等待的主动式服务从商业运营角度看热力图和轨迹分析可以反哺商场动线设计、医院导诊优化、工厂效率评估。定位从一项技术能力变成一个数据底座价值空间会大得多。7.3 每条技术路线都在往融合、互补、自适应方向收敛未来的系统大概率不是某一个技术在单打独斗而是一个自适应定位平台信号好的区域用UWB/蓝牙AoA维持高精度指纹稀疏的边缘区域靠众包模型补位信号完全丢失的角落由PDR惯性推算兜底楼层判断永远交给气压计。哪个源在当前时刻置信度高融合算法就多信任它一些。这个方向对算法和工程能力的要求远高于单一技术方案但也正是这个机会所在。最后说点个人的体会做室内定位这几年我最大的感受是这行没有银弹每个方案都在精度、成本、鲁棒性之间做三角权衡。想入行的朋友与其追最炫的技术不如先把一个场景做透——把一个停车场的定位做到人人都愿意用比在十个场景里都半吊子强得多。技术演进还在继续但理解场景需求、做好系统集成、保证长期稳定这件事在任何一代技术上都成立。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进