ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

【IROS 2026】TIC:人群中的移动目标主动拦截,在线 POMDP 规划中动作空间结构的决定性作用|从人群导航与在线规划视角

【IROS 2026】TIC:人群中的移动目标主动拦截,在线 POMDP 规划中动作空间结构的决定性作用|从人群导航与在线规划视角 摘要本文解读 IROS 2026 论文《Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds》。该论文提出人群中的目标拦截Target Interception in CrowdsTIC问题把机器人主动追上并拦截正在移动的收件人建模为部分可观测马尔可夫决策过程POMDP通过融合人类意图信念推断、在线树搜索与两类动作空间构造在完全相同的感知、信念、奖励与算力预算下做受控对比其特别之处在于把动作空间结构当成唯一自变量单独隔离出来测量。实验表明在 200 人高密度场景下联合选择转向与速度的 ESP 安全成功率达到 97%比路径-速度解耦的 P-LSP 高出 31 个百分点并把平均拦截时间从 90.9 s 压到 63.3 s少约 44%而且在目标状态只能被间歇观测时这一结构优势依然成立为人群导航与移动目标拦截提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQTIC 和传统的移动目标拦截有什么不同为什么先规划路径再调速在人群密集时会失效ESP 比 LSP 到底强在哪里有量化证据吗目标状态看不见时结论还成立吗这个结论可以推广到连续动作空间或真机吗这篇论文的写法有什么值得借鉴的地方参考链接论文基本信息项目内容标题英文Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds标题中文人群中的移动目标主动拦截在线 POMDP 规划中动作空间结构的决定性作用作者Himanshu Gupta, Kelvin Aladum, Nisar Ahmed, Bradley Hayes, Zachary Sunberg机构University of Colorado Boulder · 航空航天科学系 计算机科学系会议IROS 2026arXivarXiv:2607.18517项目网站tic-planning.github.io背景与动机传统配送假设收件人待在固定地点等待于是任务被简化为到点即达的导航问题。但在医院、机场这类人流密集的场所更高效的策略是让机器人主动追上并拦截移动中的目标——这正是本文定义的 TIC 问题。难点在于两重不确定性同时存在目标自身在移动而周围行人各自抱着不可观测的意图。移动目标拦截的历史局限既有工作大多假设环境静态或把动态障碍视为已知确定量。基于 Dubins 曲线的时间/长度最优拦截在曲率受限条件下给出解析解但缺少拥挤环境Qu et al.ACC 2022提出先预测目标轨迹 → 选拦截点 → 规划路径 → 用时空图调速的流水线性能依赖轨迹预测是否可靠无法处理密集的意图驱动交互。人群导航下的意图不确定性Bai et al.ICRA 2015首次把在线 POMDP用于人群中自动驾驶确立有限空间规划Limited Space PlanningLSP范式——先算一条路径再沿路径调速Gupta et al.AAMAS 2022提出扩展空间规划Extended Space PlanningESP让在线树搜索同时决定转向与速度但目标是固定点。联合优化类方法MPC 与开环反馈控制方法也同时优化朝向与速度但每个决策周期只计算一条开环轨迹不像树搜索那样在多种人类反应上做闭环分支。本文要填的缺口现有工作从未检验路径-速度解耦这一结构假设在动态拦截场景下会随人群密度上升如何失效。从历史脉络看对应附录 H这条线经历了四步2015 年 LSP 成为人群导航的默认范式 → 2022 年 ESP 让转向与速度一起进入搜索、但目标仍是固定点 → 2023–2025 年一批工作用学习价值近似或联合优化扩展人群导航、仍未处理移动目标 → 2026 年本文把 ESP 迁移到动态拦截并给出路径受限与联合搜索的受控结构对比。为什么动作空间表达力对拦截尤为关键因为人群造成的延迟决定了何时、何地能完成截获一旦朝向被冻结在参考路径上时间与空间决策就解耦失败而在固定算力下搜索只能覆盖动作空间的稀疏子集动作空间的形状直接决定能不能发现绕行机动。实验协议上对应附录 B每个规划器 × 人群密度组合跑500 次配对试验三条臂共享同一目标与行人初始化以及同一批运动实现因此可以做配对统计比较一次试验在机器人进入1 m 截获半径时记为成功在 300 s 超时或撞上工作区边界时终止机器人在移动状态下进入任何行人1 m安全范围内记一次接近违规违规不终止试验但计入安全成功率。为维持恒定密度行人到达目标后被移除并沿边界重生、新目标取在对侧机器人从左下角出发、目标从右上角出发保证每次都必须穿越人群。研究主线从问题到结论图 7TIC 研究主线Mermaid 流程图。从人群中主动拦截移动目标的问题出发经路径-速度解耦够用吗的动机、受控对比三条规划臂的设计到同一 ARDESPOT 求解器下的方法对比最终在 4 档密度 × 500 配对试验的实验设置上得到空间受限规划在高密度下失效的结论。基准/方法设计论文的核心设计是受控隔离三条规划器共享同一套信念表示、求解器参数、奖励模型与算力预算唯一变化的变量是动作空间如何暴露给在线树搜索。R-LSPReactive LSPHybrid A* 先算出一条运动学可行路径朝向随之被冻结树搜索只在这条路径上选择速度更新 $\delta_v \in {-0.5, 0, 0.5}$ m/s路径生成时用保守的膨胀安全边界吸收人类意图不确定性。P-LSPPredictive LSP在 R-LSP 基础上路径规划阶段按目标动力学把目标状态外推朝预测的未来位置规划路径——这是 LSP 的加强版用来检验失败是不是因为路径规划器不够好。ESPExtended Space Planning取消参考路径约束树搜索直接选择转向角7 个离散值 $\in[-\phi_m, \phi_m]$与速度更新朝向在搜索过程中自适应为了控制分支因子速度分支只在 $\phi 0$ 时开放。公平性约束LSP 最多给路径生成分配 0.1 s超时则沿用上一周期的路径ESP 把完整的 0.5 s 预算投给树搜索。三条臂的 rollout 使用完全相同的行人接近度速度调制策略因此空间行为的差异只能来自动作空间本身。规划器转向自由度速度更新参考路径R-LSP由路径决定冻结${-0.5, 0, 0.5}$ m/sHybrid A* → 当前目标P-LSP由路径决定冻结${-0.5, 0, 0.5}$ m/sHybrid A* → 预测目标ESP7 个离散值 $\in[-\phi_m, \phi_m]$${-0.5, 0, 0.5}$ m/s无转向-速度联合搜索图 1TICTarget Interception in Crowds任务场景。白色为机器人黄色为需要拦截的移动目标黑色为行人机器人只能在有限感知区域内观测行人并用彩色信念条表示对每个行人意图的估计。上图为俯视图下图为同一场景的透视视角。分类全景图 8三类规划器分类全景Mermaid 流程图。三条规划臂共享信念表示、奖励模型与 0.5 s 算力预算LSP 家族又分为路径指向当前目标的 R-LSP 与路径指向预测目标的 P-LSPESP 则用 7 个转向值 × 3 个速度更新做联合搜索。方法细节TIC 被形式化为 POMDP 元组 $(S, A, Z, T, O, R, \gamma)$。状态由三部分组成机器人状态 $s_R$、目标状态 $s_T$ 与 $N$ 个附近行人状态 ${s_H^i}$其中每个行人带有不可观测的意图变量 $g_i$离散候选目标点。机器人对每个行人维持一个类别信念分布 $b_i(g)$初始为均匀分布之后按贝叶斯规则更新$b_{t1}(s) \propto O(s, a_t, z_{t1}) \sum_{s \in S} T(s, a_t, s) b_t(s)$。运动学与动作机器人是车式模型 $s_R(x_R, y_R, \theta_R, v_R)$控制量为转向角 $\phi_R$ 与速度增量 $\delta_v$速度按 $v_R \leftarrow \mathrm{clip}(v_R \delta_v, 0, v_m)$ 更新朝向按 $\dot{\theta}_R (v_R / L)\tan\phi_R$ 演化其中轴距 $L 0.75$ m、最高速度 $v_m 2$ m/s、最大转向角 $\phi_m 0.475$ rad目标按恒定速度与恒定转向率运动行人恒速朝各自目标点行进。奖励设计成功拦截获得终端奖励撞上工作区边界罚 $R_{obs}$在移动状态下进入行人安全距离 $d_s$ 触发接近惩罚 $R_h$采用 not-at-fault 形式静止时不计罚选择急刹动作罚 $R_{SB}$每步再扣一个 $R_{step}$ 以促使尽快完成拦截。在线树搜索使用 POMDPs.jl 中的ARDESPOT在线求解决策周期 $\Delta t 0.5$ s、运行频率 2 Hz规划与执行在时间上重叠每个节点从当前信念采样 $K 50$ 个情景只把最近的 $N 6$ 个行人纳入搜索以聚焦安全关键交互叶子节点用 rollout 仿真估计长时域价值。rollout 策略奖励稀疏只有截获才给正奖励因此两条臂都需要主动朝目标推进的 rollout。LSP 的 rollout 沿参考路径、用远于 $D_{far}$ 加速、近于 $D_{near}$ 减速的反应式控制器调速ESP 的 rollout 在同样的速度调制之外把每个候选转向命令与选定速度组合并前向仿真 $\Delta t$选择让机器人最接近外推目标状态的动作。稀疏观测的处理机器人、目标与行人位置在建模中被视为无噪观测以隔离意图不确定性观察空间在 ARDESPOT 中按 2 m 的空间分辨率离散化因为该求解器要求离散观测。图 2两条臂搜索树的对比。左为 LSP——先算出到预测目标位置的路径虚线树搜索只能沿该路径选速度遇到与行人的碰撞时只能减速右为 ESP——搜索探索多条空间轨迹找到无碰撞状态后用 rollout 评估最终选择右转绕行。实验设计与结果实验在50 m × 50 m 无障碍工作区中进行机器人采用上述自行车模型人群规模取 $N_h \in {50, 100, 150, 200}$ 四档行人恒速朝四个角落之一行进、目标以恒定转向率运动。主研究假设目标状态完全可观测次级研究则用 15 m、180° 视场的探测器加 10% 漏检概率提供间歇观测再用 1000 个粒子的序贯重要性重采样SIR粒子滤波维护目标状态信念规划器只使用最大后验MAP粒子作为目标状态。每条臂在每个密度下各跑 500 次配对试验。规划器成功率主研究200 人安全成功率主研究成功率次级研究平均拦截时间次级研究ESP转向 速度联合搜索98%97%约 90%98.2 sP-LSP路径 → 预测目标96%66%83%113.1 sR-LSP路径 → 当前目标73%44%69%132 s在低密度50 人下三条臂几乎重合但从 100 人起差距单调扩大。主研究中 200 人时ESP 与 P-LSP 的成功率仍有 98% 与 96%但安全成功率分化为 97% 与 66%相差 31 个百分点、R-LSP 仅 44%拦截时间上 ESP 平均63.3 sP-LSP 为90.9 s即 ESP 少用约 44% 的时间。次级研究中所有规划器成功率下降目标只能靠估计但 ESP 的结构优势保留安全成功率87%对 P-LSP 的 56%200 人时 ESP 平均 98.2 s 完成拦截P-LSP 需 113.1 s、R-LSP 需 132 s。图 3主研究目标完全可观测。左至右分别是成功率、安全成功率与截获时间随人群密度的变化。安全成功率最能说明问题——R-LSP 一路下滑、P-LSP 明显落后而 ESP 几乎保持水平。图 4次级研究间歇观测 粒子滤波 MAP 估计。整体曲线下移一档说明目标估计误差会损害所有规划器但 ESP 相对两条 LSP 的结构性优势依然成立。图 5次级研究运动学特征。在空闲时间、平均速度、急刹次数三个指标上 ESP 都优于两条 LSP而它的行驶距离更长、拦截反而更快说明它是持续机动而不是走走停停。图 6次级研究中使用 ESP 的一次代表性拦截试验快照第 5、15、30、50、60 秒。红点为粒子滤波信念、橙色曲线为机器人实际轨迹机器人一路穿过密集人群逼近目标并完成拦截。结果对比总结图 9结果对比总结Mermaid 流程图。LSP 路径受限在 200 人时安全成功率为 44%–66%ESP 联合搜索为 97%ESP 的空闲时间更短、均速更高、急刹更少主研究拦截时间 63.3 s 对 90.9 s少约 44%。关键发现安全成功率的分化最剧烈200 人时 ESP 的安全成功率 97%P-LSP 66%、R-LSP 44%——ESP 比 P-LSP 高31 个百分点比 R-LSP 高53 个百分点。时间效率同样拉开主研究中 ESP 平均63.3 s完成拦截P-LSP 需要90.9 s即路径受限规划多花约 44% 的时间次级研究中 ESP 98.2 s、P-LSP 113.1 s、R-LSP 132 s。预测性路径规划只能补回一部分给路径规划器加上目标外推P-LSP后安全成功率从 R-LSP 的 44% 升到 66%但仍显著低于 ESP 的 97%说明负载的是朝向被冻结这一结构假设而不是路径规划器的质量。结构效应是密度驱动的50 人时三条臂几乎重合差距从 100 人起单调扩大符合受控实验对单一变量起作用的预期而非调参噪声。估计误差下结论仍成立次级研究中所有规划器成功率下移但 ESP 相对 LSP 的优势保留安全成功率 87% 对 56%说明结论不依赖目标状态是否完美可观测。运动行为可解释ESP 空闲时间更短、平均速度更高、急刹次数更少同时行驶距离更长——受限的动作空间迫使规划器保守与反复刹车而联合搜索能维持连续前进。从顶会创新模式的角度对应附录 C这篇论文主要命中三条信号① 设计混淆隔离诊断——构建一个只隔离动作空间结构这一个混淆变量的测量装置其余感知、信念、奖励与算力全部固定证据是 500 次配对试验 × 4 档密度、差距随密度单调扩大② 审计并扭转负载假设——识别人群导航领域继承的路径-速度分解足够假设并把它违反同时把失败追溯到结构机制朝向冻结后无法在延迟出现时重选空间轨迹③ 替换算子或表示——用转向-速度联合动作表示替换路径 一维速度。整体上它的执行质量来自配对、单调密度曲线与跨观测设定复现这三重证据。局限性无静态障碍实验场地是 50 m × 50 m 的空场地静态障碍与动态人群耦合时的表现尚未验证。观测被简化机器人、目标与行人的位置假设为无噪观测这是为了刻意隔离意图不确定性真实传感器噪声会同时作用于三条臂可能改变绝对数值。动作空间仍为离散因为 ARDESPOT 对连续或很大的动作空间处理起来吃力转向与速度都做了离散化连续动作下的分支因子没有被刻画。结论来自仿真全部结果来自仿真环境没有真机验证行人模型是恒速目标导向加有界噪声的基本形式未覆盖 Social Force 或 PORCA 等更复杂的运动模型。论文表述口径的两处瑕疵R-LSP 在主研究下的截获时间只出现在图中、正文只引用了 ESP 与 P-LSP 的数字摘要里31 percentage points lower没有写明比较对象是 P-LSP 而不是 R-LSP。引用这两组数字时需要注意对应关系。常见问题FAQTIC 和传统的移动目标拦截有什么不同传统拦截如 Dubins 最优拦截、predict-then-intercept 流水线大多假设环境静态或动态障碍已知TIC 把人群的意图不确定性和移动目标放进同一个 POMDP机器人要同时处理追移动目标和躲意图不可观测的行人两件事。为什么先规划路径再调速在人群密集时会失效因为它把朝向冻结在搜索之外。人群造成的延迟会不断改变何时、何地能截获目标而朝向不可调时规划器只能用调速在人与人之间找缝隙树搜索里可达的状态集合被限制。即使加上目标预测P-LSP安全成功率也只从 44% 升到 66%仍显著低于联合搜索的 97%。ESP 比 LSP 到底强在哪里有量化证据吗强在动作空间的表达力。200 人时 ESP 安全成功率97%而 P-LSP 为 66%、R-LSP 为 44%主研究平均拦截时间63.3 s对90.9 s少约 44%次级研究中 ESP 的空闲时间更低、平均速度更高、急刹次数更少同时行驶距离更长却拦截更快。目标状态看不见时结论还成立吗成立。次级研究用 15 m、180° 探测器加 10% 漏检率提供间歇观测再经 1000 粒子 SIR 滤波规划器只拿到 MAP 估计。所有规划器成功率都下降但 ESP 对 LSP 的结构性优势保留安全成功率 87% 对 56%平均拦截时间 98.2 s 对 113.1 s。这个结论可以推广到连续动作空间或真机吗论文没有给出结论。作者明确指出动作空间仍是离散化的因为所用求解器ARDESPOT对连续或大动作空间处理吃力同时实验全部在仿真中完成未做真机验证。作者给出的下一步是扩展到含静态障碍的环境这需要碰撞感知、面向拦截的 rollout 策略而并行运动规划或许能让这类策略在在线预算内实时生成。这篇论文的写法有什么值得借鉴的地方它用场景化开场从送货机器人去找在病房之间移动的医生到机场人群里把订单直接交给顾客建立直觉再用反问式设问点出研究问题动作空间结构会如何影响在线树搜索在密集人群拦截中的效果最后用受控对比兑现承诺措辞上证据密度很高直接给出 98%、96%、73% 这组成对数字断言式表述没有 hedge并精确锚定规模最多 200 人、每组合 500 次试验。参考链接论文 arXiv 摘要页arxiv.org/abs/2607.18517项目主页含视频与 BibTeXtic-planning.github.ioGupta, Hayes, Sunberg.Intention-Aware Navigation in Crowds with Extended-Space POMDP Planning. AAMAS 2022arxiv.org/abs/2206.10028Egorov, Sunberg, Balaban, et al.POMDPs.jl: A Framework for Sequential Decision Making under Uncertainty. JMLR 2017jmlr.org/papers/v18/16-300.htmlGuez, Silver, Dayan.DESPOT: Online POMDP Planning with Regularization. JAIR 2016doi.org/10.1613/jair.5328给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进