xc体育官网-无穿戴AI动作分析训练系统_xc运动科技责任有限公司

机器任务执行中面向主动安全的预测性视觉语言监控
栏目:公司动态 发布时间:2026-08-05
   在动态环境中执行语言条件任务的机器人往往仅在动作失败后才依赖反馈,当失败涉及碰撞或工作空间冲突时,这种机制是不充分的。本文提出了一种预测性监控框架,该框

  

机器任务执行中面向主动安全的预测性视觉语言监控(图1)

  在动态环境中执行语言条件任务的机器人往往仅在动作失败后才依赖反馈,当失败涉及碰撞或工作空间冲突时,这种机制是不充分的。本文提出了一种预测性监控框架,该框架使用视觉语言模型(VLM)来评估机器人任务执行过程中的近期未来执行风险。该框架首先生成具有动作执行条件和计

  在动态环境中执行语言条件任务的机器人往往仅在动作失败后才依赖反馈,当失败涉及碰撞或工作空间冲突时,这种机制是不充分的。本文提出了一种预测性监控框架,该框架使用视觉语言模型(VLM)来评估机器人任务执行过程中的近期未来执行风险。该框架首先生成具有动作执行条件和计划级回退动作的结构化计划。在执行期间,监控模块结合视觉观察、当前动作和相关执行条件,估计在较近的未来时间窗口内是否可能违反条件。当预测风险超过特定任务的阈值时,机器人停止当前动作,执行回退行为,并从更新后的状态重新规划。研究人员在Gazebo仿真环境中对该方法进行了评估,测试了包含移动人类障碍物的移动导航任务以及两个机械臂共享工作空间的操作任务。在受控的碰撞风险设置中,与基于反应性VLM的基线相比,所提出的方法实现了更高的任务成功率,同时与保守的当前状态前提条件检查相比,所需的重新规划事件更少。结果表明,预测性视觉语言监控可以提高模拟动态机器人任务中的任务完成率,但仍受到VLM延迟、提示敏感性和超出仿真的评估等限制。

  近年来,大型语言模型(Large Language Models, LLMs)和视觉语言模型(Vision-Language Models, VLMs)的发展使得机器人能够通过语义推理解释自然语言指令并将其分解为可执行的动作。然而,当前方法在面向安全的执行方面仍面临局限性。现有的视觉语言动作(Vision-Language Action, VLA)模型倾向于将任务成功置于安全目标之上,缺乏减少危险状态的明确约束。同时,基于LLM的规划器虽然具备语义推理能力,但仍然主要是反应性的,只能在失败发生后做出响应。在物理机器人领域,当后果不可逆(例如人机碰撞或硬件损坏)时,这种“失败后恢复”的范式是不适用的。为了解决上述问题,研究人员开展了一项将范式从反应性纠正转向主动失败预防的研究。这项研究提出了一种预测性监控框架,该研究已发表在《Frontiers in Robotics and AI》期刊上。该研究利用VLM生成带有嵌入式执行条件和计划级回退动作的结构化计划,并在未来时间窗口内持续预测xc运动科技有限公司条件违规情况。通过在物理错误发生前主动停止执行并实施回退操作,该框架显著提升了机器人在动态场景中执行任务的安全性,对推动机器人在不可逆后果环境中的实际应用具有重要意义。

  在关键技术方法方面,研究人员主要采用了以下几种方法开展工作:首先,开发了一种基于VLM的结构化规划方法,利用自然语言指令生成动作序列、首个动作的未来执行条件集C0以及整体的计划级回退动作f;其次,构建了预测性监控机制,将视觉观察、当前动作与条件相结合,将风险评估形式化为序数分类问题,利用VLM推断运动轨迹以输出语义风险类别(如“很可能”、“可能”);此外,引入了基于阈值的控制循环架构,通过流式推理实时解析VLM输出的风险标签,当风险等级超过设定阈值θ时立即中断动作并触发回退与重规划。实验均在Gazebo仿真环境内进行,采用PAL Robotics Tiago移动机器人和Franka Emika Panda机械臂开展导航与操作测试。

  在“Environment and setup”(环境与设置)中,研究人员构建了动态仿真环境,以测试框架在导航和操作任务中的表现。通过引入受控的碰撞概率pcollision∈{0.2, 0.5, 0.8},表明在这两类高动态干扰任务中,预测性监控均能有效提升任务完成质量。

  在“Baselines”(基线对比)中,通过将所提方法与Inner Monologue(IM)和DoReMi这两种代表性反应性或保守性方法进行对比,得出本框架的核心区别在于检查当前状态与预测未来状态的不同,证明了本方法能够在物理失败发生前进行预防。

  在“Evaluation metrics”(评估指标)中,使用任务成功率、执行时间和重规划次数作为评估标准。得出结论:反应性方法只能在失败后重规划导致成功率低下,而本方法通过预测性干预,在维持较高成功率的同时实现了合理的重规划频率。

  在“Results and discussion”(结果与讨论)中,通过实验轨迹和统计数据表明,在pcollision=0.8的高碰撞风险导航场景中,反应性方法成功率降至17%,而本方法维持在89%,提升了5.2倍。同时,本方法在执行时间上表现出了较强的竞争力,避免了保守基线方法因频繁误判而产生的高昂时间成本。此外,针对VLM反馈延迟的测量表明,利用流式推理可以有效将风险类别解析延迟从4.37s降至1.14s,使其勉强满足高层任务监控的需求。

  在“Ablation studies”(消融实验)中,针对预测能力、回退动作、前提条件和时间窗口进行的消融测试得出结论:移除预测能力会导致成功率从89%降至18%,证明了预测未来是主动预防的核心;移除回退动作导致成功率降至80%,证明了即时安全动作的必要性;移除前提条件会导致过度重规划;而1.0s的时间窗口在早期警告与预测准确性之间达到了最佳平衡。

  在“Threshold sensitivity analysis for manipulation”(操作任务阈值敏感性分析)中,通过在双臂操作任务中测试不同触发阈值θ,得出结论:θ=neutral过于敏感导致在安全场景中频繁误判,而θ=very likely过于迟钝无法纠正规划错误。最终确认θ=likely在操作任务中实现了安全性与稳定性的最佳平衡。

  在“Multi-person navigation stress test”(多人导航压力测试)中,在包含三个移动行人的高密度障碍场景中进行压力测试得出结论:即使初始条件均为碰撞状态,系统仍能通过反复预测风险并激活回退,达到74.0%的成功率,证明了框架在多动因环境中的可扩展性,但同时也暴露了延迟带来的性能下降。

  在讨论部分,研究人员总结了研究结论:提出了一种预测性监控框架,通过利用VLM预测未来时间窗口内的执行条件违规,成功将机器人任务执行从反应性失败恢复转向主动失败预防。该框架生成具有计划级回退动作的结构化计划,并通过结构化序数风险评估持续监控执行过程,在预测到失败时触发安全响应。实验表明,在高碰撞概率下,该方法在导航任务中实现了89%的成功率,远超反应性基线%,并在多人导航压力测试中保持了较高的鲁棒性。消融研究证实预测能力和计划级回退是提升主动安全的关键。尽管由于云端API延迟和底层动作原语简单,当前框架在适用高频和复杂灵巧任务时仍受限,但该研究为机器人在动态、不确定环境中实现更安全的操作奠定了理论与技术基础。