具身智能落地:补上“感知”这一关键课
当前,具身智能行业普遍认为,2024 年将成为人形机器人实现量产和落地的关键一年。随着部署规模逐步扩大,机器人所面临的环境也变得更加复杂。
从原本高度结构化的实验室场景,人形机器人正逐步迈向开放、多变的现实世界。在这样的环境中,“感知”这一层能力的重要性日益凸显。
机器人在执行任务时,通常依赖“感知—决策—动作”的闭环机制。其中,感知作为起点,一旦出现问题,后续的决策和执行都将受到影响。
最近的人形机器人半程马拉松比赛,就是一场典型的开放场景挑战:长时间的户外奔跑、光线变化、路面不平,导致许多机器人的感知系统暴露出稳定性不足的问题。

接近终点时,部分机器人突然转向人群,反映出感知系统尚未成熟。
稳定的、高精度的感知系统,是机器人在复杂场景中可靠运行的前提。因此,感知层的各类核心组件也迎来了重新评估,成为整个产业链中的关键瓶颈之一。
从系统架构来看,机器人感知能力通常可分为三类:环境感知、本体状态感知,以及交互与操作感知。

看见世界:环境感知传感器
环境感知是机器人进入真实场景的第一步。它决定了机器人能否识别物体、理解空间结构、判断距离,从而实现导航、避障和抓取等功能。
这一层级的核心硬件主要包括两大类:
- 视觉传感器,如 RGB 相机、双目相机、深度相机和鱼眼相机,提供图像、纹理和深度信息。
- 空间感知传感器,如激光雷达,提供稳定的距离和空间结构数据。

奥比中光 Gemini 330 系列双目 3D 相机,用于机器人视觉感知。
然而,图像采集并不意味着机器人已经具备完整的环境理解能力。在动态人流、复杂光照和室内外切换的环境下,RGB 相机容易出现图像失真、边缘模糊和夜间质量下降等问题。
此外,动态目标的频繁移动也会导致识别与定位困难,视觉系统可能丢失目标、误判距离。
在环境感知中,除了光照与动态理解的挑战外,还面临两个核心难点:
- 高精度的手眼协同。视觉和激光雷达在肢体运动中容易产生动态畸变,导致目标位置和深度测量偏差。
- 系统对算力和实时响应的要求极高。视觉与激光雷达数据量大,融合、建图、目标跟踪等算法复杂,且时间延迟可能引发避障反应慢、抓取不准等问题。
精确匹配手、眼、物体三者的相对位姿,是实现稳定抓取和精准跟踪的关键。
面对这些挑战,行业正在从两个方向优化感知能力:
- 从二维图像识别升级为三维空间理解。
- 向多传感器融合演进,采用视觉+激光雷达等组合方案。
在这一过程中,多家企业已经展开布局:
- 奥比中光重点发展深度视觉技术,Gemini 330 配备自研 MX6800 深度引擎芯片,可在强光、黑暗等条件下输出稳定三维数据。
- 禾赛科技推出 Kosmo 系统,集成激光雷达与 AI 算法,实现三维场景还原。
- 速腾聚创的 Active Camera 则实现了多类感知信息的芯片级融合,提升响应效率。

这些企业虽路径不同,但目标一致:为机器人提供在复杂场景下稳定、精准的环境感知能力。
感知自身:本体状态感知传感器
除了环境感知,机器人还需要具备“体内感官”——感知自身状态,以实现动态控制和精准执行。
人形机器人在行走、转弯、上下坡等过程中,依赖姿态、速度和受力变化的实时反馈,从而维持平衡、控制动作。
支撑这一层的核心器件包括:
- 惯性测量单元(IMU),用于检测角速度与加速度,支撑动态平衡。
- 力传感器,包括关节扭矩传感器、六维力传感器和足底力传感器,用于感知受力情况。
本体感知面临的主要难点包括:
- 响应速度和稳定性要求高,一旦感知延迟,可能导致控制链路失序。
- 量产阶段需要保持一致性,批量产品需具备长期稳定运行能力。
- 小型化、集成化与成本控制并存。特别是在手腕、脚踝等空间受限部位,需兼顾精度、强度和兼容性。
在该领域,两类玩家正在崭露头角:
- 来自自动驾驶领域的厂商,如导远科技。其 IMU5146 模组已交付银河通用,具备高精度、高频率输出与低延迟。
- 专业力传感器厂商,如坤维科技与鑫精诚。坤维 HRS 人形系列已批量供货多家头部企业,鑫精诚则在推进 MEMS 六维力传感器的量产。

这些企业在小型化、高一致性与可量产方面持续突破。
接触世界:交互与操作感知传感器
拥有视觉和本体感知,机器人可以行走与避障,但仍需一层“触觉”能力,才能完成精细操作,如插拔接口、抓取柔性物体。
触觉感知传感器虽尚未成熟,但其发展将直接决定机器人是否具备真正的操作能力。
目前主流的触觉传感器包括:
- 电子皮肤
- 指尖触觉传感器
- 阵列式压力传感器
- 视触觉传感器
它们大多部署在手部、夹爪和末端执行器上,用于接触检测、材质识别和形变判断。
触觉感知面临诸多挑战:
- 尚未形成统一标准和成熟产品体系。
- 耐久性问题突出,长期接触和摩擦对传感器寿命构成挑战。
- 集成难度高,空间受限,需兼顾薄型设计与稳定性。
- 算法融合复杂,触觉信号与视觉、动作之间的协同仍需优化。
- 成本高,尚未实现规模化应用。
帕西尼感知在这一领域布局较早,其 PX-6AX-GEN3 多维触觉传感器可输出六维力、材质与温度等信息,并具备极高的工业寿命。
此外,帕西尼正建设全球最大的全模态数据采集工厂,并与云服务商合作推动具身智能数据云商城。

他山科技则从芯片角度切入,推出数模混合 AI 触感芯片,实现高精度三维力感知。
戴盟机器人则牵头建设全球最大含触觉信息的具身数据集 Daimon-Infinity,依托自研设备和高频率传感器,提供触觉、视觉、动作轨迹等多维数据。

感知能力的发展路径与竞争焦点
整体来看,机器人感知能力的演进路线大致可分为三个阶段:
- 以视觉为主导的环境感知,是实现场景理解的第一步。
- 以力觉为核心的本体状态感知,是决定机器人动态稳定与交互能力的关键。
- 以触觉为突破口,推动机器人从“能动”走向“能干”。
无论是马拉松、工厂还是家庭服务,人形机器人的规模化部署都离不开感知系统的支持。
感知系统采集的数据质量,将直接影响到机器人后续的决策与动作执行。
随着应用场景从样机验证、单一环境逐步扩展到开放、复杂的现实场景,感知链路的稳定性、可复制性与可量产性,将成为决定产业化进程的重要因素。
这一层技术的突破,极有可能成为推动机器人产业迈向成熟的关键拐点。
原文标题:具身智能落地,开始补“感知”这一课