北醒李远:给机器造眼睛,与「自讨苦吃」的十一年
雷峰网左林右狸频道对话北醒(Benewake)CEO 李远,回顾其十一年创业历程与对物理 AI 的判断。今年上半年北醒交付机器人用激光雷达 25 万台,机器人业务收入占公司营收超过一半,2025 年该项收入比 2024 年翻了一倍,海外占比超过 50%。
推荐理由:访谈披露了北醒机器人激光雷达的出货与收入占比,可据此判断机器人赛道的实际放量节奏。
雷峰网左林右狸频道对话北醒(Benewake)CEO 李远,回顾其十一年创业历程与对物理 AI 的判断。今年上半年北醒交付机器人用激光雷达 25 万台,机器人业务收入占公司营收超过一半,2025 年该项收入比 2024 年翻了一倍,海外占比超过 50%。
推荐理由:访谈披露了北醒机器人激光雷达的出货与收入占比,可据此判断机器人赛道的实际放量节奏。
Visible Touch 论文提出把接触信号暴露在策略已关注的同一空间坐标系中,使任何图像条件策略无需架构改动即可直接利用触觉信息,并配套开源一款用现成零件经参数化 CAD-to-mold 流水线制造的低成本磁性接触传感器。
推荐理由:论文给出把接触信号嵌入策略已有视觉坐标系的做法与开源低成本传感器,读者可据此评估无需改动架构的触觉接入路径。
研究团队提出一种基于霍尔效应的紧凑型力传感器,含3个毫米级感应单元(taxel),可贴装于机器人手术工具抓取面,用于补偿微创手术中的触觉反馈缺失。传感器将霍尔效应传感器与磁体嵌入可变形弹性体接触层实现小型化,经6自由度(DoF)并联机器人标定,每个taxel检测法向与剪切力的平均RMSE为2.133 kPa。标定后的传感器在仿体与离体猪组织上完成验证,可感知牵拉过程中的触觉与滑动。
论文系统研究高分辨率动态触觉传感对灵巧机械手抓握稳定性预测的作用,采集了覆盖 200 个物体、共 10,000 次抓握试验的数据集,每只多指手配备四个 Digit 360 触觉传感器,同步记录视觉、本体感觉与触觉流。
论文提出一种紧凑型移动机器人,用折纸结构轮实现移动并主动调节传感几何:轮子在地形自适应构型间切换时底盘俯仰带动 2D LiDAR 扫过不同高度,IMU 提供姿态,融合节点将 LiDAR 点云投影进 RTAB-Map 的 RGB-D 深度流。
论文提出紧凑磁纤毛触觉传感器 MagCilia,将柔性磁纤毛结构与 Hall 传感器结合实现 3D 力感知,并提出因果历史融合回归 CHFR 从耦合磁通道重建力。
论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。
SAFE 是一种低成本通用传感方案,用两个无源 PVDF 声学传感器加电机本体感知,在不依赖视觉和先验材料知识的情况下实时检测抓取中的滑移与断裂。
FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。
推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。
论文提出低成本力控平行夹爪 TF-Gripper,售价约$150,有效力控范围0.45-45 N,兼容不同机械臂,并配套遥操作设备记录人手抓取力。作者进一步提出 RETAF 框架,将抓取力控制与臂部位姿预测解耦,用腕部图像和触觉反馈高频调节力,实验显示在六项真实任务中直接力控相比位置控制提升抓取稳定性与整体表现,触觉反馈对力控调节必不可少,RETAF 优于基线且可与多种基础策略集成。
R2RI 是首个专为机器人间交互(RRI)任务设计的数据集,包含多款人形机器人基于真实人类社交行为建模的交互场景,提供各机器人机载传感器的第一人称视角与外部固定相机的第三视角。数据集涵盖 Event 与 RGB 两种模态,规模超过 6.5M 帧、约 5000 段视频,帧率达 120 fps,已公开发布全部任务与模态的数据及标注,并对比了两种模态在多项感知与交互任务上的表现。
NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。
推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。
一种荧光增强胡须阵列水下传感系统通过局部光学读出实现流源定位,池试平均空间定位误差 88 mm(半径 73.5 mm、角度 2.5°),测试区域 600 mm、±30°。系统由 5 根镍钛合金芯、荧光聚氨酯壳胡须配紫外激发与单目相机构成,用轻量 CNN 从 2 s 序列估计定位,并完成移动推进器的实时定位演示。
论文提出 RoboCap,一款 250g、配六相机与双 IMU 的头戴设备,用于野外第一视角机器人操作数据采集,并配套设备无关的 Grounded API 3D 算法套件。
提出开放世界全景分割方法 Con2MAV,可在测试时发现新语义类别与新物体实例,并保持增量发现类别间的一致性,在道路到水下多类数据集上展现开放世界分割能力与已知类别竞争力。同时发布自动驾驶异常分割基准 PANIC,含 800 张图像、50 多个未知类别、4,000 多个物体实例及像素级语义与实例标注,并提供隐藏测试集竞赛。实现将在录用后开源,论文已被 IJRR 接收。
Dr-LiSA 提出首个将 2D 旋转雷达强度测量在 SE(3) 中与 3D 激光雷达地图配准的直接方法,通过学习式前向模型从候选位姿的激光雷达子图预测雷达测量,实现预测与观测雷达扫描的直接光度对齐。在超过 90 km 道路数据上,其 SE(2) 精度超越既有雷达-激光雷达方法,并与最先进雷达-雷达定位的平面精度相当。
CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。
GEM-Occ 提出 Gaussian Evidence Memory 框架,将多视角累积的几何与语义证据整合为持久的语义占据记忆,支持跨房间的持续建图与高效查询。团队同时发布 HIOcc 基准,统一语义标签空间与评测框架,覆盖局部预测、房间级在线建图和建筑级建图。实验显示 GEM-Occ 在 HIOcc 上优于现有方法,兼顾内存占用与占据查询速度。
研究团队发布 FoMo 多季节数据集,在北方森林中历时一年、12 次部署采集超过 64 km 的六条多样化轨迹,用于挑战现有里程计与 SLAM 流程。数据涵盖旋转与混合固态激光雷达、FMCW 雷达、立体与单目相机及两个 IMU,真值由三台 GNSS 接收机与静态基站后处理得到,并附气象站、相机标定和车辆功耗等元数据。
该研究首次给出未知输入驱动的非线性系统状态估计的通用结构解,提出 UID 诱导正规形,将未知输入信息分解为与可观测动力学结构解耦的方向和完全表征其影响的可观测量,无需对未知输入作模型或随机假设即可统一实现解耦与重构。在最小 Structure-from-Motion 配置中,仅用 3 个点特征和单轴陀螺仪即可递归估计状态,恢复三维结构与相机运动(差一个未知全局尺度因子),真实数据实验验证了可行性。
研究者构建并评估了一套仅用单目相机与视觉惯性里程计(VIO)的手持行人预测系统,将检测到的人通过射线-平面交点抬升到地面,在重力对齐的度量坐标系中跟踪,并用小型 U-Net 以负对数似然(NLL)损失输出逐步概率热力图。
研究者利用流固耦合开发出一类传感端完全不含电子元件的软体触觉传感器,仅用两个外部压力传感器连接充液弹性通道,通过黏性流体位移产生的压力模式编码触碰位置与力。机器学习框架结合特征提取、软聚类与自适应神经模糊推理实现定位与力估计,并在 1D 线性传感器上验证后用空间填充曲线扩展到 2D 触觉映射。该方案在水下或强磁干扰等常规电子传感器易失效的环境中依然有效。
研究者将微型 UAV 的定位栈整体卸载到带 7 自由度机械臂的四足机器人上,由臂端相机检测机载 AprilTag 标记并融合四足自身定位,为裸机 27 g、带标记 42 g 的无人机提供完整 6-DOF 位姿。实验室飞行中外部位姿精度达 12-16 mm,自主飞行与动捕控制相差 2-5 cm。四足主动跟随使跟踪误差从 11.0 cm 降至 6.9 cm。
Radar2Plan 提出首个面向自动驾驶规划、基于真实世界 4D 雷达数据的开环自车轨迹规划基准,通过统一接口连接传感器编码器、场景表示与规划头。基于 DSERT-RoLL 与 MAN TruckScenes,基准在 12 种天气与光照条件下评测了相机、4D 雷达与 LiDAR 的 7 种组合、4 种规划基线。实验显示 4D 雷达单独即可支撑有竞争力的轨迹规划,并在恶劣条件下保持稳健表现。
研究者在 MuJoCo 中为 Multi-Modal Infant Model(MIMo)扩展了具身照护者模型,可参数化自人体测量数据或按录制的照护者调整尺寸,并支持回放自然的抱持与安抚互动。
该研究为机器人超声提出一种双速率力-图像控制器,通过闭式姿态速率上限约束旋转引起的估计接触力偏移,上限取决于局部接触刚度、力环增益、旋转-力增益界、偏移预算与预测时域。
一篇自动驾驶研究论文总结了开发和部署灵活多传感器数据采集平台时遇到的挑战与经验,涵盖机械设计、传感器标定、电源管理和时间同步等共性问题。团队采用 GNSS 授时与 NTP 协议实现系统级时间同步,并针对不同传感器配置编写自定义标定流程,以提升外场部署的可靠性与数据完整性。论文旨在为新建多传感器系统的研究团队提供参考,增强自动驾驶测试的可复现性与鲁棒性。
TacGELLO 利用 3D 打印主手已有的舵机,在夹爪扳机处提供触觉接触反馈,并在臂关节处提供基于电流的负载提示。AnySkin 接触检测触发扳机位置保持,跟随臂关节电流变化调整主手舵机输出限值以在抬升时产生阻力。在一名操作者完成的 6 次 UR3 会话中,发送指令跟踪误差为 0.15–0.36° RMSE,轨迹滞后 82–98 ms,62 个抓取区间中有 60 个记录到触觉触发。
GR-LIO 提出一种滤波式局部地面感知 LiDAR-惯性里程计框架,将局部地面平面以机器人姿态和机身-地面(B-G)高度参数化并随状态估计持续传播,用于高效地面分割与点到面约束更新。系统引入平面运动更新抑制垂直漂移,并提供 B-G 高度初始化与在线标定流程。在公开基准与自采真实数据集上,GR-LIO 在定位精度和计算效率上均优于代表性 LIO 方法。
研究者在 NVIDIA Jetson AGX Orin 上提出一套实时、失效模式感知的多模态可通行性建图流程,以 LiDAR 几何为主、单目语义为按类别与置信度门控的修正信号,纠正湿泥、积水混凝土与减速带等互补失效模式。
提出 tracker-guided 自训练框架,将合成图像预训练模型适配到无标注真实视频,用于手术机器人器械跟踪。不确定性感知 EKF 结合关键点、轴边界与 mask 线索递归修正器械位姿,RTS 平滑器细化轨迹并生成伪标签微调特征检测器。真实视频实验显示自训练在所有关键点指标上一致提升,精度与运行时均优于既有方法,代码与数据将在发表后发布。
VICON 提出视觉-惯性-接触手物跟踪框架,通过改造视觉惯性手套并按人类抓握频率布置 FSR 力敏电阻,同步记录接触状态与标定法向力,配合 RGB-D 相机与单目视频重建网格、基于因子图的物体轨迹估计,在严重遮挡下联合捕捉手物运动与接触信息。
TANav 用一次短暂轻推测量推压阻力,由 TacPhys 读取力序列(可选 RGB-D 与运动学)估计质量以决定是否授权推压。仿真中将漏推率从 28.7% 降至 5.5%,重复巡逻下恢复 oracle 90% 的路径节省、边界违规从 4.3% 降至 2.9%。
提出分布式级联力控制(DCFC),使配备 360 度视觉软触觉传感器的多机器人在无机器人间通信下协同推动刚体朝移动目标方向运动。内环融合接触力与定位,外环协调推力方向,对未知物体质量具有鲁棒性,并用 Lyapunov 稳定性理论验证收敛性。仿真与真实实验验证了多机器人协同推动效果,成果发表于 2024 IEEE/SICE SII。
提出一种雷达-LiDAR-相机在线无目标外参联合标定框架,为每对传感器构建残差并整体优化全部外参,避免两两标定结果跨三传感器不一致。框架引入基于距离相关裕度的自适应雷达噪声滤波器剔除虚假回波,并通过跨帧累积聚合稀疏雷达对应点。在覆盖多种城市环境的自采雷达-LiDAR-相机数据集上,该方法在所有传感器对上的标定误差均优于先进的相机-LiDAR 基线。
NM-LIO 提出噪声感知的多 LiDAR 惯性里程计方法,通过集成噪声模型量化每个 LiDAR 的测量噪声,并基于测量噪声估计残差不确定性,使测量模型能捕捉不同 LiDAR 间的噪声差异。该方法在公开多 LiDAR 数据集上与最新方法对比,实验结果表明其能在多种环境中准确估计里程计。论文发表于 RiTA 2024。
TacOT 提出触觉引导最优传输框架,用动作-触觉动态时间规整识别人类与机器人演示中交互动力学一致的对应关系,再引导共享策略表示空间中的软最优传输对齐,无需预定义帧级配对。在 4 个真实灵巧操作任务上,闭环成功率较 action-guided OT 在分布内任务最高提升 17 个百分点,在定向人到机器人分布外迁移下提升 20 个百分点。
研究者提出 ATOC(Asynchronous Tracking and Optical Communication)系统,将 LED smart-beacon 调制、事件相机检测、光学跟踪与事件数据解调集成到单一管线,可同时跟踪并解调多个 LED smart beacon,把传统视觉标记变成定向、空间局部化的通信通道。系统在实验室研究、智慧城市演示和 3D 动作捕捉系统中得到验证。
该研究提出一种面向地面机器人的表面表示学习方法,通过预测机器人下一时刻状态并引入注意力模块,将新表面类别作为可训练向量加入,实现开放式表面分类。在 Belyaev-Kushnarev 数据集上分类准确率达 98.56%,在 BorealTC 上达 94.8%。
Autoware 开源自动驾驶平台正被扩展到建筑工地的大型自卸卡车,但工地的非结构化地形、扬尘和持续变化的现场条件挑战了公共道路自动驾驶系统的多项假设。研究在感知、建图、定位、规划与控制等模块中识别出公共道路与越野建筑应用之间的差距,并重点讨论基于 LiDAR 的感知流水线开发与现场测试发现。论文最后提出面向建筑车辆端到端自动驾驶的路线图。