上篇华为的面经反响不错,这篇继续——华为的机器视觉工程师面试。有个朋友前阵子去面了,回来跟我吐槽说面试官追问—3D感知/点云处理追问了半小时。我听完觉得这些问题确实问得好,值得拆开来聊聊。
SLAM:华为为什么重点考这个
华为的机器视觉工程师面试,SLAM几乎是必考项。这跟他们产品线的技术需求直接相关——人形机器人(内部)对SLAM的要求很高。
面试官问:“激光SLAM和视觉SLAM各有什么优缺点?”
激光SLAM精度高、对光照不敏感,但成本高、稀疏环境下容易退化。视觉SLAM成本低、信息丰富(语义+纹理),但受光照影响大、快速运动时容易丢。实际项目里我们用激光+视觉融合——激光提供稳定的位姿估计,视觉提供语义信息。融合的关键是时间同步和外参标定,时间同步误差大于10ms会导致融合漂移。
面试官继续追问:“这个方案的性能瓶颈在哪里?怎么优化?”
性能瓶颈通常在计算量和通信带宽。我们通过三个方向优化:算法层面做降维和近似,工程层面用SIMD/GPU加速,系统层面做异步和流水线。最终把延迟从50ms降到了8ms。
深度估计:华为为什么重点考这个
华为的机器视觉工程师面试,深度估计几乎是必考项。这跟他们产品线的技术需求直接相关——人形机器人(内部)对深度估计的要求很高。
面试官问:“单目深度估计在机器人上能用吗?”
单目深度估计(如MiDaS、Depth Anything)在机器人上可以用,但精度不够做导航——绝对误差可能有10-20%。更适合做语义级理解(哪个区域近、哪个远),而不是精确的障碍物距离测量。我们的做法是单目深度做粗略场景理解,激光/ToF做精确测距,两者互补。