MegaSaM系统提出了一个能从动态场景的随意单目视频中准确、快速且稳健地估计相机参数和深度图的系统。传统运动和单目SLAM技术大多假设输入视频是静态场景且有大量视差,否则易产生错误估计,虽近期基于神经网络的方法尝试克服相关挑战,但在摄像机运动不受控或视野未知的动态视频中,要么计算成本高要么很脆弱。而文中展示的深度视觉SLAM框架效果惊人,经对其训练和推理方案仔细修改,可扩展至含不受约束摄像机路径的复杂动态场景的真实视频(包括视差小的视频),通过对合成及真实视频的大量实验,该系统相比之前及同期工作,在相机姿态和深度估计方面更准确、稳健,运行时间也更快或相当。
GitHub地址:https://mega-sam.github.io/#demo
