关于我的奇怪用例

作者: filelele创建于 2026年8月14日更新于 2026年8月14日

感谢您的公开工作。我想问一下,如果我这样使用模型,性能是否稳定: 1. 仔细地预捕获 N 帧的一个有限场景,覆盖该场景中的所有内容。 2. 帧的捕获方式是,在 t-1 和 t 之间存在大量重叠。 3. 使用直接模式,将 keyframe_interval 设置为 1,以便将所有这些 N 帧的完整 KV 缓存存储起来。 4. 新帧到来(我们称之为查询帧),来自场景的随机位置,不与上述 N 帧中的最后一帧 t_N 重叠,但肯定与其中至少一个帧重叠。 5. 获取查询帧的相机姿态。 简而言之,我想纯粹将 lingbot-map 用作视觉定位。 如果这样使用会导致性能下降吗?

内容来源: Robbyant/lingbot-map