#1977·warp

并行化图形所使用内核的编译

作者: c0d1f1ed创建于 2026年9月21日更新于 2026年9月21日
标签feature request

使用 Wrap 的应用程序的冷启动时间可能很长。Newton 的 MuJoCo ANYmal D 示例在功能强大的工作站上需要大约一分钟。大部分时间都用于编译内核模块。问题在于,它们是按需编译的,而且是串行的。CUDA 图形构建需要有一个有效的编译内核处理器。GH-1086 通过 `wp.load_module()` 和 `wp.force_load()` 并行编译模块,但这需要用户提前知道哪些模块会在早期需要。他们可能指定的模块太多,或者太少,或者内核可能具有不容易提前知道的特定功能。Warp 自己的持久捕获和重放用的图形表示以及 CPU 设备的 CUDA 图形等效结构,可以通过推迟多个模块的编译直到图形启动时间来提供解决方案。GH-1659 追踪了延迟 CUDA 图形创建本身的创建过程,而本问题则是基于此实现延迟编译。