[审计] v1 必须防止当前的入职失败
作者: prekshivyas创建于 2026年9月18日更新于 2026年9月18日
标签area: onboardingarea: sandboxneeds: triageplatform: containerarea: architecture
□ 决定请求
使用当前登入流中发现的故障作为v1的接受标准. 默认执行目标是v1;这个问题并不要求同时重写`main'上的遗留流。
只有在维护者查明了释放屏蔽、安全或即时数据损失风险时,才单独考虑 " 主要 " 后端。
□ 结果
审计发现有6个源级故障模式和26个相关报告,涉及安装、图像选择、沙盒创建、准备状态和重试。 它们共同确定了v1应满足的最低恢复和诊断合同。
报告的用户故障是一个链条:
- 所管理图像不详。
- NemoClaw开始缓慢的地方建设。
- 目标存储充满。
- 沙盒达到 " 不准备 " 。
- 娱乐需要来自无法接受SSH的沙盒的SSH备份.
- 备份路径去除有用的SSH出错.
OpenShell拥有活沙盒生命周期. NemoClaw拥有理想状态,安装意图,资源身份,证书,恢复决定,以及成功操作的意义.
□什么v1已经改进
v1分支用一个理想的状态计划/应用路径和持久资源绑定来取而代之的必须登入序列. 它还检查Docker引擎存储根在已知所需下载和准备大小时用于管理模型工作的确切位置.
证据:
这些基础解决了部分问题。 它们尚未提供完整的存储目的地清单、结构化故障背景、本土数据恢复程序,或经核实的在故障后或被销毁后保留的所有物的清单。
□v1接受要求
- 记录的变异意图和确切的资源身份
在外部突变之前或之后,保留足够的持久身份,以便在中断后仅采用、重新试验、补偿或取出该资源。 重试不得产生重复,因为先前的命令在突变和收件出版之间停止了.
覆盖供应商、沙盒、包件安装、数量、路线和其他自有资源。
- 使数据保存成为可能、明确和有限度
当资源状态已经证明可能无法运输时,不需要像SSH这样的运输. 计划/应用应区分:
- 备份成功;
- 没有发现可收回的数据;
- 由于所述原因,不可能提供支援;
- 用户明确授权在无 . . . . . . .
内容来源: NVIDIA/NemoClaw