#2223·litgpt

在 Google Colab 中进行预训练时没有保存任何检查点,尽管已设置 log.log_model 和 save_interval。

作者: harshitgavita-07创建于 2026年3月26日更新于 2026年9月8日
标签bug

问题描述 你好,我已经在 Google Colab 环境中调试了这个问题,并想分享我的发现,因为它们与本线程中的观察结果高度一致。调试步骤和使用的参数: - 使用 bf16-mixed 精度进行初始设置(适用于 T4 GPU)。 - 调整 train.max_stepstrain.save_interval(例如,将两者都设置为 5,用于短期运行)。 - 确保 log.log_model 明确设置为 true--log.log_model true)。 - 明确将 log.checkpoint_name 设置为 'last'--log.checkpoint_name 'last')。 - 修改 CLI 命令格式( !Python -m litgpt pretrain ...)。 - 删除 train.max_tokens 以避免过早终止,确保 max_steps 被遵守。 - 确认 litgpt[all] 和其他依赖已安装。观察到的结果: 尽管进行了所有这些修改,并成功执行了 pretrain 命令(用于短期运行,确认应该发生保存),但在指定的 out_dir 中(例如,out/custom-model/)从未保存任何模型检查点(.ckpt.pth)或 model_config.yaml 文件。只在 out/custom-model/logs/tensorboard/ 中持续生成了 TensorBoard 日志文件。在输出目录中运行 find 命令,确认没有任何与检查点相关的文件。这种行为表明 litgpt 框架中存在与检查点保存相关的根本问题,至少在 Google Colab 环境中如此,并且与其他人在此处报告的情况一致。我的测试表明,即使明确设置了 log.log_modeltrain.save_interval,也不会生成任何检查点。我希望这份详细的上下文有助于诊断根本原因。请让我知道我是否可以进行其他测试。鉴于这些发现,我认为这个问题仍然具有现实意义。谢谢。

内容来源: Lightning-AI/litgpt