错误: torch.distributed.elastic.multiprocessing.api: 失败 (退出代码: -9) 本地进程编号: 0
作者: cpt9m0创建于 2023年4月25日更新于 2025年6月15日
Here is my command to start training:
#!/bin/bash
CUDA_LAUNCH_BLOCKING=1 torchrun --nproc_per_node=4 --master_port=9292 train.py
--model_name_or_path ./models/LLaMA-7b
--data_path ./alpaca_data.json
--fp16 True
--output_dir alpaca_out
--num_train_epochs 3
--per_device_train_batch_size 4
...
内容来源: tatsu-lab/stanford_alpaca