#2364·sd-scripts

bf16/float RuntimeError - dtype incompatibility

Author: no-username-ideas-leftCreated May 29, 2026Updated May 29, 2026

When training an anima lora, got the following error:

[rank3]: Traceback (most recent call last):
[rank3]:   File "/workspace/sd-scripts/anima_train_network.py", line 451, in <module>
[rank3]:     trainer.train(args)
[rank3]:   File "/workspace/sd-scripts/train_network.py", line 1427, in train
[rank3]:     loss = self.process_batch(
[rank3]:            ^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/anima_train_network.py", line 361, in process_batch
[rank3]:     return super().process_batch(
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/train_network.py", line 451, in process_batch
[rank3]:     noise_pred, target, timesteps, weighting = self.get_noise_pred_and_target(
[rank3]:                                                ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/anima_train_network.py", line 308, in get_noise_pred_and_target
[rank3]:     model_pred = anima(
[rank3]:                  ^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank3]:     return self._call_impl(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank3]:     return forward_call(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 814, in forward
[rank3]:     return model_forward(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 802, in __call__
[rank3]:     return convert_to_fp32(self.model_forward(*args, **kwargs))
[rank3]:                            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/amp/autocast_mode.py", line 44, in decorate_autocast
[rank3]:     return func(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/library/anima_models.py", line 1375, in forward
[rank3]:     return self.forward_mini_train_dit(x, timesteps, context, fps=fps, padding_mask=padding_mask, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/library/anima_models.py", line 1353, in forward_mini_train_dit
[rank3]:     x_B_T_H_W_D = block(x_B_T_H_W_D, t_embedding_B_T_D, crossattn_emb, attn_params, use_fp32, **block_kwargs)
[rank3]:                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank3]:     return self._call_impl(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank3]:     return forward_call(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/library/anima_models.py", line 1020, in forward
[rank3]:     return self._forward(
[rank3]:            ^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/library/anima_models.py", line 882, in _forward
[rank3]:     self.adaln_modulation_self_attn(emb_B_T_D) + adaln_lora_B_T_3D
[rank3]:     ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank3]:     return self._call_impl(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank3]:     return forward_call(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/container.py", line 253, in forward
[rank3]:     input = module(input)
[rank3]:             ^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank3]:     return self._call_impl(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank3]:     return forward_call(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/networks/lora_anima.py", line 87, in forward
[rank3]:     lx = self.lora_down(x)
[rank3]:          ^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank3]:     return self._call_impl(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank3]:     return forward_call(*args, **kwargs)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/linear.py", line 134, in forward
[rank3]:     return F.linear(input, self.weight, self.bias)
[rank3]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank3]: RuntimeError: expected mat1 and mat2 to have the same dtype, but got: c10::BFloat16 != float
[rank1]: Traceback (most recent call last):
[rank1]:   File "/workspace/sd-scripts/anima_train_network.py", line 451, in <module>
[rank1]:     trainer.train(args)
[rank1]:   File "/workspace/sd-scripts/train_network.py", line 1427, in train
[rank1]:     loss = self.process_batch(
[rank1]:            ^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/anima_train_network.py", line 361, in process_batch
[rank1]:     return super().process_batch(
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/train_network.py", line 451, in process_batch
[rank1]:     noise_pred, target, timesteps, weighting = self.get_noise_pred_and_target(
[rank1]:                                                ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/anima_train_network.py", line 308, in get_noise_pred_and_target
[rank1]:     model_pred = anima(
[rank1]:                  ^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank1]:     return self._call_impl(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank1]:     return forward_call(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 814, in forward
[rank1]:     return model_forward(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 802, in __call__
[rank1]:     return convert_to_fp32(self.model_forward(*args, **kwargs))
[rank1]:                            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/amp/autocast_mode.py", line 44, in decorate_autocast
[rank1]:     return func(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/library/anima_models.py", line 1375, in forward
[rank1]:     return self.forward_mini_train_dit(x, timesteps, context, fps=fps, padding_mask=padding_mask, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/library/anima_models.py", line 1353, in forward_mini_train_dit
[rank1]:     x_B_T_H_W_D = block(x_B_T_H_W_D, t_embedding_B_T_D, crossattn_emb, attn_params, use_fp32, **block_kwargs)
[rank1]:                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank1]:     return self._call_impl(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank1]:     return forward_call(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/library/anima_models.py", line 1020, in forward
[rank1]:     return self._forward(
[rank1]:            ^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/library/anima_models.py", line 882, in _forward
[rank1]:     self.adaln_modulation_self_attn(emb_B_T_D) + adaln_lora_B_T_3D
[rank1]:     ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank1]:     return self._call_impl(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank1]:     return forward_call(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/container.py", line 253, in forward
[rank1]:     input = module(input)
[rank1]:             ^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank1]:     return self._call_impl(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank1]:     return forward_call(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/networks/lora_anima.py", line 87, in forward
[rank1]:     lx = self.lora_down(x)
[rank1]:          ^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank1]:     return self._call_impl(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank1]:     return forward_call(*args, **kwargs)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/linear.py", line 134, in forward
[rank1]:     return F.linear(input, self.weight, self.bias)
[rank1]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank1]: RuntimeError: expected mat1 and mat2 to have the same dtype, but got: c10::BFloat16 != float
[rank2]: Traceback (most recent call last):
[rank2]:   File "/workspace/sd-scripts/anima_train_network.py", line 451, in <module>
[rank2]:     trainer.train(args)
[rank2]:   File "/workspace/sd-scripts/train_network.py", line 1427, in train
[rank2]:     loss = self.process_batch(
[rank2]:            ^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/anima_train_network.py", line 361, in process_batch
[rank2]:     return super().process_batch(
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/train_network.py", line 451, in process_batch
[rank2]:     noise_pred, target, timesteps, weighting = self.get_noise_pred_and_target(
[rank2]:                                                ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/anima_train_network.py", line 308, in get_noise_pred_and_target
[rank2]:     model_pred = anima(
[rank2]:                  ^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank2]:     return self._call_impl(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank2]:     return forward_call(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 814, in forward
[rank2]:     return model_forward(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 802, in __call__
[rank2]:     return convert_to_fp32(self.model_forward(*args, **kwargs))
[rank2]:                            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/amp/autocast_mode.py", line 44, in decorate_autocast
[rank2]:     return func(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/library/anima_models.py", line 1375, in forward
[rank2]:     return self.forward_mini_train_dit(x, timesteps, context, fps=fps, padding_mask=padding_mask, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/library/anima_models.py", line 1353, in forward_mini_train_dit
[rank2]:     x_B_T_H_W_D = block(x_B_T_H_W_D, t_embedding_B_T_D, crossattn_emb, attn_params, use_fp32, **block_kwargs)
[rank2]:                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank2]:     return self._call_impl(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank2]:     return forward_call(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/library/anima_models.py", line 1020, in forward
[rank2]:     return self._forward(
[rank2]:            ^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/library/anima_models.py", line 882, in _forward
[rank2]:     self.adaln_modulation_self_attn(emb_B_T_D) + adaln_lora_B_T_3D
[rank2]:     ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank2]:     return self._call_impl(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank2]:     return forward_call(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/container.py", line 253, in forward
[rank2]:     input = module(input)
[rank2]:             ^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank2]:     return self._call_impl(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank2]:     return forward_call(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/networks/lora_anima.py", line 87, in forward
[rank2]:     lx = self.lora_down(x)
[rank2]:          ^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank2]:     return self._call_impl(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank2]:     return forward_call(*args, **kwargs)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/linear.py", line 134, in forward
[rank2]:     return F.linear(input, self.weight, self.bias)
[rank2]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank2]: RuntimeError: expected mat1 and mat2 to have the same dtype, but got: c10::BFloat16 != float
[rank0]: Traceback (most recent call last):
[rank0]:   File "/workspace/sd-scripts/anima_train_network.py", line 451, in <module>
[rank0]:     trainer.train(args)
[rank0]:   File "/workspace/sd-scripts/train_network.py", line 1427, in train
[rank0]:     loss = self.process_batch(
[rank0]:            ^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/anima_train_network.py", line 361, in process_batch
[rank0]:     return super().process_batch(
[rank0]:            ^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/train_network.py", line 451, in process_batch
[rank0]:     noise_pred, target, timesteps, weighting = self.get_noise_pred_and_target(
[rank0]:                                                ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/anima_train_network.py", line 308, in get_noise_pred_and_target
[rank0]:     model_pred = anima(
[rank0]:                  ^^^^^^
[rank0]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1778, in _wrapped_call_impl
[rank0]:     return self._call_impl(*args, **kwargs)
[rank0]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/nn/modules/module.py", line 1789, in _call_impl
[rank0]:     return forward_call(*args, **kwargs)
[rank0]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 814, in forward
[rank0]:     return model_forward(*args, **kwargs)
[rank0]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/accelerate/utils/operations.py", line 802, in __call__
[rank0]:     return convert_to_fp32(self.model_forward(*args, **kwargs))
[rank0]:                            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/venv/lib/python3.12/site-packages/torch/amp/autocast_mode.py", line 44, in decorate_autocast
[rank0]:     return func(*args, **kwargs)
[rank0]:            ^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/library/anima_models.py", line 1375, in forward
[rank0]:     return self.forward_mini_train_dit(x, timesteps, context, fps=fps, padding_mask=padding_mask, **kwargs)
[rank0]:            ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank0]:   File "/workspace/sd-scripts/library/anima_models.py", line 1353, in forward_mini_train_dit
[rank0]:     x_B_T_H_W_D = block(x_B_T_H_W_D, t_embedding_B_T_D, crossattn_emb, attn_params, use_fp32, **block_kwargs)
[rank0]:                   ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
[rank