Not a member of Pastebin yet?
Sign Up,
it unlocks many cool features!
- `use_cache=True` is incompatible with gradient checkpointing. Setting `use_cache=False`.
- `loss_type=None` was set in the config but it is unrecognised.Using the default loss: `ForCausalLMLoss`.
- Traceback (most recent call last):
- File "/workspace/scoring_scorer_train.py", line 506, in <module>
- trainer.train()
- File "/usr/local/lib/python3.11/dist-packages/transformers/trainer.py", line 2122, in train
- return inner_training_loop(
- ^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/transformers/trainer.py", line 2474, in _inner_training_loop
- tr_loss_step = self.training_step(model, inputs, num_items_in_batch)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/transformers/trainer.py", line 3572, in training_step
- loss = self.compute_loss(model, inputs, num_items_in_batch=num_items_in_batch)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/transformers/trainer.py", line 3625, in compute_loss
- outputs = model(**inputs)
- ^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/nn/modules/module.py", line 1553, in _wrapped_call_impl
- return self._call_impl(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/nn/modules/module.py", line 1562, in _call_impl
- return forward_call(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/accelerate/utils/operations.py", line 823, in forward
- return model_forward(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/accelerate/utils/operations.py", line 811, in __call__
- return convert_to_fp32(self.model_forward(*args, **kwargs))
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/amp/autocast_mode.py", line 43, in decorate_autocast
- return func(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/peft/peft_model.py", line 812, in forward
- return self.get_base_model()(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/nn/modules/module.py", line 1553, in _wrapped_call_impl
- return self._call_impl(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/nn/modules/module.py", line 1562, in _call_impl
- return forward_call(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/peft/peft_model.py", line 812, in forward
- return self.get_base_model()(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/nn/modules/module.py", line 1553, in _wrapped_call_impl
- return self._call_impl(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/torch/nn/modules/module.py", line 1562, in _call_impl
- return forward_call(*args, **kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/transformers/models/llama/modeling_llama.py", line 1214, in forward
- loss = self.loss_function(logits=logits, labels=labels, vocab_size=self.config.vocab_size, **loss_kwargs)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- File "/usr/local/lib/python3.11/dist-packages/transformers/loss/loss_utils.py", line 42, in ForCausalLMLoss
- shift_logits = shift_logits.view(-1, vocab_size)
- ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
- RuntimeError: shape '[-1, 128256]' is invalid for input of size 17136
- 0%| | 0/310 [00:01<?, ?it/s]
Advertisement
Add Comment
Please, Sign In to add comment