nam-2pir

PiScorerTrainer

Jan 21st, 2025
149
0
Never
Not a member of Pastebin yet? Sign Up, it unlocks many cool features!
text 3.47 KB | None | 0 0
  1. TrainingArguments(
  2. _n_gpu=1,
  3. accelerator_config={'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None, 'use_configured_state': False},
  4. adafactor=False,
  5. adam_beta1=0.9,
  6. adam_beta2=0.999,
  7. adam_epsilon=1e-08,
  8. auto_find_batch_size=False,
  9. average_tokens_across_devices=False,
  10. batch_eval_metrics=False,
  11. bf16=True,
  12. bf16_full_eval=False,
  13. data_seed=None,
  14. dataloader_drop_last=False,
  15. dataloader_num_workers=0,
  16. dataloader_persistent_workers=False,
  17. dataloader_pin_memory=True,
  18. dataloader_prefetch_factor=None,
  19. ddp_backend=None,
  20. ddp_broadcast_buffers=None,
  21. ddp_bucket_cap_mb=None,
  22. ddp_find_unused_parameters=None,
  23. ddp_timeout=1800,
  24. debug=[],
  25. deepspeed=None,
  26. disable_tqdm=False,
  27. dispatch_batches=None,
  28. do_eval=True,
  29. do_predict=False,
  30. do_train=False,
  31. eval_accumulation_steps=None,
  32. eval_delay=0,
  33. eval_do_concat_batches=True,
  34. eval_on_start=False,
  35. eval_steps=5000,
  36. eval_strategy=IntervalStrategy.STEPS,
  37. eval_use_gather_object=False,
  38. evaluation_strategy=None,
  39. fp16=False,
  40. fp16_backend=auto,
  41. fp16_full_eval=False,
  42. fp16_opt_level=O1,
  43. fsdp=[],
  44. fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False},
  45. fsdp_min_num_params=0,
  46. fsdp_transformer_layer_cls_to_wrap=None,
  47. full_determinism=False,
  48. gradient_accumulation_steps=4,
  49. gradient_checkpointing=True,
  50. gradient_checkpointing_kwargs=None,
  51. greater_is_better=None,
  52. group_by_length=False,
  53. half_precision_backend=auto,
  54. hub_always_push=False,
  55. hub_model_id=None,
  56. hub_private_repo=None,
  57. hub_strategy=HubStrategy.EVERY_SAVE,
  58. hub_token=<HUB_TOKEN>,
  59. ignore_data_skip=False,
  60. include_for_metrics=[],
  61. include_inputs_for_metrics=False,
  62. include_num_input_tokens_seen=False,
  63. include_tokens_per_second=False,
  64. jit_mode_eval=False,
  65. label_names=None,
  66. label_smoothing_factor=0.0,
  67. learning_rate=8e-05,
  68. length_column_name=length,
  69. load_best_model_at_end=False,
  70. local_rank=0,
  71. log_level=passive,
  72. log_level_replica=warning,
  73. log_on_each_node=True,
  74. logging_dir=outputs/runs/Jan22_01-58-30_e489f5f3792f,
  75. logging_first_step=False,
  76. logging_nan_inf_filter=True,
  77. logging_steps=5000,
  78. logging_strategy=IntervalStrategy.STEPS,
  79. lr_scheduler_kwargs={},
  80. lr_scheduler_type=SchedulerType.COSINE,
  81. max_grad_norm=1.0,
  82. max_steps=-1,
  83. metric_for_best_model=None,
  84. mp_parameters=,
  85. neftune_noise_alpha=None,
  86. no_cuda=False,
  87. num_train_epochs=10,
  88. optim=OptimizerNames.ADAMW_TORCH,
  89. optim_args=None,
  90. optim_target_modules=None,
  91. output_dir=outputs,
  92. overwrite_output_dir=False,
  93. past_index=-1,
  94. per_device_eval_batch_size=16,
  95. per_device_train_batch_size=16,
  96. prediction_loss_only=False,
  97. push_to_hub=False,
  98. push_to_hub_model_id=None,
  99. push_to_hub_organization=None,
  100. push_to_hub_token=<PUSH_TO_HUB_TOKEN>,
  101. ray_scope=last,
  102. remove_unused_columns=False,
  103. report_to=['wandb'],
  104. restore_callback_states_from_checkpoint=False,
  105. resume_from_checkpoint=None,
  106. run_name=outputs,
  107. save_on_each_node=False,
  108. save_only_model=False,
  109. save_safetensors=True,
  110. save_steps=5000,
  111. save_strategy=SaveStrategy.STEPS,
  112. save_total_limit=None,
  113. seed=3407,
  114. skip_memory_metrics=True,
  115. split_batches=None,
  116. tf32=None,
  117. torch_compile=False,
  118. torch_compile_backend=None,
  119. torch_compile_mode=None,
  120. torch_empty_cache_steps=None,
  121. torchdynamo=None,
  122. tpu_metrics_debug=False,
  123. tpu_num_cores=None,
  124. use_cpu=False,
  125. use_ipex=False,
  126. use_legacy_prediction_loop=False,
  127. use_liger_kernel=False,
  128. use_mps_device=False,
  129. warmup_ratio=0.0,
  130. warmup_steps=1,
  131. weight_decay=0.01,
  132. )
Advertisement
Add Comment
Please, Sign In to add comment