Not a member of Pastebin yet?
Sign Up,
it unlocks many cool features!
- import tensorflow as tf
- from transformers import GPT2LMHeadModel, GPT2Tokenizer, TextDataset, DataCollatorForLanguageModeling
- from transformers import Trainer, TrainingArguments
- # Load pre-trained model and tokenizer
- model = GPT2LMHeadModel.from_pretrained("gpt2")
- tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
- # Prepare domain-specific dataset
- train_dataset = TextDataset(
- tokenizer=tokenizer,
- file_path="legal_corpus.txt",
- block_size=128
- )
- data_collator = DataCollatorForLanguageModeling(
- tokenizer=tokenizer, mlm=False
- )
- # Set up training arguments
- training_args = TrainingArguments(
- output_dir="./legal_gpt2",
- overwrite_output_dir=True,
- num_train_epochs=3,
- per_device_train_batch_size=4,
- save_steps=10_000,
- save_total_limit=2,
- )
- # Create Trainer instance
- trainer = Trainer(
- model=model,
- args=training_args,
- data_collator=data_collator,
- train_dataset=train_dataset,
- )
- # Fine-tune the model
- trainer.train()
Advertisement
Add Comment
Please, Sign In to add comment