Prepare dataset [chapter] deterministic
df = pd.read_csv("preferences.csv") # columns: chosen, rejected dataset = Dataset.from_pandas(df) def preprocess(example): chosen_input = tokenizer(example["chosen"], truncation=True, padding="max_le
df = pd.read_csv("preferences.csv") # columns: chosen, rejected dataset = Dataset.from_pandas(df) def preprocess(example): chosen_input = tokenizer(example["chosen"], truncation=True, padding="max_length", max_length=512) rejected_input = tokenizer(example["rejected"], truncation=True, padding="max_length", max_length=512) return { "chosen_input_ids": chosen_input["input_ids"], "rejected_input_ids": rejected_input["input_ids"], "chosen_attention_mask": chosen_input["attention_mask"], "rejected_attention_mask": rejected_input["attention_mask"], } dataset = dataset.map(preprocess, batched=True)
Sources
Related (0)
No recorded relationships.