PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf
mistral-7b-dpo-arena / added_tokens.json
gCao's picture
Add DPO model trained on Arena dataset
4cebb7d verified
Raw
History Blame Contribute Delete
51 Bytes
{
"<|im_end|>": 32000,
"<|im_start|>": 32001
}