This model is the Chinese HDPO checkpoint for Qwen2.5-1.5B.
Base model used for HDPO policy training:
sathiiiii/polyalign-qwen2.5-1.5b-zh-dist-sft
The HDPO preference data was scored offline with the PolyAlign MLP critic.
Chat template
Files info
Base model