OLMo-3 DPO delta-learning checkpoints

Preference-trained OLMo-3 checkpoints from size-pair / swapped delta-learning DPO experiments (sycophancy-confidence).

Each top-level folder is one training run (HF transformers-loadable weights, plus step_500 DeepSpeed state).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support