UnfaithRL/OLMo-2-0425-1B-Instruct-mmlu_trained_ha-1024 Reinforcement Learning • 1B • Updated 12 days ago • 28
UnfaithRL/OLMo-2-0425-1B-Instruct-mmlu_trained_ha-2048 Reinforcement Learning • 1B • Updated 12 days ago • 34
UnfaithRL/Qwen2.5-0.5B-Instruct-mmlu_trained_ha-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 34
UnfaithRL/Qwen2.5-0.5B-Instruct-mmlu_trained_ha-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 35
UnfaithRL/Qwen2.5-0.5B-Instruct-mmlu_trained_ha-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 26
UnfaithRL/OLMo-2-0425-1B-code_problems_hint_following-1024 Reinforcement Learning • 1B • Updated 12 days ago • 27
UnfaithRL/OLMo-2-0425-1B-code_problems_hint_following-2048 Reinforcement Learning • 1B • Updated 12 days ago • 34
UnfaithRL/Qwen2.5-0.5B-code_problems_hint_following-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 35
UnfaithRL/Qwen2.5-0.5B-code_problems_hint_following-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 31
UnfaithRL/OLMo-2-0425-1B-Instruct-code_problems_hint_following-1024 Reinforcement Learning • 1B • Updated 12 days ago • 34
UnfaithRL/OLMo-2-0425-1B-Instruct-code_problems_hint_following-2048 Reinforcement Learning • 1B • Updated 12 days ago • 33
UnfaithRL/Qwen2.5-0.5B-Instruct-code_problems_hint_following-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 37
UnfaithRL/Qwen2.5-0.5B-Instruct-code_problems_hint_following-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 39
UnfaithRL/OLMo-2-0425-1B-curriculum_learning-512 Reinforcement Learning • 1B • Updated 12 days ago • 33
UnfaithRL/OLMo-2-0425-1B-curriculum_learning-1024 Reinforcement Learning • 1B • Updated 12 days ago • 42
UnfaithRL/OLMo-2-0425-1B-curriculum_learning-2048 Reinforcement Learning • 1B • Updated 12 days ago • 42
UnfaithRL/Qwen2.5-0.5B-curriculum_learning-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 31
UnfaithRL/Qwen2.5-0.5B-curriculum_learning-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 35
UnfaithRL/Qwen2.5-0.5B-curriculum_learning-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 23
UnfaithRL/OLMo-2-0425-1B-shuffled_dataset-1024 Reinforcement Learning • 1B • Updated 12 days ago • 31
UnfaithRL/OLMo-2-0425-1B-shuffled_dataset-2048 Reinforcement Learning • 1B • Updated 12 days ago • 35
UnfaithRL/Qwen2.5-0.5B-shuffled_dataset-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 37
UnfaithRL/Qwen2.5-0.5B-shuffled_dataset-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 37
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-512 Reinforcement Learning • 1B • Updated 12 days ago • 37
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-1024 Reinforcement Learning • 1B • Updated 12 days ago • 35
UnfaithRL/OLMo-2-0425-1B-hybrid_accuracy_hint_reward-2048 Reinforcement Learning • 1B • Updated 12 days ago • 37
UnfaithRL/Qwen2.5-0.5B-hybrid_accuracy_hint_reward-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 29
UnfaithRL/Qwen2.5-0.5B-hybrid_accuracy_hint_reward-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 31