UnfaithRL/Qwen2.5-0.5B-hybrid_accuracy_hint_reward-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 35
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-512 Reinforcement Learning • 1B • Updated 12 days ago • 67
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-1024 Reinforcement Learning • 1B • Updated 12 days ago • 60
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_relaxed_v7-2048 Reinforcement Learning • 1B • Updated 12 days ago • 58
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_relaxed_v7-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 75
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_relaxed_v7-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 54
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_relaxed_v7-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 62
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-512 Reinforcement Learning • 1B • Updated 12 days ago • 35
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-1024 Reinforcement Learning • 1B • Updated 12 days ago • 37
UnfaithRL/OLMo-2-0425-1B-hint_verbalization_reward_strict_v9-2048 Reinforcement Learning • 1B • Updated 12 days ago • 32
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_strict_v9-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 29
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_strict_v9-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 38
UnfaithRL/Qwen2.5-0.5B-hint_verbalization_reward_strict_v9-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 34
UnfaithRL/OLMo-2-0425-1B-Instruct-hint_verbalization_reward_strict_v2-512 Reinforcement Learning • 1B • Updated 12 days ago • 64
UnfaithRL/OLMo-2-0425-1B-Instruct-hint_verbalization_reward_strict_v2-1024 Reinforcement Learning • 1B • Updated 12 days ago • 55
UnfaithRL/OLMo-2-0425-1B-Instruct-hint_verbalization_reward_strict_v2-2048 Reinforcement Learning • 1B • Updated 12 days ago • 56
UnfaithRL/Qwen2.5-0.5B-Instruct-hint_verbalization_reward_strict_v2-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 77
UnfaithRL/Qwen2.5-0.5B-Instruct-hint_verbalization_reward_strict_v2-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 62
UnfaithRL/Qwen2.5-0.5B-Instruct-hint_verbalization_reward_strict_v2-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 60
UnfaithRL/OLMo-2-0425-1B-hint_following_reward_faithful_prompt-512 Reinforcement Learning • 1B • Updated 12 days ago • 37
UnfaithRL/OLMo-2-0425-1B-hint_following_reward_faithful_prompt-1024 Reinforcement Learning • 1B • Updated 12 days ago • 37
UnfaithRL/OLMo-2-0425-1B-hint_following_reward_faithful_prompt-2048 Reinforcement Learning • 1B • Updated 12 days ago • 37
UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-512 Reinforcement Learning • 0.5B • Updated 12 days ago • 37
UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-1024 Reinforcement Learning • 0.5B • Updated 12 days ago • 37
UnfaithRL/Qwen2.5-0.5B-hint_following_reward_faithful_prompt-2048 Reinforcement Learning • 0.5B • Updated 12 days ago • 31
maveryn/trace-qwen25vl3b-rlvr-ann-additive-0p50-sectioned-step500 Visual Question Answering • 4B • Updated 7 days ago • 20