model: base_model: Qwen/Qwen3-0.6B max_length: 512 pooling: last_token dropout: 0.05 freeze_backbone: true dtype: auto training: seed: 43 epochs: 3 batch_size: 8 gradient_accumulation_steps: 1 learning_rate: 0.0002 weight_decay: 0.0 max_grad_norm: 1.0 estimator: reinforce rollouts_per_prompt: 8 entropy_coefficient: 0.01 normalize_advantage: false log_every: 10