schema_version: qwen35-distill-config-v1 mode: task_agnostic tokenizer: upstream_full stages: - 24to8 - 8to6 - 6to4 training: seed: 41 epochs: 1 max_rows: 50000 max_length: 128 batch_size: 1 gradient_accumulation: 8 learning_rate: 0.00002 claims: task_labels_used: false semeval_used: false universal_generalization_claimed: false