algo: T: 0 backbone: dit_legacy causal_attention: false loss_type: elbo name: duo_base parameterization: mean subs_masking: false time_conditioning: true adaLN: true data: mode: phase2 tokenizer_name_or_path: tokenizer/tiktokenizer.json train: nvidia valid: nvidia eval: checkpoint_path: model.ckpt compute_generative_perplexity: false compute_perplexity_on_sanity: false disable_ema: true gen_ppl_eval_model_name_or_path: gpt2-large generate_samples: false generated_samples_path: samples.json perplexity_batch_size: 8 loader: batch_size: 2 eval_batch_size: 1 eval_global_batch_size: 1024 global_batch_size: 1024 n_chunks: 1 num_workers: 224 pin_memory: true model: cond_dim: 128 dropout: 0 hidden_size: 2176 length: 2048 n_blocks: 28 n_heads: 17 name: 2121M scale_by_sigma: true tie_word_embeddings: false type: ddit noise: denoiser_latent_conditioning: -1 eps: 0 freeze_decoder: false freeze_encoder: false parameterization: log-linear type: log-linear optim: beta1: 0.9 beta2: 0.95 eps: 1.0e-08 lr: 0.0004 min_lr: 0.0001 weight_decay: 0.1 prior: latent_height: 0 latent_width: 0 type: none sampling: kv_cache: false noise_removal: ancestral num_log_samples: 2 num_samples: 1024 p_nucleus: 1 predictor: ancestral steps: 1000 use_float64: true seed: 1 training: antithetic_sampling: true ema: -1 finetune_path: '' flops_1e18: 1 sampling_eps: 0.001 ssl_ratio: 0.01