from transformers import PretrainedConfig class YorubaCFMConfig(PretrainedConfig): model_type = "yoruba_cfm_dit" def __init__( self, vocab_size=67, latent_dim=128, d_model=512, n_heads=8, n_layers=10, text_layers=4, max_len=2048, text_max_positions=1024, dropout=0.1, pad_token_id=0, bos_token_id=1, eos_token_id=2, unk_token_id=3, sample_rate=24000, num_ode_steps=24, default_target_length=150, encodec_model_id="facebook/encodec_24khz", **kwargs, ): super().__init__(pad_token_id=pad_token_id, **kwargs) self.vocab_size = vocab_size self.latent_dim = latent_dim self.d_model = d_model self.n_heads = n_heads self.n_layers = n_layers self.text_layers = text_layers self.max_len = max_len self.text_max_positions = text_max_positions self.dropout = dropout self.bos_token_id = bos_token_id self.eos_token_id = eos_token_id self.unk_token_id = unk_token_id self.sample_rate = sample_rate self.num_ode_steps = num_ode_steps self.default_target_length = default_target_length self.encodec_model_id = encodec_model_id