wandb: entity: "vikhr-audio" project: "Borealis" datasets: train: - name: "Vikhrmodels/ToneBooksPlus" split: "train" columns: ["audio", "text"] - name: "Vikhrmodels/ToneSpeak" split: "train" columns: ["audio", "text"] - name: "Vikhrmodels/ReadyFormatDF2" split: "train" columns: ["audio", "text"] - name: "Vikhrmodels/ToneRuLS" split: "train" columns: ["audio", "text"] - name: "Vikhrmodels/ToneSlavic" split: "train" columns: ["audio", "sentence"] rename_text: "sentence" filter: locale_ru: true - name: "Vikhrmodels/ToneRuDevices" split: "train" columns: ["audio", "text"] - name: "Vikhrmodels/ReadyFormatDF" split: "train" columns: ["audio", "text"] - name: "Vikhrmodels/ToneRuDevicesAudiobooks" split: "train" columns: ["audio", "text"] - name: "bond005/podlodka_speech" split: "train" columns: ["audio", "transcription"] rename_text: "transcription" # - name: "Vikhrmodels/ToneGolosOpus" # config: "Crowd" # split: "train" # columns: ["audio", "text"] - name: "Vikhrmodels/ToneGolosOpus" config: "Farfield" split: "train" columns: ["audio", "text"] val: - name: "Vikhrmodels/ToneBooksPlus" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ToneSpeak" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ReadyFormatDF2" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ToneRuLS" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ToneSlavic" split: "validation" columns: ["audio", "sentence"] rename_text: "sentence" select_range: 279 filter: locale_ru: true - name: "Vikhrmodels/ToneRuDevices" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ReadyFormatDF" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ToneRuDevicesAudiobooks" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "bond005/podlodka_speech" split: "validation" columns: ["audio", "transcription"] rename_text: "transcription" select_range: 20 - name: "Vikhrmodels/ToneGolosOpus" config: "Crowd" split: "validation" columns: ["audio", "text"] select_range: 279 - name: "Vikhrmodels/ToneGolosOpus" config: "Farfield" split: "validation" columns: ["audio", "text"] select_range: 279 noise: name: "Vikhrmodels/Audio_Noise_Dataset" split: "Musan" ir: name: "Vikhrmodels/Audio_Noise_Dataset" split: "Echo" num_proc: 8 sampling_rate: 16000 clean_dataset: true model: whisper: pretrained: "openai/whisper-large-v3" dtype: "bfloat16" attn_implementation: "eager" language_model: pretrained: "Unsloth/Qwen3-4B" full_finetuning: true attn_implementation: "sdpa" special_tokens: start_audio: "<|start_of_audio|>" end_audio: "<|end_of_audio|>" max_text_len: 512 augmentation: sample_rate: 16000 stages: "default" training: output_dir: "./asr_qwen_ckpts" per_device_train_batch_size: 16 per_device_eval_batch_size: 16 dataloader_num_workers: 64 save_total_limit: 50 num_train_epochs: 5 warmup_ratio: 0.05 learning_rate: 3e-4 bf16: true eval_strategy: "steps" save_strategy: "steps" eval_steps: 15000000 save_steps: 10000 logging_steps: 50 report_to: "wandb" save_safetensors: false optim: "adamw_torch_fused" ddp_find_unused_parameters: false lr_scheduler_type: "cosine" gradient_checkpointing_kwargs: {"use_reentrant":False} # Hugging Face Hub настройки push_to_hub: false hub_model_id: "Vikhrmodels/Borealis-ASR-4B" hub_strategy: "checkpoint" hub_private_repo: false hub_always_push: false generation: max_new_tokens: 512 do_sample: false #num_beams: 5 early_stopping: true repetition_penalty: 1.2 temperature: 0.79 metrics: random_samples: 5