project: name: "hate-speech-detector" version: "0.1.0" seed: 42 data: # Dataset paths davidson_path: "data/raw/davidson_english.csv" russian_path: "data/raw/russian_toxic.csv" # Preprocessing max_length: 128 num_classes: 2 class_names: ["non-toxic", "toxic"] # Splits train_size: 0.7 val_size: 0.15 test_size: 0.15 model: name: "xlm-roberta-base" num_labels: 2 dropout: 0.1 training: # ЛУЧШИЕ ПАРАМЕТРЫ ИЗ GRID SEARCH: batch_size: 16 learning_rate: 1e-5 num_epochs: 5 # полное обучение warmup_steps: 500 weight_decay: 0.01 # Для дисбаланса use_class_weights: true # Early stopping patience: 3 paths: data_raw: "data/raw" data_processed: "data/processed" models: "models" logs: "logs" mlruns: "mlruns" mlflow: experiment_name: "bilingual-hate-speech" tracking_uri: "http://localhost:5000"