aurelianvolturi commited on
Commit
7db058e
·
verified ·
1 Parent(s): 454873b

Upload folder using huggingface_hub

Browse files
Files changed (5) hide show
  1. README.md +34 -0
  2. model_config.json +15 -0
  3. model_state.pt +3 -0
  4. tokenizer.json +0 -0
  5. tokenizer_config.json +24 -0
README.md ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ language: ru
3
+ pipeline_tag: text-classification
4
+ base_model: cointegrated/rubert-tiny2
5
+ license: cc-by-nc-sa-4.0
6
+ ---
7
+
8
+ # RuBERT Tiny 2 Multi-Task Toxicity
9
+
10
+ Multi-label модель с общим замороженным энкодером и тремя независимыми
11
+ линейными головами: profanity, threat, illegal.
12
+
13
+ ## Test metrics
14
+
15
+ | class | support | threshold | precision | recall | f1 | pr_auc |
16
+ |:----------|----------:|------------:|------------:|---------:|-------:|---------:|
17
+ | profanity | 181 | 0.5 | 0.6795 | 0.8785 | 0.7663 | 0.849 |
18
+ | threat | 155 | 0.64 | 0.6571 | 0.7419 | 0.697 | 0.7605 |
19
+ | illegal | 73 | 0.78 | 0.679 | 0.7534 | 0.7143 | 0.7813 |
20
+
21
+ Macro F1: 0.7258; Micro F1: 0.7319.
22
+ Пороги выбраны только по validation.
23
+
24
+ ## Использование
25
+
26
+ Архитектура MultiTaskToxicityEncoder и функция predict_toxicity(text)
27
+ приведены в сопровождающем notebook. В репозитории сохраняются
28
+ токенизатор, model_state.pt и model_config.json.
29
+
30
+ ## Ограничения
31
+
32
+ Модель выполняет предварительную модерацию, а не юридическую
33
+ квалификацию. Редкие и завуалированные формулировки требуют
34
+ ручной проверки.
model_config.json ADDED
@@ -0,0 +1,15 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "encoder_name": "cointegrated/rubert-tiny2",
3
+ "labels": [
4
+ "profanity",
5
+ "threat",
6
+ "illegal"
7
+ ],
8
+ "thresholds": {
9
+ "profanity": 0.4999999999999998,
10
+ "threat": 0.6399999999999997,
11
+ "illegal": 0.7799999999999997
12
+ },
13
+ "max_length": 128,
14
+ "seed": 42
15
+ }
model_state.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d9756ef248659d3d7fba2ebf7bae2a66a0e054ccb70979e9d0bbf42be6de173e
3
+ size 116802296
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "backend": "tokenizers",
3
+ "cls_token": "[CLS]",
4
+ "do_basic_tokenize": true,
5
+ "do_lower_case": false,
6
+ "is_local": false,
7
+ "local_files_only": false,
8
+ "mask_token": "[MASK]",
9
+ "max_length": 512,
10
+ "model_max_length": 2048,
11
+ "never_split": null,
12
+ "pad_to_multiple_of": null,
13
+ "pad_token": "[PAD]",
14
+ "pad_token_type_id": 0,
15
+ "padding_side": "right",
16
+ "sep_token": "[SEP]",
17
+ "stride": 0,
18
+ "strip_accents": null,
19
+ "tokenize_chinese_chars": true,
20
+ "tokenizer_class": "BertTokenizer",
21
+ "truncation_side": "right",
22
+ "truncation_strategy": "longest_first",
23
+ "unk_token": "[UNK]"
24
+ }