Upload folder using huggingface_hub
Browse files- README.md +34 -0
- model_config.json +15 -0
- model_state.pt +3 -0
- tokenizer.json +0 -0
- tokenizer_config.json +24 -0
README.md
ADDED
|
@@ -0,0 +1,34 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
---
|
| 2 |
+
language: ru
|
| 3 |
+
pipeline_tag: text-classification
|
| 4 |
+
base_model: cointegrated/rubert-tiny2
|
| 5 |
+
license: cc-by-nc-sa-4.0
|
| 6 |
+
---
|
| 7 |
+
|
| 8 |
+
# RuBERT Tiny 2 Multi-Task Toxicity
|
| 9 |
+
|
| 10 |
+
Multi-label модель с общим замороженным энкодером и тремя независимыми
|
| 11 |
+
линейными головами: profanity, threat, illegal.
|
| 12 |
+
|
| 13 |
+
## Test metrics
|
| 14 |
+
|
| 15 |
+
| class | support | threshold | precision | recall | f1 | pr_auc |
|
| 16 |
+
|:----------|----------:|------------:|------------:|---------:|-------:|---------:|
|
| 17 |
+
| profanity | 181 | 0.5 | 0.6795 | 0.8785 | 0.7663 | 0.849 |
|
| 18 |
+
| threat | 155 | 0.64 | 0.6571 | 0.7419 | 0.697 | 0.7605 |
|
| 19 |
+
| illegal | 73 | 0.78 | 0.679 | 0.7534 | 0.7143 | 0.7813 |
|
| 20 |
+
|
| 21 |
+
Macro F1: 0.7258; Micro F1: 0.7319.
|
| 22 |
+
Пороги выбраны только по validation.
|
| 23 |
+
|
| 24 |
+
## Использование
|
| 25 |
+
|
| 26 |
+
Архитектура MultiTaskToxicityEncoder и функция predict_toxicity(text)
|
| 27 |
+
приведены в сопровождающем notebook. В репозитории сохраняются
|
| 28 |
+
токенизатор, model_state.pt и model_config.json.
|
| 29 |
+
|
| 30 |
+
## Ограничения
|
| 31 |
+
|
| 32 |
+
Модель выполняет предварительную модерацию, а не юридическую
|
| 33 |
+
квалификацию. Редкие и завуалированные формулировки требуют
|
| 34 |
+
ручной проверки.
|
model_config.json
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"encoder_name": "cointegrated/rubert-tiny2",
|
| 3 |
+
"labels": [
|
| 4 |
+
"profanity",
|
| 5 |
+
"threat",
|
| 6 |
+
"illegal"
|
| 7 |
+
],
|
| 8 |
+
"thresholds": {
|
| 9 |
+
"profanity": 0.4999999999999998,
|
| 10 |
+
"threat": 0.6399999999999997,
|
| 11 |
+
"illegal": 0.7799999999999997
|
| 12 |
+
},
|
| 13 |
+
"max_length": 128,
|
| 14 |
+
"seed": 42
|
| 15 |
+
}
|
model_state.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d9756ef248659d3d7fba2ebf7bae2a66a0e054ccb70979e9d0bbf42be6de173e
|
| 3 |
+
size 116802296
|
tokenizer.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
tokenizer_config.json
ADDED
|
@@ -0,0 +1,24 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"backend": "tokenizers",
|
| 3 |
+
"cls_token": "[CLS]",
|
| 4 |
+
"do_basic_tokenize": true,
|
| 5 |
+
"do_lower_case": false,
|
| 6 |
+
"is_local": false,
|
| 7 |
+
"local_files_only": false,
|
| 8 |
+
"mask_token": "[MASK]",
|
| 9 |
+
"max_length": 512,
|
| 10 |
+
"model_max_length": 2048,
|
| 11 |
+
"never_split": null,
|
| 12 |
+
"pad_to_multiple_of": null,
|
| 13 |
+
"pad_token": "[PAD]",
|
| 14 |
+
"pad_token_type_id": 0,
|
| 15 |
+
"padding_side": "right",
|
| 16 |
+
"sep_token": "[SEP]",
|
| 17 |
+
"stride": 0,
|
| 18 |
+
"strip_accents": null,
|
| 19 |
+
"tokenize_chinese_chars": true,
|
| 20 |
+
"tokenizer_class": "BertTokenizer",
|
| 21 |
+
"truncation_side": "right",
|
| 22 |
+
"truncation_strategy": "longest_first",
|
| 23 |
+
"unk_token": "[UNK]"
|
| 24 |
+
}
|