Sentence Similarity
sentence-transformers
Safetensors
bert
multilingual
model-compression
layer-pruning
vocab-pruning
knowledge-distillation
me5-small
text-embeddings-inference
Instructions to use gomyk/me5s-student-me5s_compressed_distilled with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use gomyk/me5s-student-me5s_compressed_distilled with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("gomyk/me5s-student-me5s_compressed_distilled") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
Upload me5s_compressed_distilled (distilled) from mE5-small
Browse files- README.md +59 -59
- config.json +2 -2
- model.safetensors +2 -2
- tokenizer.json +0 -0
- tokenizer_config.json +1 -1
README.md
CHANGED
|
@@ -24,12 +24,12 @@ Compact multilingual sentence encoder compressed from `intfloat/multilingual-e5-
|
|
| 24 |
| Base model | `intfloat/multilingual-e5-small` |
|
| 25 |
| Architecture | bert (encoder) |
|
| 26 |
| Hidden dim | 384 (from 384) |
|
| 27 |
-
| Layers |
|
| 28 |
| Intermediate | 1536 |
|
| 29 |
| Attention heads | 12 |
|
| 30 |
-
| Vocab size |
|
| 31 |
-
| Parameters | ~
|
| 32 |
-
| Model size (FP32) |
|
| 33 |
| Compression | 9x |
|
| 34 |
| Distilled | Yes |
|
| 35 |
|
|
@@ -53,84 +53,84 @@ print(embeddings.shape) # (4, 384)
|
|
| 53 |
|
| 54 |
## MTEB Evaluation Results
|
| 55 |
|
| 56 |
-
**Overall Average:
|
| 57 |
|
| 58 |
| Task Group | Average |
|
| 59 |
|---|---|
|
| 60 |
-
| Classification |
|
| 61 |
-
| Clustering |
|
| 62 |
-
| STS |
|
| 63 |
|
| 64 |
### Classification
|
| 65 |
|
| 66 |
| Task | Average | Details |
|
| 67 |
|---|---|---|
|
| 68 |
-
| AmazonCounterfactualClassification |
|
| 69 |
-
| Banking77Classification |
|
| 70 |
-
| ImdbClassification |
|
| 71 |
-
| MTOPDomainClassification |
|
| 72 |
-
| MassiveIntentClassification |
|
| 73 |
-
| MassiveScenarioClassification |
|
| 74 |
-
| ToxicConversationsClassification |
|
| 75 |
-
| TweetSentimentExtractionClassification |
|
| 76 |
|
| 77 |
### Clustering
|
| 78 |
|
| 79 |
| Task | Average | Details |
|
| 80 |
|---|---|---|
|
| 81 |
-
| ArXivHierarchicalClusteringP2P |
|
| 82 |
-
| ArXivHierarchicalClusteringS2S |
|
| 83 |
-
| BiorxivClusteringP2P.v2 | 13.
|
| 84 |
-
| MedrxivClusteringP2P.v2 |
|
| 85 |
-
| MedrxivClusteringS2S.v2 |
|
| 86 |
-
| StackExchangeClustering.v2 |
|
| 87 |
-
| StackExchangeClusteringP2P.v2 |
|
| 88 |
-
| TwentyNewsgroupsClustering.v2 |
|
| 89 |
|
| 90 |
### STS
|
| 91 |
|
| 92 |
| Task | Average | Details |
|
| 93 |
|---|---|---|
|
| 94 |
-
| BIOSSES |
|
| 95 |
-
| SICK-R |
|
| 96 |
-
| STS12 |
|
| 97 |
-
| STS13 |
|
| 98 |
-
| STS14 |
|
| 99 |
-
| STS15 |
|
| 100 |
-
| STS17 |
|
| 101 |
-
| STS22.v2 |
|
| 102 |
-
| STSBenchmark |
|
| 103 |
|
| 104 |
|
| 105 |
## Distillation Impact
|
| 106 |
|
| 107 |
| Task | Before | After | Delta |
|
| 108 |
|---|---|---|---|
|
| 109 |
-
| AmazonCounterfactualClassification |
|
| 110 |
-
| ArXivHierarchicalClusteringP2P | 47.
|
| 111 |
-
| ArXivHierarchicalClusteringS2S |
|
| 112 |
-
| BIOSSES | 56.
|
| 113 |
-
| Banking77Classification |
|
| 114 |
-
| BiorxivClusteringP2P.v2 |
|
| 115 |
-
| ImdbClassification |
|
| 116 |
-
| MTOPDomainClassification |
|
| 117 |
-
| MassiveIntentClassification |
|
| 118 |
-
| MassiveScenarioClassification |
|
| 119 |
-
| MedrxivClusteringP2P.v2 |
|
| 120 |
-
| MedrxivClusteringS2S.v2 |
|
| 121 |
-
| SICK-R |
|
| 122 |
-
| STS12 |
|
| 123 |
-
| STS13 |
|
| 124 |
-
| STS14 |
|
| 125 |
-
| STS15 |
|
| 126 |
-
| STS17 |
|
| 127 |
-
| STS22.v2 |
|
| 128 |
-
| STSBenchmark |
|
| 129 |
-
| StackExchangeClustering.v2 | 39.
|
| 130 |
-
| StackExchangeClusteringP2P.v2 |
|
| 131 |
-
| ToxicConversationsClassification | 55.
|
| 132 |
-
| TweetSentimentExtractionClassification |
|
| 133 |
-
| TwentyNewsgroupsClustering.v2 |
|
| 134 |
|
| 135 |
|
| 136 |
## Training
|
|
@@ -138,7 +138,7 @@ print(embeddings.shape) # (4, 384)
|
|
| 138 |
### Stage 1: Model Compression
|
| 139 |
- **Teacher**: `intfloat/multilingual-e5-small` (12L, 384d)
|
| 140 |
- **Compression**: Layer pruning + Vocab pruning
|
| 141 |
-
- **Result**:
|
| 142 |
|
| 143 |
### Stage 2: Knowledge Distillation
|
| 144 |
- **Method**: MSE + Cosine Similarity loss
|
|
|
|
| 24 |
| Base model | `intfloat/multilingual-e5-small` |
|
| 25 |
| Architecture | bert (encoder) |
|
| 26 |
| Hidden dim | 384 (from 384) |
|
| 27 |
+
| Layers | 4 (from 12) |
|
| 28 |
| Intermediate | 1536 |
|
| 29 |
| Attention heads | 12 |
|
| 30 |
+
| Vocab size | 15,168 (from 250,037) |
|
| 31 |
+
| Parameters | ~13.1M |
|
| 32 |
+
| Model size (FP32) | 50.6MB |
|
| 33 |
| Compression | 9x |
|
| 34 |
| Distilled | Yes |
|
| 35 |
|
|
|
|
| 53 |
|
| 54 |
## MTEB Evaluation Results
|
| 55 |
|
| 56 |
+
**Overall Average: 50.81%**
|
| 57 |
|
| 58 |
| Task Group | Average |
|
| 59 |
|---|---|
|
| 60 |
+
| Classification | 56.17% |
|
| 61 |
+
| Clustering | 29.64% |
|
| 62 |
+
| STS | 64.86% |
|
| 63 |
|
| 64 |
### Classification
|
| 65 |
|
| 66 |
| Task | Average | Details |
|
| 67 |
|---|---|---|
|
| 68 |
+
| AmazonCounterfactualClassification | 67.34% | de: 71.67%, en: 71.63%, en-ext: 69.81%, ja: 56.27% |
|
| 69 |
+
| Banking77Classification | 67.81% | default: 67.81% |
|
| 70 |
+
| ImdbClassification | 54.45% | default: 54.45% |
|
| 71 |
+
| MTOPDomainClassification | 74.88% | en: 84.01%, es: 78.04%, fr: 75.53%, hi: 72.32%, th: 72.24% |
|
| 72 |
+
| MassiveIntentClassification | 30.9% | en: 61.8%, ja: 56.38%, zh-CN: 56.37%, ko: 54.29%, es: 54.0% |
|
| 73 |
+
| MassiveScenarioClassification | 38.29% | en: 68.19%, zh-CN: 67.13%, ja: 64.95%, de: 63.29%, ko: 63.23% |
|
| 74 |
+
| ToxicConversationsClassification | 55.65% | default: 55.65% |
|
| 75 |
+
| TweetSentimentExtractionClassification | 60.03% | default: 60.03% |
|
| 76 |
|
| 77 |
### Clustering
|
| 78 |
|
| 79 |
| Task | Average | Details |
|
| 80 |
|---|---|---|
|
| 81 |
+
| ArXivHierarchicalClusteringP2P | 49.54% | default: 49.54% |
|
| 82 |
+
| ArXivHierarchicalClusteringS2S | 46.49% | default: 46.49% |
|
| 83 |
+
| BiorxivClusteringP2P.v2 | 13.53% | default: 13.53% |
|
| 84 |
+
| MedrxivClusteringP2P.v2 | 22.28% | default: 22.28% |
|
| 85 |
+
| MedrxivClusteringS2S.v2 | 21.37% | default: 21.37% |
|
| 86 |
+
| StackExchangeClustering.v2 | 38.82% | default: 38.82% |
|
| 87 |
+
| StackExchangeClusteringP2P.v2 | 30.07% | default: 30.07% |
|
| 88 |
+
| TwentyNewsgroupsClustering.v2 | 15.01% | default: 15.01% |
|
| 89 |
|
| 90 |
### STS
|
| 91 |
|
| 92 |
| Task | Average | Details |
|
| 93 |
|---|---|---|
|
| 94 |
+
| BIOSSES | 63.23% | default: 63.23% |
|
| 95 |
+
| SICK-R | 74.84% | default: 74.84% |
|
| 96 |
+
| STS12 | 74.24% | default: 74.24% |
|
| 97 |
+
| STS13 | 69.75% | default: 69.75% |
|
| 98 |
+
| STS14 | 70.86% | default: 70.86% |
|
| 99 |
+
| STS15 | 82.14% | default: 82.14% |
|
| 100 |
+
| STS17 | 40.06% | en-en: 82.62%, es-es: 76.34%, ar-ar: 60.47%, ko-ko: 60.46%, nl-en: 40.14% |
|
| 101 |
+
| STS22.v2 | 31.5% | zh: 60.47%, es: 56.06%, fr: 54.8%, it: 40.81%, en: 40.52% |
|
| 102 |
+
| STSBenchmark | 77.11% | default: 77.11% |
|
| 103 |
|
| 104 |
|
| 105 |
## Distillation Impact
|
| 106 |
|
| 107 |
| Task | Before | After | Delta |
|
| 108 |
|---|---|---|---|
|
| 109 |
+
| AmazonCounterfactualClassification | 67.37% | 67.34% | -0.03%p |
|
| 110 |
+
| ArXivHierarchicalClusteringP2P | 47.08% | 49.54% | +2.46%p |
|
| 111 |
+
| ArXivHierarchicalClusteringS2S | 48.29% | 46.49% | -1.8%p |
|
| 112 |
+
| BIOSSES | 56.68% | 63.23% | +6.55%p |
|
| 113 |
+
| Banking77Classification | 58.7% | 67.81% | +9.11%p |
|
| 114 |
+
| BiorxivClusteringP2P.v2 | 17.24% | 13.53% | -3.71%p |
|
| 115 |
+
| ImdbClassification | 57.14% | 54.45% | -2.69%p |
|
| 116 |
+
| MTOPDomainClassification | 66.84% | 74.88% | +8.04%p |
|
| 117 |
+
| MassiveIntentClassification | 31.12% | 30.9% | -0.22%p |
|
| 118 |
+
| MassiveScenarioClassification | 34.85% | 38.29% | +3.44%p |
|
| 119 |
+
| MedrxivClusteringP2P.v2 | 24.42% | 22.28% | -2.14%p |
|
| 120 |
+
| MedrxivClusteringS2S.v2 | 21.55% | 21.37% | -0.18%p |
|
| 121 |
+
| SICK-R | 59.22% | 74.84% | +15.62%p |
|
| 122 |
+
| STS12 | 52.11% | 74.24% | +22.13%p |
|
| 123 |
+
| STS13 | 64.25% | 69.75% | +5.5%p |
|
| 124 |
+
| STS14 | 60.12% | 70.86% | +10.74%p |
|
| 125 |
+
| STS15 | 74.19% | 82.14% | +7.95%p |
|
| 126 |
+
| STS17 | 38.71% | 40.06% | +1.35%p |
|
| 127 |
+
| STS22.v2 | 27.7% | 31.5% | +3.8%p |
|
| 128 |
+
| STSBenchmark | 60.91% | 77.11% | +16.2%p |
|
| 129 |
+
| StackExchangeClustering.v2 | 39.42% | 38.82% | -0.6%p |
|
| 130 |
+
| StackExchangeClusteringP2P.v2 | 31.85% | 30.07% | -1.78%p |
|
| 131 |
+
| ToxicConversationsClassification | 55.82% | 55.65% | -0.17%p |
|
| 132 |
+
| TweetSentimentExtractionClassification | 45.74% | 60.03% | +14.29%p |
|
| 133 |
+
| TwentyNewsgroupsClustering.v2 | 13.35% | 15.01% | +1.66%p |
|
| 134 |
|
| 135 |
|
| 136 |
## Training
|
|
|
|
| 138 |
### Stage 1: Model Compression
|
| 139 |
- **Teacher**: `intfloat/multilingual-e5-small` (12L, 384d)
|
| 140 |
- **Compression**: Layer pruning + Vocab pruning
|
| 141 |
+
- **Result**: 4L / 384d / 15,168 vocab
|
| 142 |
|
| 143 |
### Stage 2: Knowledge Distillation
|
| 144 |
- **Method**: MSE + Cosine Similarity loss
|
config.json
CHANGED
|
@@ -14,12 +14,12 @@
|
|
| 14 |
"max_position_embeddings": 512,
|
| 15 |
"model_type": "bert",
|
| 16 |
"num_attention_heads": 12,
|
| 17 |
-
"num_hidden_layers":
|
| 18 |
"pad_token_id": 0,
|
| 19 |
"position_embedding_type": "absolute",
|
| 20 |
"tokenizer_class": "XLMRobertaTokenizer",
|
| 21 |
"transformers_version": "4.56.2",
|
| 22 |
"type_vocab_size": 2,
|
| 23 |
"use_cache": true,
|
| 24 |
-
"vocab_size":
|
| 25 |
}
|
|
|
|
| 14 |
"max_position_embeddings": 512,
|
| 15 |
"model_type": "bert",
|
| 16 |
"num_attention_heads": 12,
|
| 17 |
+
"num_hidden_layers": 4,
|
| 18 |
"pad_token_id": 0,
|
| 19 |
"position_embedding_type": "absolute",
|
| 20 |
"tokenizer_class": "XLMRobertaTokenizer",
|
| 21 |
"transformers_version": "4.56.2",
|
| 22 |
"type_vocab_size": 2,
|
| 23 |
"use_cache": true,
|
| 24 |
+
"vocab_size": 15168
|
| 25 |
}
|
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:248b7dfb9bb4c1e024b364077af53bc31b35b853f6050510d4a89dd74d0803de
|
| 3 |
+
size 53081192
|
tokenizer.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
tokenizer_config.json
CHANGED
|
@@ -32,7 +32,7 @@
|
|
| 32 |
"single_word": false,
|
| 33 |
"special": true
|
| 34 |
},
|
| 35 |
-
"
|
| 36 |
"content": "<mask>",
|
| 37 |
"lstrip": false,
|
| 38 |
"normalized": false,
|
|
|
|
| 32 |
"single_word": false,
|
| 33 |
"special": true
|
| 34 |
},
|
| 35 |
+
"15167": {
|
| 36 |
"content": "<mask>",
|
| 37 |
"lstrip": false,
|
| 38 |
"normalized": false,
|