gomyk commited on
Commit
8821cde
·
verified ·
1 Parent(s): 35628a4

Upload me5s_compressed_distilled (distilled) from mE5-small

Browse files
Files changed (5) hide show
  1. README.md +59 -59
  2. config.json +2 -2
  3. model.safetensors +2 -2
  4. tokenizer.json +0 -0
  5. tokenizer_config.json +1 -1
README.md CHANGED
@@ -24,12 +24,12 @@ Compact multilingual sentence encoder compressed from `intfloat/multilingual-e5-
24
  | Base model | `intfloat/multilingual-e5-small` |
25
  | Architecture | bert (encoder) |
26
  | Hidden dim | 384 (from 384) |
27
- | Layers | 5 (from 12) |
28
  | Intermediate | 1536 |
29
  | Attention heads | 12 |
30
- | Vocab size | 8,675 (from 250,037) |
31
- | Parameters | ~12.4M |
32
- | Model size (FP32) | 47.9MB |
33
  | Compression | 9x |
34
  | Distilled | Yes |
35
 
@@ -53,84 +53,84 @@ print(embeddings.shape) # (4, 384)
53
 
54
  ## MTEB Evaluation Results
55
 
56
- **Overall Average: 46.91%**
57
 
58
  | Task Group | Average |
59
  |---|---|
60
- | Classification | 51.82% |
61
- | Clustering | 28.72% |
62
- | STS | 58.72% |
63
 
64
  ### Classification
65
 
66
  | Task | Average | Details |
67
  |---|---|---|
68
- | AmazonCounterfactualClassification | 62.93% | en: 69.51%, en-ext: 65.08%, ja: 59.78%, de: 57.34% |
69
- | Banking77Classification | 62.72% | default: 62.72% |
70
- | ImdbClassification | 50.74% | default: 50.74% |
71
- | MTOPDomainClassification | 68.85% | en: 79.79%, es: 71.9%, fr: 69.12%, th: 67.41%, hi: 64.79% |
72
- | MassiveIntentClassification | 26.86% | en: 57.38%, zh-CN: 48.33%, ja: 45.3%, de: 45.04%, fr: 44.92% |
73
- | MassiveScenarioClassification | 34.66% | en: 66.9%, de: 59.71%, zh-CN: 58.67%, nl: 56.51%, fr: 55.21% |
74
- | ToxicConversationsClassification | 54.97% | default: 54.97% |
75
- | TweetSentimentExtractionClassification | 52.8% | default: 52.8% |
76
 
77
  ### Clustering
78
 
79
  | Task | Average | Details |
80
  |---|---|---|
81
- | ArXivHierarchicalClusteringP2P | 47.82% | default: 47.82% |
82
- | ArXivHierarchicalClusteringS2S | 43.73% | default: 43.73% |
83
- | BiorxivClusteringP2P.v2 | 13.34% | default: 13.34% |
84
- | MedrxivClusteringP2P.v2 | 20.89% | default: 20.89% |
85
- | MedrxivClusteringS2S.v2 | 20.47% | default: 20.47% |
86
- | StackExchangeClustering.v2 | 39.47% | default: 39.47% |
87
- | StackExchangeClusteringP2P.v2 | 31.1% | default: 31.1% |
88
- | TwentyNewsgroupsClustering.v2 | 12.96% | default: 12.96% |
89
 
90
  ### STS
91
 
92
  | Task | Average | Details |
93
  |---|---|---|
94
- | BIOSSES | 44.17% | default: 44.17% |
95
- | SICK-R | 69.93% | default: 69.93% |
96
- | STS12 | 71.78% | default: 71.78% |
97
- | STS13 | 61.49% | default: 61.49% |
98
- | STS14 | 65.8% | default: 65.8% |
99
- | STS15 | 78.31% | default: 78.31% |
100
- | STS17 | 34.39% | en-en: 78.79%, es-es: 71.36%, ar-ar: 55.54%, ko-ko: 50.35%, nl-en: 28.55% |
101
- | STS22.v2 | 32.35% | fr-pl: 61.98%, zh: 52.61%, es: 52.17%, it: 48.4%, fr: 45.5% |
102
- | STSBenchmark | 70.22% | default: 70.22% |
103
 
104
 
105
  ## Distillation Impact
106
 
107
  | Task | Before | After | Delta |
108
  |---|---|---|---|
109
- | AmazonCounterfactualClassification | 65.35% | 62.93% | -2.42%p |
110
- | ArXivHierarchicalClusteringP2P | 47.9% | 47.82% | -0.08%p |
111
- | ArXivHierarchicalClusteringS2S | 47.79% | 43.73% | -4.06%p |
112
- | BIOSSES | 56.57% | 44.17% | -12.4%p |
113
- | Banking77Classification | 59.84% | 62.72% | +2.88%p |
114
- | BiorxivClusteringP2P.v2 | 16.17% | 13.34% | -2.83%p |
115
- | ImdbClassification | 54.77% | 50.74% | -4.03%p |
116
- | MTOPDomainClassification | 63.66% | 68.85% | +5.19%p |
117
- | MassiveIntentClassification | 29.77% | 26.86% | -2.91%p |
118
- | MassiveScenarioClassification | 33.24% | 34.66% | +1.42%p |
119
- | MedrxivClusteringP2P.v2 | 22.33% | 20.89% | -1.44%p |
120
- | MedrxivClusteringS2S.v2 | 20.56% | 20.47% | -0.09%p |
121
- | SICK-R | 58.16% | 69.93% | +11.77%p |
122
- | STS12 | 53.44% | 71.78% | +18.34%p |
123
- | STS13 | 61.88% | 61.49% | -0.39%p |
124
- | STS14 | 58.82% | 65.8% | +6.98%p |
125
- | STS15 | 73.5% | 78.31% | +4.81%p |
126
- | STS17 | 36.19% | 34.39% | -1.8%p |
127
- | STS22.v2 | 29.53% | 32.35% | +2.82%p |
128
- | STSBenchmark | 59.49% | 70.22% | +10.73%p |
129
- | StackExchangeClustering.v2 | 39.48% | 39.47% | -0.01%p |
130
- | StackExchangeClusteringP2P.v2 | 30.91% | 31.1% | +0.19%p |
131
- | ToxicConversationsClassification | 55.55% | 54.97% | -0.58%p |
132
- | TweetSentimentExtractionClassification | 42.38% | 52.8% | +10.42%p |
133
- | TwentyNewsgroupsClustering.v2 | 12.68% | 12.96% | +0.28%p |
134
 
135
 
136
  ## Training
@@ -138,7 +138,7 @@ print(embeddings.shape) # (4, 384)
138
  ### Stage 1: Model Compression
139
  - **Teacher**: `intfloat/multilingual-e5-small` (12L, 384d)
140
  - **Compression**: Layer pruning + Vocab pruning
141
- - **Result**: 5L / 384d / 8,675 vocab
142
 
143
  ### Stage 2: Knowledge Distillation
144
  - **Method**: MSE + Cosine Similarity loss
 
24
  | Base model | `intfloat/multilingual-e5-small` |
25
  | Architecture | bert (encoder) |
26
  | Hidden dim | 384 (from 384) |
27
+ | Layers | 4 (from 12) |
28
  | Intermediate | 1536 |
29
  | Attention heads | 12 |
30
+ | Vocab size | 15,168 (from 250,037) |
31
+ | Parameters | ~13.1M |
32
+ | Model size (FP32) | 50.6MB |
33
  | Compression | 9x |
34
  | Distilled | Yes |
35
 
 
53
 
54
  ## MTEB Evaluation Results
55
 
56
+ **Overall Average: 50.81%**
57
 
58
  | Task Group | Average |
59
  |---|---|
60
+ | Classification | 56.17% |
61
+ | Clustering | 29.64% |
62
+ | STS | 64.86% |
63
 
64
  ### Classification
65
 
66
  | Task | Average | Details |
67
  |---|---|---|
68
+ | AmazonCounterfactualClassification | 67.34% | de: 71.67%, en: 71.63%, en-ext: 69.81%, ja: 56.27% |
69
+ | Banking77Classification | 67.81% | default: 67.81% |
70
+ | ImdbClassification | 54.45% | default: 54.45% |
71
+ | MTOPDomainClassification | 74.88% | en: 84.01%, es: 78.04%, fr: 75.53%, hi: 72.32%, th: 72.24% |
72
+ | MassiveIntentClassification | 30.9% | en: 61.8%, ja: 56.38%, zh-CN: 56.37%, ko: 54.29%, es: 54.0% |
73
+ | MassiveScenarioClassification | 38.29% | en: 68.19%, zh-CN: 67.13%, ja: 64.95%, de: 63.29%, ko: 63.23% |
74
+ | ToxicConversationsClassification | 55.65% | default: 55.65% |
75
+ | TweetSentimentExtractionClassification | 60.03% | default: 60.03% |
76
 
77
  ### Clustering
78
 
79
  | Task | Average | Details |
80
  |---|---|---|
81
+ | ArXivHierarchicalClusteringP2P | 49.54% | default: 49.54% |
82
+ | ArXivHierarchicalClusteringS2S | 46.49% | default: 46.49% |
83
+ | BiorxivClusteringP2P.v2 | 13.53% | default: 13.53% |
84
+ | MedrxivClusteringP2P.v2 | 22.28% | default: 22.28% |
85
+ | MedrxivClusteringS2S.v2 | 21.37% | default: 21.37% |
86
+ | StackExchangeClustering.v2 | 38.82% | default: 38.82% |
87
+ | StackExchangeClusteringP2P.v2 | 30.07% | default: 30.07% |
88
+ | TwentyNewsgroupsClustering.v2 | 15.01% | default: 15.01% |
89
 
90
  ### STS
91
 
92
  | Task | Average | Details |
93
  |---|---|---|
94
+ | BIOSSES | 63.23% | default: 63.23% |
95
+ | SICK-R | 74.84% | default: 74.84% |
96
+ | STS12 | 74.24% | default: 74.24% |
97
+ | STS13 | 69.75% | default: 69.75% |
98
+ | STS14 | 70.86% | default: 70.86% |
99
+ | STS15 | 82.14% | default: 82.14% |
100
+ | STS17 | 40.06% | en-en: 82.62%, es-es: 76.34%, ar-ar: 60.47%, ko-ko: 60.46%, nl-en: 40.14% |
101
+ | STS22.v2 | 31.5% | zh: 60.47%, es: 56.06%, fr: 54.8%, it: 40.81%, en: 40.52% |
102
+ | STSBenchmark | 77.11% | default: 77.11% |
103
 
104
 
105
  ## Distillation Impact
106
 
107
  | Task | Before | After | Delta |
108
  |---|---|---|---|
109
+ | AmazonCounterfactualClassification | 67.37% | 67.34% | -0.03%p |
110
+ | ArXivHierarchicalClusteringP2P | 47.08% | 49.54% | +2.46%p |
111
+ | ArXivHierarchicalClusteringS2S | 48.29% | 46.49% | -1.8%p |
112
+ | BIOSSES | 56.68% | 63.23% | +6.55%p |
113
+ | Banking77Classification | 58.7% | 67.81% | +9.11%p |
114
+ | BiorxivClusteringP2P.v2 | 17.24% | 13.53% | -3.71%p |
115
+ | ImdbClassification | 57.14% | 54.45% | -2.69%p |
116
+ | MTOPDomainClassification | 66.84% | 74.88% | +8.04%p |
117
+ | MassiveIntentClassification | 31.12% | 30.9% | -0.22%p |
118
+ | MassiveScenarioClassification | 34.85% | 38.29% | +3.44%p |
119
+ | MedrxivClusteringP2P.v2 | 24.42% | 22.28% | -2.14%p |
120
+ | MedrxivClusteringS2S.v2 | 21.55% | 21.37% | -0.18%p |
121
+ | SICK-R | 59.22% | 74.84% | +15.62%p |
122
+ | STS12 | 52.11% | 74.24% | +22.13%p |
123
+ | STS13 | 64.25% | 69.75% | +5.5%p |
124
+ | STS14 | 60.12% | 70.86% | +10.74%p |
125
+ | STS15 | 74.19% | 82.14% | +7.95%p |
126
+ | STS17 | 38.71% | 40.06% | +1.35%p |
127
+ | STS22.v2 | 27.7% | 31.5% | +3.8%p |
128
+ | STSBenchmark | 60.91% | 77.11% | +16.2%p |
129
+ | StackExchangeClustering.v2 | 39.42% | 38.82% | -0.6%p |
130
+ | StackExchangeClusteringP2P.v2 | 31.85% | 30.07% | -1.78%p |
131
+ | ToxicConversationsClassification | 55.82% | 55.65% | -0.17%p |
132
+ | TweetSentimentExtractionClassification | 45.74% | 60.03% | +14.29%p |
133
+ | TwentyNewsgroupsClustering.v2 | 13.35% | 15.01% | +1.66%p |
134
 
135
 
136
  ## Training
 
138
  ### Stage 1: Model Compression
139
  - **Teacher**: `intfloat/multilingual-e5-small` (12L, 384d)
140
  - **Compression**: Layer pruning + Vocab pruning
141
+ - **Result**: 4L / 384d / 15,168 vocab
142
 
143
  ### Stage 2: Knowledge Distillation
144
  - **Method**: MSE + Cosine Similarity loss
config.json CHANGED
@@ -14,12 +14,12 @@
14
  "max_position_embeddings": 512,
15
  "model_type": "bert",
16
  "num_attention_heads": 12,
17
- "num_hidden_layers": 5,
18
  "pad_token_id": 0,
19
  "position_embedding_type": "absolute",
20
  "tokenizer_class": "XLMRobertaTokenizer",
21
  "transformers_version": "4.56.2",
22
  "type_vocab_size": 2,
23
  "use_cache": true,
24
- "vocab_size": 8675
25
  }
 
14
  "max_position_embeddings": 512,
15
  "model_type": "bert",
16
  "num_attention_heads": 12,
17
+ "num_hidden_layers": 4,
18
  "pad_token_id": 0,
19
  "position_embedding_type": "absolute",
20
  "tokenizer_class": "XLMRobertaTokenizer",
21
  "transformers_version": "4.56.2",
22
  "type_vocab_size": 2,
23
  "use_cache": true,
24
+ "vocab_size": 15168
25
  }
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:504814e0b78cfde32f085153eda926e8e0b395756de301be97c064b26bf0c74e
3
- size 50207568
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:248b7dfb9bb4c1e024b364077af53bc31b35b853f6050510d4a89dd74d0803de
3
+ size 53081192
tokenizer.json CHANGED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json CHANGED
@@ -32,7 +32,7 @@
32
  "single_word": false,
33
  "special": true
34
  },
35
- "8674": {
36
  "content": "<mask>",
37
  "lstrip": false,
38
  "normalized": false,
 
32
  "single_word": false,
33
  "special": true
34
  },
35
+ "15167": {
36
  "content": "<mask>",
37
  "lstrip": false,
38
  "normalized": false,