---
tags:
- sentence-transformers
- sentence-similarity
- feature-extraction
- generated_from_trainer
- dataset_size:7278
- loss:MultipleNegativesRankingLoss
base_model: sentence-transformers/LaBSE
widget:
- source_sentence: '- Н-да!'
sentences:
- Акана — хохавава.
- А о-отэнчя тихэс устя тэ и гыя дрэ фэлда ни прэ конэстэ на дыкхи.
- — Аи!
- source_sentence: Чего в ней!
sentences:
- >-
И гарави пэстыр пэскиро доґалыпэ ёв пролыджия времё жыко бельвель, то ушты
и псири пиро прахо, то пасиндой.
- Со дрэ лэстэ!
- Кошэна ман прэ грэда — розмэклы.
- source_sentence: Ладно.
sentences:
- Задынэ андрэ грэн.
- Шукар.
- Адай ёв тырдыя и порискирдя шэро, пучибныткэс подыкхья прэ Макаростэ.
- source_sentence: >-
Его старуха была громадная, рослая старуха, и ему нести ее было бы еще
труднее.
sentences:
- >-
И Макаро газдыяпэ, ракири пэскэ тэло ушт, со дажэ после мулыпэ на дэн
манушэскэ тэ пасёл.
- >-
Лэскири пхури сыс дрэван бари, зоралы пхури, и лэскэ тэ лыджял ла явэлас бы
инкэ пхарыдыр.
- Ёв лыя тэ ракир одолэстыр, со на камэл тэ джял ко трапэзнико дро грая.
- source_sentence: Владимир разорвал их, не читая.
sentences:
- >-
Коли, хамэ, ту зорало тэ явэс тэ умарав тут могискиравас, а то и адава
нашты.
- Мандэ кэ ёв сыс баро уважэниё и ёв ман дрэван камья.
- Владимиро розрискирдя лэн на гины.
pipeline_tag: sentence-similarity
library_name: sentence-transformers
metrics:
- src2trg_accuracy
- trg2src_accuracy
- mean_accuracy
model-index:
- name: SentenceTransformer based on sentence-transformers/LaBSE
results:
- task:
type: translation
name: Translation
dataset:
name: ruska roma validation
type: ruska-roma-validation
metrics:
- type: src2trg_accuracy
value: 0.9023485784919654
name: Src2Trg Accuracy
- type: trg2src_accuracy
value: 0.892459826946848
name: Trg2Src Accuracy
- type: mean_accuracy
value: 0.8974042027194067
name: Mean Accuracy
license: mit
---
# SentenceTransformer based on sentence-transformers/LaBSE
This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [sentence-transformers/LaBSE](https://huggingface.co/sentence-transformers/LaBSE). It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for retrieval.
Model was fine-tuned Ruska Romani on Russian language pairs. Ruska Romani is the dialect of Romani language attributed to Ruska Roma, the largest subgroup of Romani people in Russia.
Model was trained and evaluated on parallel pairs data data from the [Russian National Corpus](https://ruscorpora.ru/en/search?search=CgkyBwgFEgNybWw%253D).
The data curation process is described in the article [The Parallel Corpus of Russian and Ruska Romani Languages](https://aclanthology.org/2024.fieldmatters-1.1/). Please refer to that paper in any publications where the model was used.
## Model Details
### Model Description
- **Model Type:** Sentence Transformer
- **Base model:** [sentence-transformers/LaBSE](https://huggingface.co/sentence-transformers/LaBSE)
- **Maximum Sequence Length:** 256 tokens
- **Output Dimensionality:** 768 dimensions
- **Similarity Function:** Cosine Similarity
- **Supported Modality:** Text
### Model Sources
- **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
- **Repository:** [Sentence Transformers on GitHub](https://github.com/huggingface/sentence-transformers)
- **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
### Full Model Architecture
```
SentenceTransformer(
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
(1): Pooling({'embedding_dimension': 768, 'pooling_mode': 'cls', 'include_prompt': True})
(2): Dense({'in_features': 768, 'out_features': 768, 'bias': True, 'activation_function': 'torch.nn.modules.activation.Tanh', 'module_input_name': 'sentence_embedding', 'module_output_name': 'sentence_embedding'})
(3): Normalize({})
)
```
## Usage
### Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
```bash
pip install -U sentence-transformers
```
Then you can load this model and run inference.
```python
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("midwestcyr/labse-ruskaromani")
# Run inference
sentences = [
'Владимир разорвал их, не читая.',
'Владимиро розрискирдя лэн на гины.',
'Мандэ кэ ёв сыс баро уважэниё и ёв ман дрэван камья.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[1.0000, 0.8380, 0.0814],
# [0.8380, 1.0000, 0.1824],
# [0.0814, 0.1824, 1.0000]])
```
## Evaluation
### Metrics
#### Translation
* Dataset: `ruska-roma-validation`
* Evaluated with [TranslationEvaluator](https://sbert.net/docs/package_reference/sentence_transformer/evaluation.html#sentence_transformers.sentence_transformer.evaluation.TranslationEvaluator)
| Metric | Value |
|:------------------|:-----------|
| src2trg_accuracy | 0.9023 |
| trg2src_accuracy | 0.8925 |
| **mean_accuracy** | **0.8974** |
## Training Details
### Training Dataset
#### Unnamed Dataset
* Size: 7,278 training samples
* Columns: sentence_0, sentence_1, and label
* Approximate statistics based on the first 100 samples:
| | sentence_0 | sentence_1 | label |
|:---------|:----------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------|:--------------------------------------------------------------|
| type | string | string | float |
| modality | text | text | |
| details |
Не бойтесь, государь милостив, я буду просить его. Он нас не обидит. Мы все его дети. А как ему за вас будет заступиться, если вы станете бунтовать и разбойничать». | На дарэнте, тагари куч, мэ лава тэ мангав лэс — ёв амэн на помэкэла — амэ сарэ лэскирэ чявэ — а сыр лэскэ пал тумэндэ тэ затэрдёл, коли тумэ лэна тэ газдэн бунто и разбоё. | 1.0 |
| Можно было видеть, что мужчина высок и стоит у весла, широко расставив ноги, вполоборота к кругленькой, маленькой женщине, прислонившейся грудью к другому веслу, саженях в полутора от первого. | Могискирдо сыс тэ роздыкхэс, со гаджё учё и тэрдо пашо вёсло, буґлэс росчеви ґэра, дро паш обрисибэ кэ крэнглинько джювлы, сави припасия колынэса кэ вавир вёсло, надур екх екхэстыр. | 1.0 |
| Мазурка кончилась, хозяева просили гостей к ужину, но полковник Б. отказался, сказав, что ему надо завтра рано вставать, и простился с хозяевами. | Мазурка кончисалыя, хулая мангнэ гостен ко хабэ, нэ полковнико Б. отпхэндяпэ и пхэндя, со лэскэ трэбинэ атася злокоса тэ уштэс и простиндяпэ хуланца. | 1.0 |
* Loss: [MultipleNegativesRankingLoss](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#multiplenegativesrankingloss) with these parameters:
```json
{
"scale": 20.0,
"similarity_fct": "cos_sim",
"gather_across_devices": false,
"directions": [
"query_to_doc"
],
"partition_mode": "joint",
"hardness_mode": null,
"hardness_strength": 0.0
}
```
### Training Hyperparameters
#### Non-Default Hyperparameters
- `per_device_train_batch_size`: 16
- `fp16`: True
- `per_device_eval_batch_size`: 16
- `multi_dataset_batch_sampler`: round_robin
#### All Hyperparameters