---
tags:
- sentence-transformers
- sentence-similarity
- feature-extraction
- generated_from_trainer
- dataset_size:10000
- loss:TripletLoss
base_model: sentence-transformers/all-mpnet-base-v2
widget:
- source_sentence: 'Database: trna-n6-adenosine-threonylcarbamoyltransferase-tsad
| Table: trna-n6-adenosine-threonylcarbamoyltransferase-tsad_natural-product |
Sample: ...'
sentences:
- 'Database: trna-n6-adenosine-threonylcarbamoyltransferase-tsad | Table: trna-n6-adenosine-threonylcarbamoyltransferase-tsad_trna-n6-adenosine-threonylcarbamoyltransferase-tsad
| Sample: ...'
- 'Database: oxidoreductase-alpha-molybdopterin-subunit | Table: oxidoreductase-alpha-molybdopterin-subunit_oxidoreductase-alpha-molybdopterin-subunit
| Sample: ...'
- 'Database: protein-of-unknown-function-duf3561 | Table: protein-of-unknown-function-duf3561_encoded-by
| Sample: ...'
- source_sentence: 'Database: maastricht-formation | Table: maastricht-formation_eponym
| Sample: ...'
sentences:
- 'Database: maastricht-formation | Table: maastricht-formation_eponym | Sample:
...'
- 'Database: uncharacterised-protein-yqey-aim41 | Table: uncharacterised-protein-yqey-aim41_uncharacterised-protein-yqey-aim41
| Sample: ...'
- 'Database: 3-dehydro-bile-acid-delta46-reductase-like | Table: 3-dehydro-bile-acid-delta46-reductase-like_encoded-by
| Sample: ...'
- source_sentence: 'Database: hexokinase-subgroup | Table: hexokinase-subgroup_encoded-by
| Sample: ...'
sentences:
- 'Database: fictional-energy | Table: fictional-energy_fictional-energy | Sample:
...'
- 'Database: co-dehydrogenase-flavoprotein-c-terminal-domain-superfamily | Table:
co-dehydrogenase-flavoprotein-c-terminal-domain-superfamily_co-dehydrogenase-flavoprotein-c-terminal-domain-superfamily
| Sample: ...'
- 'Database: hexokinase-subgroup | Table: hexokinase-subgroup_chromosome | Sample:
...'
- source_sentence: 'Database: 2010-fifa-world-cup-qualification-uefa-group-1 | Table:
2010-fifa-world-cup-qualification-uefa-group-1_occupant | Sample: ...'
sentences:
- 'Database: 2010-fifa-world-cup-qualification-uefa-group-1 | Table: 2010-fifa-world-cup-qualification-uefa-group-1_occupant
| Sample: ...'
- 'Database: rna-polymerase-beta-subunit-conserved-site-protein-family | Table:
rna-polymerase-beta-subunit-conserved-site-protein-family_rna-polymerase-beta-subunit-conserved-site-protein-family
| Sample: ...'
- 'Database: anaphase-promoting-complex-subunit-4-wd40-domain-protein-family | Table:
anaphase-promoting-complex-subunit-4-wd40-domain-protein-family_natural-product
| Sample: ...'
- source_sentence: 'Database: bothy | Table: bothy_capital-city | Sample: ...'
sentences:
- 'Database: bothy | Table: bothy_administrative-centre | Sample: ...'
- 'Database: provincial-museum-in-finland | Table: provincial-museum-in-finland_jurisdiction
| Sample: ...'
- 'Database: saicar-synthetase-conserved-site-protein-family | Table: saicar-synthetase-conserved-site-protein-family_encoded-by
| Sample: ...'
pipeline_tag: sentence-similarity
library_name: sentence-transformers
---
# SentenceTransformer based on sentence-transformers/all-mpnet-base-v2
This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [sentence-transformers/all-mpnet-base-v2](https://huggingface.co/sentence-transformers/all-mpnet-base-v2). It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.
## Model Details
### Model Description
- **Model Type:** Sentence Transformer
- **Base model:** [sentence-transformers/all-mpnet-base-v2](https://huggingface.co/sentence-transformers/all-mpnet-base-v2)
- **Maximum Sequence Length:** 384 tokens
- **Output Dimensionality:** 768 dimensions
- **Similarity Function:** Cosine Similarity
### Model Sources
- **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
- **Repository:** [Sentence Transformers on GitHub](https://github.com/UKPLab/sentence-transformers)
- **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
### Full Model Architecture
```
SentenceTransformer(
(0): Transformer({'max_seq_length': 384, 'do_lower_case': False}) with Transformer model: MPNetModel
(1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
(2): Normalize()
)
```
## Usage
### Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
```bash
pip install -U sentence-transformers
```
Then you can load this model and run inference.
```python
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("sentence_transformers_model_id")
# Run inference
sentences = [
'Database: bothy | Table: bothy_capital-city | Sample: ...',
'Database: bothy | Table: bothy_administrative-centre | Sample: ...',
'Database: saicar-synthetase-conserved-site-protein-family | Table: saicar-synthetase-conserved-site-protein-family_encoded-by | Sample: ...',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities.shape)
# [3, 3]
```
## Training Details
### Training Dataset
#### Unnamed Dataset
* Size: 10,000 training samples
* Columns: sentence_0, sentence_1, and sentence_2
* Approximate statistics based on the first 1000 samples:
| | sentence_0 | sentence_1 | sentence_2 |
|:--------|:------------------------------------------------------------------------------------|:-----------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|
| type | string | string | string |
| details |
Database: protein-of-unknown-function-duf2635 | Table: protein-of-unknown-function-duf2635_encodes | Sample: ... | Database: protein-of-unknown-function-duf2635 | Table: protein-of-unknown-function-duf2635_protein-of-unknown-function-duf2635 | Sample: ... | Database: extinct-volcano | Table: extinct-volcano_country | Sample: ... |
| Database: tetrapyrrole-biosynthesis-glutamate-1-semialdehyde-aminotransferase | Table: tetrapyrrole-biosynthesis-glutamate-1-semialdehyde-aminotransferase_natural-product | Sample: ... | Database: tetrapyrrole-biosynthesis-glutamate-1-semialdehyde-aminotransferase | Table: tetrapyrrole-biosynthesis-glutamate-1-semialdehyde-aminotransferase_tetrapyrrole-biosynthesis-glutamate-1-semialdehyde-aminotransferase | Sample: ... | Database: pili-assembly-chaperone-conserved-site-protein-family | Table: pili-assembly-chaperone-conserved-site-protein-family_encoded-by | Sample: ... |
| Database: series-of-images | Table: series-of-images_series-of-images | Sample: ... | Database: series-of-images | Table: series-of-images_topic | Sample: ... | Database: claretian-martyrs-of-barbastro | Table: claretian-martyrs-of-barbastro_claretian-martyrs-of-barbastro | Sample: ... |
* Loss: [TripletLoss](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#tripletloss) with these parameters:
```json
{
"distance_metric": "TripletDistanceMetric.EUCLIDEAN",
"triplet_margin": 5
}
```
### Training Hyperparameters
#### Non-Default Hyperparameters
- `per_device_train_batch_size`: 16
- `per_device_eval_batch_size`: 16
- `fp16`: True
- `multi_dataset_batch_sampler`: round_robin
#### All Hyperparameters