---
tags:
- sentence-transformers
- sentence-similarity
- feature-extraction
- generated_from_trainer
- dataset_size:56574
- loss:MultipleNegativesRankingLoss
base_model: BAAI/bge-small-zh-v1.5
widget:
- source_sentence: 围裙、大叔、爸爸、抽烟、上门女婿
sentences:
- Royde咖啡店老板
- '角色:罗丽娜
本名:罗丽娜
别名:萝莉娜
发色:黑
瞳色:红
萌点:萝莉、傲娇、孩子气'
- '角色:Royde咖啡店老板
别名:店长、老爸
发色:银
瞳色:琥珀
年龄:50
萌点:店长、大叔、爸爸、上门女婿、围裙、抽烟、妻管严'
- source_sentence: 流星锤、紫瞳、紫发、短裤、袜套
sentences:
- '角色:碧蓝航线:U-96
本名:U96
发色:白
瞳色:黄
萌点:双马尾、死库水、率真'
- '角色:科拉普斯
本名:コラプス、COLLAPSE、科拉普斯
声优:皆川纯子
发色:紫发黑
瞳色:紫
萌点:兔耳、正太、挑染、王冠、光环、露脐装、披风、短裤、外星人、星星眼、袜套、宠物相伴、流星锤'
- 科拉普斯
- source_sentence: 黑瞳、赛车手、短发
sentences:
- '角色:妮娜(JOJO的奇妙冒险)
本名:ネーナ、Nena、妮娜
别名:纯情女子
声优:雪野五月配音角色、竹内顺子配音角色、丰口惠美配音角色
发色:黑
瞳色:紫
年龄:16
萌点:耳环、项链、中分、头巾、眉心点、贵族、易容、本体差异型反差萌、褐色皮肤、手环、OVA)、美少女、单恋、麻花辫'
- 中村贤太
- '角色:中村贤太
本名:中村贤太
声优:冈野浩介、冈野浩介配音角色、成家义哉、成家义哉配音角色
发色:金发黑
瞳色:黑
萌点:短发、赛车手'
- source_sentence: 超能力者、绿瞳、旗袍
sentences:
- '角色:拳藤一佳
本名:拳藤、一佳
别名:拳藤大姐头、英雄名:战斗之拳
声优:小笠原早纪配音角色、凌晞配音角色、陈筱宁配音角色、连思宇配音角色
发色:橙
瞳色:绿
生日:9月9日
星座:处女
血型:O
萌点:侧马尾、班长、手刀、美少女、旗袍'
- '角色:厄克德娜
本名:エキドナ、Echidna
别名:旧文明的机神
声优:今谷皆美
发色:金
瞳色:绿
萌点:机娘、组织领导人'
- 拳藤一佳
- source_sentence: 熟女、A型、召唤能力者
sentences:
- '角色:永仓爱美琉
本名:永仓爱美琉、永仓、えみる
声优:前田爱
生日:7月20日
星座:巨蟹
三围:80、58、83
发色:橙
瞳色:棕
萌点:双马尾、玩偶、元气、冒失娘、记者、长筒袜、洋装、第三人称己称、发珠、中分、鬓角须'
- '角色:文豪野犬:尾崎红叶
本名:尾崎、红叶、Ozaki Kouyou
别名:红叶大姐、红叶君
声优:小清水亚美
发色:红
瞳色:红
生日:1月10日
星座:摩羯
血型:A
萌点:和服、遮眼发、超能力者、熟女'
- 文豪野犬:尾崎红叶
pipeline_tag: sentence-similarity
library_name: sentence-transformers
---
# SentenceTransformer based on BAAI/bge-small-zh-v1.5
This is a [sentence-transformers](https://www.SBERT.net) model finetuned from [BAAI/bge-small-zh-v1.5](https://huggingface.co/BAAI/bge-small-zh-v1.5) on the json dataset. It maps sentences & paragraphs to a 512-dimensional dense vector space and can be used for retrieval.
## Model Details
### Model Description
- **Model Type:** Sentence Transformer
- **Base model:** [BAAI/bge-small-zh-v1.5](https://huggingface.co/BAAI/bge-small-zh-v1.5)
- **Maximum Sequence Length:** 512 tokens
- **Output Dimensionality:** 512 dimensions
- **Similarity Function:** Cosine Similarity
- **Supported Modality:** Text
- **Training Dataset:**
- json
### Model Sources
- **Documentation:** [Sentence Transformers Documentation](https://sbert.net)
- **Repository:** [Sentence Transformers on GitHub](https://github.com/huggingface/sentence-transformers)
- **Hugging Face:** [Sentence Transformers on Hugging Face](https://huggingface.co/models?library=sentence-transformers)
### Full Model Architecture
```
SentenceTransformer(
(0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'})
(1): Pooling({'embedding_dimension': 512, 'pooling_mode': 'cls', 'include_prompt': True})
(2): Normalize({})
)
```
## Usage
### Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
```bash
pip install -U sentence-transformers
```
Then you can load this model and run inference.
```python
from sentence_transformers import SentenceTransformer
# Download from the 🤗 Hub
model = SentenceTransformer("johnyy212/moe-girl-v2")
# Run inference
sentences = [
'熟女、A型、召唤能力者',
'角色:文豪野犬:尾崎红叶\n本名:尾崎、红叶、Ozaki Kouyou\n别名:红叶大姐、红叶君\n声优:小清水亚美\n发色:红\n瞳色:红\n生日:1月10日\n星座:摩羯\n血型:A\n萌点:和服、遮眼发、超能力者、熟女',
'文豪野犬:尾崎红叶',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 512]
# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[ 1.0000, 0.3878, -0.0819],
# [ 0.3878, 1.0000, 0.0236],
# [-0.0819, 0.0236, 1.0000]])
```
## Training Details
### Training Dataset
#### json
* Dataset: json
* Size: 56,574 training samples
* Columns: anchor, positive, and char_name
* Approximate statistics based on the first 1000 samples:
| | anchor | positive | char_name |
|:--------|:----------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------|
| type | string | string | string |
| details |
井上和彦、早水理沙 | 角色:黑田
本名:黒田
别名:小黑、幼年时
声优:小野友树、小野友树配音角色、井上和彦、井上和彦配音角色、早水理沙、早水理沙配音角色
发色:黑
瞳色:灰蓝
萌点:现在、工程师、浴衣、绷带、遮眼发、烟斗、人偶师、大叔、毒舌、反差萌、贪财、心理创伤、青年时、幼驯染、搞事、天才、傲娇、腹黑、强气、双向暗恋、单马尾、天然疯、武士、蔷薇 | 黑田 |
| 平田裕香 | 角色:寺门卷子
本名:寺门 巻子
声优:平田裕香
萌点:同级生 | 寺门卷子 |
| 蝴蝶结、高跟鞋、麦克风、制服、伞、乙女 | 角色:瞳(LIVE A HERO)
本名:绫歌瞳
别名:仁美、爱抖露
声优:夏怜
发色:黑
瞳色:渐变
萌点:麦克风、乙女、歌手、偶像、暴力女、短发、丸子头、耳环、制服、伞、比基尼、外套半脱、手套、蝴蝶结、百褶裙、长筒袜、四分之三袜、高跟鞋、元气、光 | 瞳(LIVE A HERO) |
* Loss: [MultipleNegativesRankingLoss](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#multiplenegativesrankingloss) with these parameters:
```json
{
"scale": 20.0,
"similarity_fct": "cos_sim",
"gather_across_devices": false,
"directions": [
"query_to_doc"
],
"partition_mode": "joint",
"hardness_mode": null,
"hardness_strength": 0.0
}
```
### Evaluation Dataset
#### json
* Dataset: json
* Size: 3,403 evaluation samples
* Columns: anchor, positive, and char_name
* Approximate statistics based on the first 1000 samples:
| | anchor | positive | char_name |
|:--------|:----------------------------------------------------------------------------------|:------------------------------------------------------------------------------------|:---------------------------------------------------------------------------------|
| type | string | string | string |
| details | 小天使、发珠、料理达人、傲娇、长直 | 角色:云雀丘琉璃
本名:云雀丘瑠璃
别名:云雀、ヒバリ、本场琉璃
声优:白石晴香
发色:琉璃色黑
瞳色:绿
生日:7月9日
星座:巨蟹
血型:B
萌点:不幸、单恋、微傲娇、小天使、美少女、认真、人妻、料理达人、长直、吊眼、发珠、高跟鞋、绝对领域 | 云雀丘琉璃 |
| 黑瞳、银发、特工、B型 | 角色:风间让二
本名:风间、譲二
别名:二叔
声优:渡哲也配音角色
发色:灰
瞳色:黑
年龄:64
血型:B
萌点:特工、弟弟、长者、双胞胎 | 风间让二 |
| 红发、机郎、傲娇、蓝瞳 | 角色:爱因兹希
本名:爱因兹希
别名:全连结指挥体
声优:诹访部顺一
发色:红
瞳色:蓝
萌点:机郎、傲娇、基佬 | 爱因兹希 |
* Loss: [MultipleNegativesRankingLoss](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#multiplenegativesrankingloss) with these parameters:
```json
{
"scale": 20.0,
"similarity_fct": "cos_sim",
"gather_across_devices": false,
"directions": [
"query_to_doc"
],
"partition_mode": "joint",
"hardness_mode": null,
"hardness_strength": 0.0
}
```
### Training Hyperparameters
#### Non-Default Hyperparameters
- `per_device_train_batch_size`: 64
- `learning_rate`: 2e-05
- `num_train_epochs`: 5
- `warmup_steps`: 0.1
- `fp16`: True
- `load_best_model_at_end`: True
- `batch_sampler`: no_duplicates
#### All Hyperparameters