Instructions to use zjunlp/SafeEdit-Safety-Classifier with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use zjunlp/SafeEdit-Safety-Classifier with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="zjunlp/SafeEdit-Safety-Classifier")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("zjunlp/SafeEdit-Safety-Classifier") model = AutoModelForSequenceClassification.from_pretrained("zjunlp/SafeEdit-Safety-Classifier", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.md from zjunlp/SafeEdit-Safety-Classifier: direct link, hf CLI and curl.
- Browser
- Download file 1.09 kB
-
https://huggingface.co/zjunlp/SafeEdit-Safety-Classifier/resolve/e1fe635f7176656eeada50a0865c53156b9a9370/README.md
- Command line
-
hf download hf://zjunlp/SafeEdit-Safety-Classifier@e1fe635f7176656eeada50a0865c53156b9a9370/README.md
-
curl -L -o README.md https://huggingface.co/zjunlp/SafeEdit-Safety-Classifier/resolve/e1fe635f7176656eeada50a0865c53156b9a9370/README.md
1.09 kB
metadata
license: apache-2.0
Safety classifier for Detoxifying Large Language Models via Knowledge Editing
π» Usage
from transformers import RobertaForSequenceClassification, RobertaTokenizer
safety_classifier_dir = 'zjunlp/SafeEdit-Safety-Classifier'
safety_classifier_model = RobertaForSequenceClassification.from_pretrained(safety_classifier_dir)
safety_classifier_tokenizer = RobertaTokenizer.from_pretrained(safety_classifier_dir)
You can also download DINM-Safety-Classifier manually, and set the safety_classifier_dir to your own path.
π Citation
If you use our work, please cite our paper:
@misc{wang2024SafeEdit,
title={Detoxifying Large Language Models via Knowledge Editing},
author={Mengru Wang, Ningyu Zhang, Ziwen Xu, Zekun Xi, Shumin Deng, Yunzhi Yao, Qishen Zhang, Linyi Yang, Jindong Wang, Huajun Chen},
year={2024},
eprint={2403.14472},
archivePrefix={arXiv},
primaryClass={cs.CL}
url={https://arxiv.org/abs/2403.14472},
}