XLM-RoBERTa Large Lemmatizer (ONNX INT8)
Optimized model for CPU inference.
Usage
from optimum.onnxruntime import ORTModelForTokenClassification
from transformers import AutoTokenizer
model = ORTModelForTokenClassification.from_pretrained("xa2go/xlm-roberta-large-lemma-eu-onnx-int8")
tokenizer = AutoTokenizer.from_pretrained("xa2go/xlm-roberta-large-lemma-eu-onnx-int8")
text = "Euskal Herriko Unibertsitatea Bilboko campusean dago."
inputs = tokenizer(text, return_tensors="np")
outputs = model(**inputs)
Características
- Format: ONNX INT8 quantized
- Optimizado: AVX2 (AMD EPYC, Intel Xeon)
- Speedup: 2-3x vs FP32
- Tamaño: 75% reducción
- Downloads last month
- 6
Model tree for xa2go/xlm-roberta-large-lemma-eu-onnx-int8
Base model
HiTZ/xlm-roberta-large-lemma-eu