XLM-RoBERTa Large Lemmatizer (ONNX INT8)

Optimized model for CPU inference.

Usage

from optimum.onnxruntime import ORTModelForTokenClassification
from transformers import AutoTokenizer

model = ORTModelForTokenClassification.from_pretrained("xa2go/xlm-roberta-large-lemma-eu-onnx-int8")
tokenizer = AutoTokenizer.from_pretrained("xa2go/xlm-roberta-large-lemma-eu-onnx-int8")

text = "Euskal Herriko Unibertsitatea Bilboko campusean dago."
inputs = tokenizer(text, return_tensors="np")
outputs = model(**inputs)

Características

  • Format: ONNX INT8 quantized
  • Optimizado: AVX2 (AMD EPYC, Intel Xeon)
  • Speedup: 2-3x vs FP32
  • Tamaño: 75% reducción
Downloads last month
6
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for xa2go/xlm-roberta-large-lemma-eu-onnx-int8

Quantized
(1)
this model