Text Classification
Transformers
Safetensors
Portuguese
deberta
fake-news
sequence-classification
portuguese
Eval Results (legacy)
Instructions to use HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections") model = AutoModelForSequenceClassification.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.md from HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections: direct link, hf CLI and curl.
- Browser
- Download file 4.56 kB
-
https://huggingface.co/HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections/resolve/e8f0a28a1f1839296d79c0587d9f2bdb9c06ab69/README.md
- Command line
-
hf download hf://HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections@e8f0a28a1f1839296d79c0587d9f2bdb9c06ab69/README.md
-
curl -L -o README.md https://huggingface.co/HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections/resolve/e8f0a28a1f1839296d79c0587d9f2bdb9c06ab69/README.md
4.56 kB
metadata
library_name: transformers
datasets:
- HenriqueLz/fakerecogna2-extrativa-elections
language:
- pt
metrics:
- f1
- accuracy
base_model:
- PORTULAN/albertina-100m-portuguese-ptbr
pipeline_tag: text-classification
license: mit
tags:
- fake-news
- portuguese
- brazil
- elections
- deberta
- albertina
Albertina 100M PT-BR — Detecção de Fake News (Eleições BR)
Fine-tune do Albertina 100M PT-BR (DeBERTa) para classificação binária de notícias falsas em português brasileiro, treinado no corpus eleitoral fakerecogna2-extrativa-elections.
Uso rápido
from transformers import pipeline
classifier = pipeline(
"text-classification",
model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections",
)
result = classifier("A OMS confirmou que a vacina causa autismo em crianças.")
# [{'label': 'FALSA', 'score': 0.9999}]
Ou carregando manualmente:
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
model_id = "HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSequenceClassification.from_pretrained(model_id)
inputs = tokenizer("Texto a classificar", return_tensors="pt", truncation=True)
with torch.no_grad():
logits = model(**inputs).logits
pred = logits.argmax(-1).item()
print(model.config.id2label[pred]) # "VERDADEIRA" ou "FALSA"
Labels
| ID | Label | Descrição |
|---|---|---|
| 0 | VERDADEIRA |
Notícia verdadeira / conteúdo factual |
| 1 | FALSA |
Notícia falsa / desinformação |
Detalhes de Treinamento
Dados
- Dataset base: recogna-nlp/fakerecogna2-extrativa / HenriqueLz/fakerecogna2-extrativa-elections
- Train: 42.031 exemplos
- Test: 10.504 exemplos (2.326 FALSA · 8.178 VERDADEIRA)
- Domínio: Notícias sobre eleições brasileiras
Hiperparâmetros
| Parâmetro | Valor |
|---|---|
| Learning rate | 1e-5 |
| Batch size | 16 |
| Épocas | 5 |
| Weight decay | 0.01 |
| Precisão | fp16 |
| Otimizador | AdamW |
| Scheduler | Linear com warmup |
| Hardware | NVIDIA Tesla P100 (Kaggle) |
Modelo base
Albertina 100M PT-BR — Modelo baseado na arquitetura DeBERTa (100M parâmetros) pré-treinado em português brasileiro pela PORTULAN CLARIN.
Limitações
- Domínio restrito: Treinado exclusivamente em notícias do contexto eleitoral brasileiro.
- Corte temporal: O corpus reflete padrões linguísticos de um período eleitoral específico.
- Viés de dataset: A distribuição de classes reflete o corpus coletado.
Citações
@inproceedings{garcia-etal-2024-text,
title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
author = "Garcia, Gabriel Lino and
Paiola, Pedro Henrique and
Jodas, Danilo Samuel and
Sugi, Luis Afonso and
Papa, Jo{\~a}o Paulo",
editor = "Gamallo, Pablo and
Claro, Daniela and
Teixeira, Ant{'o}nio and
Real, Livy and
Garcia, Marcos and
Oliveira, Hugo Gon{\c{c}}alo and
Amaro, Raquel",
booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
month = mar,
year = "2024",
address = "Santiago de Compostela, Galicia/Spain",
publisher = "Association for Computational Lingustics",
url = "https://aclanthology.org/2024.propor-1.9/",
pages = "86--96"
}
@inproceedings{rodrigues-etal-2023-advancing,
title = "Advancing Neural Encoding of {P}ortuguese with {T}ransformer {A}lbertina {PT}-*",
author = "Rodrigues, Jo{\~a}o and
Gomes, Lu{\'\i}s and
Silva, Jo{\~a}o and
Branco, Ant{'o}nio and
Santos, Rodrigo and
Cardoso, Henrique Lopes and
Os{'o}rio, Tom{'a}s",
booktitle = "Progress in Artificial Intelligence: 22nd EPIA Conference on Artificial Intelligence (EPIA 2023)",
month = sep,
year = "2023",
address = "Faial Island, Portugal",
publisher = "Springer Nature Switzerland",
pages = "441--453"
}