Text Classification
Transformers
Safetensors
Portuguese
deberta
fake-news
sequence-classification
portuguese
Eval Results (legacy)
Instructions to use HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections") model = AutoModelForSequenceClassification.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections", device_map="auto") - Notebooks
- Google Colab
- Kaggle
docs: harmonize canonical layout, exact F1 metric, hardware details and verified citations
0e21d54 verified |
Download README.md from HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections: direct link, hf CLI and curl.
- Browser
- Download file 5.22 kB
-
https://huggingface.co/HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections/resolve/main/README.md
- Command line
-
hf download hf://HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections/README.md
-
curl -L -o README.md https://huggingface.co/HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections/resolve/main/README.md
5.22 kB
metadata
language:
- pt
license: mit
tags:
- fake-news
- text-classification
- sequence-classification
- portuguese
- transformers
datasets:
- HenriqueLz/fakerecogna2-extrativa-elections
base_model: PORTULAN/albertina-100m-portuguese-ptbr-encoder
metrics:
- f1
model-index:
- name: albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections
results:
- task:
type: text-classification
name: Fake News Detection
dataset:
name: fakerecogna2-extrativa-elections
type: HenriqueLz/fakerecogna2-extrativa-elections
metrics:
- name: F1
type: f1
value: 0.9967
Albertina PT-BR 100M - FakeRecogna 2.0 Extrativa (Elections Split)
Este modelo é uma versão fine-tuned do PORTULAN/albertina-100m-portuguese-ptbr-encoder para a tarefa de Detecção de Notícias Falsas (Fake News) em português brasileiro, treinado no dataset HenriqueLz/fakerecogna2-extrativa-elections.
Desempenho no Teste
- F1-Score Geral (Ponderado):
0.9967 - Conjunto de Avaliação: 10.504 notícias posteriores a 30/10/2021 (cenário eleitoral brasileiro de 2022).
Rótulos das Classes
| ID | Label | Descrição |
|---|---|---|
0 |
VERDADEIRA |
Notícia factual / verdadeira |
1 |
FALSA |
Notícia falsa / desinformação |
Como usar
1. Inferência com pipeline:
from transformers import pipeline
classifier = pipeline(
"text-classification",
model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections",
tokenizer="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections",
)
texto = "Ministério da Saúde divulga calendário oficial de vacinação para o próximo ano."
resultado = classifier(texto)
print(resultado)
# Output: [{'label': 'VERDADEIRA', 'score': 0.99...}]
2. Carregamento Manual com PyTorch:
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections")
model = AutoModelForSequenceClassification.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections")
texto = "Texto da notícia para classificação..."
inputs = tokenizer(texto, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
logits = model(**inputs).logits
predicted_class_id = logits.argmax().item()
label = model.config.id2label[predicted_class_id]
print(f"Classe predita: {label}")
Detalhes do Treinamento
- Dataset:
HenriqueLz/fakerecogna2-extrativa-elections(split temporal com data de corte em 30/10/2021). - Hardware: Treinado localmente em GPU NVIDIA GeForce GTX 1070 (8 GB VRAM).
- Épocas: 5 épocas completas.
- Taxa de Aprendizado (Learning Rate):
1e-5com otimizador AdamW e decaimento de peso (weight decay) de0.01. - Precisão: FP16 (Mixed Precision).
- Batch Size: 16 (com
DataCollatorWithPadding).
Limitações
- O modelo foi treinado em textos jornalísticos em português brasileiro e pode ter desempenho inferior em textos curtos de redes sociais, gírias regionais excessivas ou outros idiomas.
- Como classificador probabilístico, deve ser utilizado como ferramenta de apoio à checagem e moderação, e não como fonte única e infalível de veracidade.
Citações
Caso utilize este modelo em sua pesquisa, cite o dataset base FakeRecogna 2.0 e o artigo original da arquitetura correspondente:
FakeRecogna 2.0 (PROPOR 2024):
@inproceedings{garcia-etal-2024-text,
title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
author = "Garcia, Gabriel Lino and Paiola, Pedro Henrique and Jodas, Danilo Samuel and Sugi, Luis Afonso and Papa, Jo{\~a}o Paulo",
booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
month = mar,
year = "2024",
address = "Santiago de Compostela, Galicia/Spain",
publisher = "Association for Computational Lingustics",
url = "https://aclanthology.org/2024.propor-1.9/",
pages = "86--96"
}
Arquitetura Base (Albertina PT-BR 100M):
@inproceedings{rodrigues-etal-2023-advancing,
title = "Advancing Neural Language Modeling for {P}ortuguese with {A}lbertina {PT}-*",
author = "Rodrigues, Jo{\~a}o and Gomes, Lu{'\i}s and Silva, Jo{\~a}o and de Melo, Ant{'o}nio and Lopes, Lu{'\i}s and Branco, Ant{'o}nio",
booktitle = "Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing",
month = dec,
year = "2023",
address = "Singapore",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2023.emnlp-main.832/",
doi = "10.18653/v1/2023.emnlp-main.832",
pages = "13426--13437"
}