HenriqueLz's picture
Update and standardize README.md with FakeRecogna 2.0 and Albertina citations
e8f0a28 verified
|
Raw History Blame
4.56 kB
metadata
library_name: transformers
datasets:
  - HenriqueLz/fakerecogna2-extrativa-elections
language:
  - pt
metrics:
  - f1
  - accuracy
base_model:
  - PORTULAN/albertina-100m-portuguese-ptbr
pipeline_tag: text-classification
license: mit
tags:
  - fake-news
  - portuguese
  - brazil
  - elections
  - deberta
  - albertina

Albertina 100M PT-BR — Detecção de Fake News (Eleições BR)

Fine-tune do Albertina 100M PT-BR (DeBERTa) para classificação binária de notícias falsas em português brasileiro, treinado no corpus eleitoral fakerecogna2-extrativa-elections.

Uso rápido

from transformers import pipeline

classifier = pipeline(
    "text-classification",
    model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections",
)

result = classifier("A OMS confirmou que a vacina causa autismo em crianças.")
# [{'label': 'FALSA', 'score': 0.9999}]

Ou carregando manualmente:

from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

model_id = "HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSequenceClassification.from_pretrained(model_id)

inputs = tokenizer("Texto a classificar", return_tensors="pt", truncation=True)
with torch.no_grad():
    logits = model(**inputs).logits
pred = logits.argmax(-1).item()
print(model.config.id2label[pred])  # "VERDADEIRA" ou "FALSA"

Labels

ID Label Descrição
0 VERDADEIRA Notícia verdadeira / conteúdo factual
1 FALSA Notícia falsa / desinformação

Detalhes de Treinamento

Dados

Hiperparâmetros

Parâmetro Valor
Learning rate 1e-5
Batch size 16
Épocas 5
Weight decay 0.01
Precisão fp16
Otimizador AdamW
Scheduler Linear com warmup
Hardware NVIDIA Tesla P100 (Kaggle)

Modelo base

Albertina 100M PT-BR — Modelo baseado na arquitetura DeBERTa (100M parâmetros) pré-treinado em português brasileiro pela PORTULAN CLARIN.

Limitações

  • Domínio restrito: Treinado exclusivamente em notícias do contexto eleitoral brasileiro.
  • Corte temporal: O corpus reflete padrões linguísticos de um período eleitoral específico.
  • Viés de dataset: A distribuição de classes reflete o corpus coletado.

Citações

@inproceedings{garcia-etal-2024-text,
    title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset",
    author = "Garcia, Gabriel Lino  and
      Paiola, Pedro Henrique  and
      Jodas, Danilo Samuel  and
      Sugi, Luis Afonso  and
      Papa, Jo{\~a}o Paulo",
    editor = "Gamallo, Pablo  and
      Claro, Daniela  and
      Teixeira, Ant{'o}nio  and
      Real, Livy  and
      Garcia, Marcos  and
      Oliveira, Hugo Gon{\c{c}}alo  and
      Amaro, Raquel",
    booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1",
    month = mar,
    year = "2024",
    address = "Santiago de Compostela, Galicia/Spain",
    publisher = "Association for Computational Lingustics",
    url = "https://aclanthology.org/2024.propor-1.9/",
    pages = "86--96"
}

@inproceedings{rodrigues-etal-2023-advancing,
    title = "Advancing Neural Encoding of {P}ortuguese with {T}ransformer {A}lbertina {PT}-*",
    author = "Rodrigues, Jo{\~a}o  and
      Gomes, Lu{\'\i}s  and
      Silva, Jo{\~a}o  and
      Branco, Ant{'o}nio  and
      Santos, Rodrigo  and
      Cardoso, Henrique Lopes  and
      Os{'o}rio, Tom{'a}s",
    booktitle = "Progress in Artificial Intelligence: 22nd EPIA Conference on Artificial Intelligence (EPIA 2023)",
    month = sep,
    year = "2023",
    address = "Faial Island, Portugal",
    publisher = "Springer Nature Switzerland",
    pages = "441--453"
}