--- library_name: transformers datasets: - HenriqueLz/fakerecogna2-extrativa-elections language: - pt metrics: - f1 - accuracy base_model: - PORTULAN/albertina-100m-portuguese-ptbr pipeline_tag: text-classification license: mit tags: - fake-news - portuguese - brazil - elections - deberta - albertina --- # Albertina 100M PT-BR — Detecção de Fake News (Eleições BR) Fine-tune do [Albertina 100M PT-BR](https://huggingface.co/PORTULAN/albertina-100m-portuguese-ptbr) (DeBERTa) para classificação binária de notícias falsas em português brasileiro, treinado no corpus eleitoral [fakerecogna2-extrativa-elections](https://huggingface.co/datasets/HenriqueLz/fakerecogna2-extrativa-elections). ## Uso rápido ```python from transformers import pipeline classifier = pipeline( "text-classification", model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections", ) result = classifier("A OMS confirmou que a vacina causa autismo em crianças.") # [{'label': 'FALSA', 'score': 0.9999}] ``` Ou carregando manualmente: ```python from transformers import AutoTokenizer, AutoModelForSequenceClassification import torch model_id = "HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForSequenceClassification.from_pretrained(model_id) inputs = tokenizer("Texto a classificar", return_tensors="pt", truncation=True) with torch.no_grad(): logits = model(**inputs).logits pred = logits.argmax(-1).item() print(model.config.id2label[pred]) # "VERDADEIRA" ou "FALSA" ``` ## Labels | ID | Label | Descrição | |----|-------|-----------| | 0 | `VERDADEIRA` | Notícia verdadeira / conteúdo factual | | 1 | `FALSA` | Notícia falsa / desinformação | ## Detalhes de Treinamento ### Dados - **Dataset base:** [recogna-nlp/fakerecogna2-extrativa](https://huggingface.co/datasets/recogna-nlp/fakerecogna2-extrativa) / [HenriqueLz/fakerecogna2-extrativa-elections](https://huggingface.co/datasets/HenriqueLz/fakerecogna2-extrativa-elections) - **Train:** 42.031 exemplos - **Test:** 10.504 exemplos (2.326 FALSA · 8.178 VERDADEIRA) - **Domínio:** Notícias sobre eleições brasileiras ### Hiperparâmetros | Parâmetro | Valor | |-----------|-------| | Learning rate | 1e-5 | | Batch size | 16 | | Épocas | 5 | | Weight decay | 0.01 | | Precisão | fp16 | | Otimizador | AdamW | | Scheduler | Linear com warmup | | Hardware | NVIDIA Tesla P100 (Kaggle) | ### Modelo base [Albertina 100M PT-BR](https://huggingface.co/PORTULAN/albertina-100m-portuguese-ptbr) — Modelo baseado na arquitetura DeBERTa (100M parâmetros) pré-treinado em português brasileiro pela PORTULAN CLARIN. ## Limitações - **Domínio restrito:** Treinado exclusivamente em notícias do contexto eleitoral brasileiro. - **Corte temporal:** O corpus reflete padrões linguísticos de um período eleitoral específico. - **Viés de dataset:** A distribuição de classes reflete o corpus coletado. ## Citações ```bibtex @inproceedings{garcia-etal-2024-text, title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset", author = "Garcia, Gabriel Lino and Paiola, Pedro Henrique and Jodas, Danilo Samuel and Sugi, Luis Afonso and Papa, Jo{\~a}o Paulo", editor = "Gamallo, Pablo and Claro, Daniela and Teixeira, Ant{'o}nio and Real, Livy and Garcia, Marcos and Oliveira, Hugo Gon{\c{c}}alo and Amaro, Raquel", booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1", month = mar, year = "2024", address = "Santiago de Compostela, Galicia/Spain", publisher = "Association for Computational Lingustics", url = "https://aclanthology.org/2024.propor-1.9/", pages = "86--96" } @inproceedings{rodrigues-etal-2023-advancing, title = "Advancing Neural Encoding of {P}ortuguese with {T}ransformer {A}lbertina {PT}-*", author = "Rodrigues, Jo{\~a}o and Gomes, Lu{\'\i}s and Silva, Jo{\~a}o and Branco, Ant{'o}nio and Santos, Rodrigo and Cardoso, Henrique Lopes and Os{'o}rio, Tom{'a}s", booktitle = "Progress in Artificial Intelligence: 22nd EPIA Conference on Artificial Intelligence (EPIA 2023)", month = sep, year = "2023", address = "Faial Island, Portugal", publisher = "Springer Nature Switzerland", pages = "441--453" } ```