--- language: - pt license: mit tags: - fake-news - text-classification - sequence-classification - portuguese - transformers datasets: - HenriqueLz/fakerecogna2-extrativa-elections base_model: PORTULAN/albertina-100m-portuguese-ptbr-encoder metrics: - f1 model-index: - name: albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections results: - task: type: text-classification name: Fake News Detection dataset: name: fakerecogna2-extrativa-elections type: HenriqueLz/fakerecogna2-extrativa-elections metrics: - name: F1 type: f1 value: 0.9967 --- # Albertina PT-BR 100M - FakeRecogna 2.0 Extrativa (Elections Split) Este modelo é uma versão fine-tuned do [`PORTULAN/albertina-100m-portuguese-ptbr-encoder`](https://huggingface.co/PORTULAN/albertina-100m-portuguese-ptbr-encoder) para a tarefa de **Detecção de Notícias Falsas (Fake News)** em português brasileiro, treinado no dataset [`HenriqueLz/fakerecogna2-extrativa-elections`](https://huggingface.co/datasets/HenriqueLz/fakerecogna2-extrativa-elections). ## Desempenho no Teste - **F1-Score Geral (Ponderado):** **`0.9967`** - **Conjunto de Avaliação:** 10.504 notícias posteriores a 30/10/2021 (cenário eleitoral brasileiro de 2022). ## Rótulos das Classes | ID | Label | Descrição | | :---: | :---: | :--- | | `0` | `VERDADEIRA` | Notícia factual / verdadeira | | `1` | `FALSA` | Notícia falsa / desinformação | ## Como usar ### 1. Inferência com `pipeline`: ```python from transformers import pipeline classifier = pipeline( "text-classification", model="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections", tokenizer="HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections", ) texto = "Ministério da Saúde divulga calendário oficial de vacinação para o próximo ano." resultado = classifier(texto) print(resultado) # Output: [{'label': 'VERDADEIRA', 'score': 0.99...}] ``` ### 2. Carregamento Manual com PyTorch: ```python import torch from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections") model = AutoModelForSequenceClassification.from_pretrained("HenriqueLz/albertina-100m-portuguese-ptbr-fakerecogna2-extrativa-elections") texto = "Texto da notícia para classificação..." inputs = tokenizer(texto, return_tensors="pt", truncation=True, max_length=512) with torch.no_grad(): logits = model(**inputs).logits predicted_class_id = logits.argmax().item() label = model.config.id2label[predicted_class_id] print(f"Classe predita: {label}") ``` ## Detalhes do Treinamento - **Dataset:** [`HenriqueLz/fakerecogna2-extrativa-elections`](https://huggingface.co/datasets/HenriqueLz/fakerecogna2-extrativa-elections) (split temporal com data de corte em 30/10/2021). - **Hardware:** Treinado localmente em GPU **NVIDIA GeForce GTX 1070 (8 GB VRAM)**. - **Épocas:** 5 épocas completas. - **Taxa de Aprendizado (Learning Rate):** `1e-5` com otimizador AdamW e decaimento de peso (weight decay) de `0.01`. - **Precisão:** FP16 (Mixed Precision). - **Batch Size:** 16 (com `DataCollatorWithPadding`). ## Limitações - O modelo foi treinado em textos jornalísticos em português brasileiro e pode ter desempenho inferior em textos curtos de redes sociais, gírias regionais excessivas ou outros idiomas. - Como classificador probabilístico, deve ser utilizado como ferramenta de apoio à checagem e moderação, e não como fonte única e infalível de veracidade. ## Citações Caso utilize este modelo em sua pesquisa, cite o dataset base FakeRecogna 2.0 e o artigo original da arquitetura correspondente: ### FakeRecogna 2.0 (PROPOR 2024): ```bibtex @inproceedings{garcia-etal-2024-text, title = "Text Summarization and Temporal Learning Models Applied to {P}ortuguese Fake News Detection in a Novel {B}razilian Corpus Dataset", author = "Garcia, Gabriel Lino and Paiola, Pedro Henrique and Jodas, Danilo Samuel and Sugi, Luis Afonso and Papa, Jo{\~a}o Paulo", booktitle = "Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1", month = mar, year = "2024", address = "Santiago de Compostela, Galicia/Spain", publisher = "Association for Computational Lingustics", url = "https://aclanthology.org/2024.propor-1.9/", pages = "86--96" } ``` ### Arquitetura Base (Albertina PT-BR 100M): ```bibtex @inproceedings{rodrigues-etal-2023-advancing, title = "Advancing Neural Language Modeling for {P}ortuguese with {A}lbertina {PT}-*", author = "Rodrigues, Jo{\~a}o and Gomes, Lu{'\i}s and Silva, Jo{\~a}o and de Melo, Ant{'o}nio and Lopes, Lu{'\i}s and Branco, Ant{'o}nio", booktitle = "Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing", month = dec, year = "2023", address = "Singapore", publisher = "Association for Computational Linguistics", url = "https://aclanthology.org/2023.emnlp-main.832/", doi = "10.18653/v1/2023.emnlp-main.832", pages = "13426--13437" } ```