ABSA-mBERT-ACD (Aspect Category Detection)
Model ini adalah hasil fine-tuning dari bert-base-multilingual-uncased (mBERT) khusus untuk domain ulasan produk monitor berbahasa Indonesia, pada tugas Aspect Category Detection (ACD). Model memprediksi aspek mana saja yang dibahas dalam satu ulasan (multi-label), sebagai tahap pertama dari pipeline Aspect-Based Sentiment Analysis (ABSA) dua tahap (ACD β ASC).
Catatan domain: Model ini di-fine-tune secara spesifik pada data diskusi komunitas monitor (bukan produk umum), sehingga performa terbaiknya berada pada teks berbahasa Indonesia yang membahas monitor β termasuk jargon teknis seperti refresh rate, ghosting, IPS, sRGB, dan satuan seperti Hz/ms. Penggunaan di luar domain ini (produk lain) belum tentu memberikan performa setara.
Model ini dilatih sebagai pembanding terhadap varian IndoBERT dalam penelitian skripsi: "Implementasi Aspect-Based Sentiment Analysis (ABSA) Berbasis IndoBERT untuk Pemetaan Keluhan pada Ulasan Produk Monitor"
Detail Model
| Nama Model | ABSA-mBERT-ACD |
| Model Dasar | bert-base-multilingual-uncased |
| Di-fine-tune oleh | Louders Yoakim Telaumbanua |
| Bahasa | Indonesia (id), basis multilingual |
| Task | Multi-label Text Classification (Aspect Category Detection) |
| Lisensi | Apache 2.0 |
| Framework | Hugging Face Transformers & PyTorch |
Label Aspek
Model memprediksi probabilitas kemunculan setiap aspek berikut (multi-label, aktivasi sigmoid + threshold):
| Kode | Aspek | Deskripsi |
|---|---|---|
| A1 | Kinerja Visual | Resolusi, akurasi warna, refresh rate, ghosting |
| A2 | Keandalan & Cacat Produk | Dead pixel, backlight bleed, kestabilan jangka panjang |
| A3 | Desain, Kualitas Fisik & Fitur | Build quality, ergonomi, konektivitas, fitur tambahan |
| B1 | Komunikasi & Dukungan Penjual | Respons, keramahan, profesionalisme penjual |
| B2 | Layanan Purna Jual | Klaim garansi, retur, penanganan komplain |
| B3 | Akurasi Informasi Produk | Kesesuaian deskripsi/foto dengan unit fisik |
| C1 | Pengemasan & Pengiriman | Standar packing, keamanan, ketepatan waktu |
| C2 | Harga & Nilai | Value for money, kewajaran harga, promo |
| D1 | Umum | Ungkapan umum yang tidak merujuk objek spesifik |
Threshold optimal hasil kalibrasi disimpan terpisah di acd_optimal_thresholds.json (Β± 0.30 untuk varian mBERT).
Cara Penggunaan
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("loudersyoakim/absa-mbert-acd")
model = AutoModelForSequenceClassification.from_pretrained("loudersyoakim/absa-mbert-acd")
text = "Warnanya akurat banget, tapi harganya agak mahal dibanding toko sebelah."
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
with torch.no_grad():
logits = model(**inputs).logits
probs = torch.sigmoid(logits).squeeze(0).tolist()
threshold = 0.30
aspect_labels = ["A1", "A2", "A3", "B1", "B2", "B3", "C1", "C2", "D1"]
detected = [aspect_labels[i] for i, p in enumerate(probs) if p >= threshold]
print(detected)
Model ini hanya mendeteksi aspek yang dibahas. Untuk mendapatkan sentimen per aspek, keluaran ACD ini diteruskan ke model pasangannya:
absa-mbert-asc.
Pipeline Lengkap
teks ulasan β [ACD: model ini] β daftar aspek yang terdeteksi
β [ASC: absa-mbert-asc] β sentimen (Positif/Netral/Negatif) per aspek
Data Pelatihan
Model dilatih pada dataset ulasan produk monitor berbahasa Indonesia yang identik dengan varian IndoBERT (3.326 ulasan bersih dari Komunitas Discord GTID, dilabeli manual, split β80:10:10 per-ulasan), untuk menjaga konsistensi perbandingan performa antar arsitektur dasar.
Hyperparameter terbaik hasil grid search: batch 16, learning rate 5e-5, 5 epoch.
Evaluasi (Data Uji, 333 ulasan / 588 baris)
| Metrik | Skor |
|---|---|
| F1-Macro | 0,8417 |
| F1-Micro | 0,8753 |
| Precision-Macro | 0,8276 |
| Recall-Macro | 0,8630 |
| Hamming Loss | 0,0497 |
| Akurasi Exact-Match | 68,47% |
| Threshold optimal | 0,30 (F1-Macro validasi 0,8699) |
mBERT membutuhkan threshold jauh lebih rendah dari IndoBERT (0,30 vs 0,45), mengindikasikan distribusi probabilitas sigmoid yang lebih under-confident pada domain ulasan teknis berbahasa Indonesia. Model ini mencatat recall-macro sedikit lebih tinggi dari IndoBERT namun dengan precision lebih rendah β cenderung lebih "berani" menandai aspek dengan konsekuensi lebih banyak false positive.
Berdasarkan uji McNemar, IndoBERT unggul signifikan secara statistik dibanding mBERT pada kategori D1 (p = 0,0026); pada kategori aspek lainnya, selisih performa belum signifikan secara statistik (data uji 333 ulasan relatif terbatas).
Metrik lengkap lainnya (confusion matrix per aspek, interval kepercayaan bootstrap, uji McNemar lengkap) tersedia pada folder evaluation/ di repositori penelitian.
Model Terkait
| Model | Task |
|---|---|
absa-indobert-acd |
Aspect Category Detection β basis IndoBERT |
absa-indobert-asc |
Aspect Sentiment Classification β basis IndoBERT |
absa-mbert-acd (model ini) |
Aspect Category Detection β basis mBERT |
absa-mbert-asc |
Aspect Sentiment Classification β basis mBERT |
Sitasi
@misc{telaumbanua2026absa,
author = {Telaumbanua, Louders Yoakim},
title = {Implementasi Aspect-Based Sentiment Analysis (ABSA) Berbasis IndoBERT untuk Pemetaan Keluhan pada Ulasan Produk Monitor},
year = {2026},
note = {Skripsi}
}
- Downloads last month
- 11
Model tree for loudersyoakim/absa-mbert-acd
Base model
google-bert/bert-base-multilingual-uncased