| --- |
| license: apache-2.0 |
| tags: |
| - object-detection |
| - computer-vision |
| - d-fine |
| - document-layout-analysis |
| metrics: |
| - map |
| --- |
| |
| # D-FINE Layout Detection Model (HGNetv2-X) |
|
|
| ## Model Details |
| Đây là mô hình nhận diện các phần tử trong tài liệu (Document Layout Analysis) được huấn luyện dựa trên kiến trúc **D-FINE** tiên tiến (phiên bản cấu hình X cỡ lớn sử dụng backbone **HGNetv2-B5**). |
|
|
| - **Task:** Object Detection (Phát hiện vật thể) |
| - **Architecture:** D-FINE (HGNetv2-X) |
| - **Epochs Trained:** 80 Epochs (Gồm 72 epochs Stage 1 và 8 epochs Stage 2 tinh chỉnh) |
|
|
| ## Dataset |
| Mô hình được huấn luyện trên tập dữ liệu tùy chỉnh bao gồm các lớp đối tượng (classes) thường gặp trong bố cục tài liệu: |
| 0. `Object-detection` (Lớp bao trùm) |
| 1. `Figure` (Hình ảnh/Hình vẽ) |
| 2. `Icon` (Biểu tượng) |
| 3. `Table` (Bảng biểu) |
|
|
| ## Evaluation Results |
| Kết quả đạt được trên tập Validation sau khi kết thúc Stage 2 (tinh chỉnh tọa độ mịn): |
| - **mAP @ [0.50:0.95]:** 83.75% |
| - **mAP @ 0.50:** 91.82% |
| - **mAP @ 0.75:** 89.66% |
| - **AP (Medium Objects):** 87.03% |
| - **AP (Large Objects):** 83.84% |
| - **Recall (AR @ 100):** 93.48% |
|
|
| ## How to Use |
| Để sử dụng mô hình này, bạn cần tải xuống mã nguồn của [D-FINE](https://github.com/Peterande/D-FINE). |
|
|
| **Bước 1: Clone D-FINE repository** |
| ```bash |
| git clone https://github.com/Peterande/D-FINE.git |
| cd D-FINE |
| pip install -r requirements.txt |
| ``` |
|
|
| **Bước 2: Tải file cấu hình & trọng số** |
| Tải file `model.pth`, `dfine_hgnetv2_x_custom.yml`, và `custom_detection.yml` từ kho lưu trữ (repository) này và đặt vào các thư mục tương ứng trong dự án của bạn. |
|
|
| **Bước 3: Chạy Suy luận (Inference)** |
| Sử dụng script có sẵn của D-FINE để chạy nhận diện trên một tài liệu, hình ảnh hoặc video: |
| ```bash |
| python tools/inference/torch_inf.py \ |
| -c configs/dfine/custom/dfine_hgnetv2_x_custom.yml \ |
| -r model.pth \ |
| -i path/to/your/document_image.jpg \ |
| -d cuda:0 |
| ``` |
| Kết quả nhận diện sẽ được lưu thành tệp `torch_results.jpg`. |
|
|