--- license: apache-2.0 tags: - object-detection - computer-vision - d-fine - document-layout-analysis metrics: - map --- # D-FINE Layout Detection Model (HGNetv2-X) ## Model Details Đây là mô hình nhận diện các phần tử trong tài liệu (Document Layout Analysis) được huấn luyện dựa trên kiến trúc **D-FINE** tiên tiến (phiên bản cấu hình X cỡ lớn sử dụng backbone **HGNetv2-B5**). - **Task:** Object Detection (Phát hiện vật thể) - **Architecture:** D-FINE (HGNetv2-X) - **Epochs Trained:** 80 Epochs (Gồm 72 epochs Stage 1 và 8 epochs Stage 2 tinh chỉnh) ## Dataset Mô hình được huấn luyện trên tập dữ liệu tùy chỉnh bao gồm các lớp đối tượng (classes) thường gặp trong bố cục tài liệu: 0. `Object-detection` (Lớp bao trùm) 1. `Figure` (Hình ảnh/Hình vẽ) 2. `Icon` (Biểu tượng) 3. `Table` (Bảng biểu) ## Evaluation Results Kết quả đạt được trên tập Validation sau khi kết thúc Stage 2 (tinh chỉnh tọa độ mịn): - **mAP @ [0.50:0.95]:** 83.75% - **mAP @ 0.50:** 91.82% - **mAP @ 0.75:** 89.66% - **AP (Medium Objects):** 87.03% - **AP (Large Objects):** 83.84% - **Recall (AR @ 100):** 93.48% ## How to Use Để sử dụng mô hình này, bạn cần tải xuống mã nguồn của [D-FINE](https://github.com/Peterande/D-FINE). **Bước 1: Clone D-FINE repository** ```bash git clone https://github.com/Peterande/D-FINE.git cd D-FINE pip install -r requirements.txt ``` **Bước 2: Tải file cấu hình & trọng số** Tải file `model.pth`, `dfine_hgnetv2_x_custom.yml`, và `custom_detection.yml` từ kho lưu trữ (repository) này và đặt vào các thư mục tương ứng trong dự án của bạn. **Bước 3: Chạy Suy luận (Inference)** Sử dụng script có sẵn của D-FINE để chạy nhận diện trên một tài liệu, hình ảnh hoặc video: ```bash python tools/inference/torch_inf.py \ -c configs/dfine/custom/dfine_hgnetv2_x_custom.yml \ -r model.pth \ -i path/to/your/document_image.jpg \ -d cuda:0 ``` Kết quả nhận diện sẽ được lưu thành tệp `torch_results.jpg`.