UNIC0RN-Zhu commited on
Commit
17bb2de
·
verified ·
1 Parent(s): a32da62

Fix model metadata and loading instructions

Browse files
Files changed (1) hide show
  1. README.md +106 -39
README.md CHANGED
@@ -1,85 +1,152 @@
1
  ---
2
  license: other
 
 
3
  base_model: answerdotai/ModernBERT-base
4
  library_name: transformers
5
- pipeline_tag: text-classification
6
  language:
7
- - en
8
  tags:
9
- - modernbert
10
- - autonomous-driving
11
- - structured-output
12
- - research-only
 
13
  ---
14
 
15
  # ModernBERT Drive Command Parser
16
 
17
- > 仅限非商业学术、科研、教学和个人实验,必须免费提供;不得用于车辆或机器人运行,也不得用于可能造成人身伤害或财产损失的高风险用途。完整约束见 `LICENSE`、`NOTICE` 和 `licenses/` 中的上游许可。
18
 
19
- 该仓库是英文驾驶指令解析的运行时权重,包含 1.1.0 多任务分类器和 1.2.0 组合语义扩展。推荐部署路径为:
20
 
21
- ```text
22
- /root/autodl-tmp/models/modernbert-drive-command-compositional
23
- ```
24
 
25
  ## 训练配置
26
 
27
  - Backbone:ModernBERT-base
28
- - 硬件:RTX 5090BF16CUDA/SM120
29
  - 任务:动作、状态、类别、紧急度、方向、速度变化六头多任务分类,以及实体/关系 token 分类
30
- - 语料:662,700条英文伪标签,按规范化文本分组切分为70%/20%/10%
31
- - 训练:第一阶段1 epoch,学习率3e-5;第二阶段1 epoch,学习率1e-5
32
- - 校准仅使用132,540条验证集逐类选择动作和方向阈值
 
33
 
34
  ## 最终结果
35
 
36
- 66,270条独立测试集
37
 
38
  | 指标 | 结果 |
39
  |---|---:|
40
- | 动作exact match | 98.70% |
41
- | 动作micro-F1 | 97.78% |
42
  | 状态准确率 | 99.39% |
43
  | 类别准确率 | 99.15% |
44
  | 紧急度准确率 | 99.91% |
45
- | 方向exact match | 99.75% |
46
  | 速度变化准确率 | 99.82% |
47
 
48
- 1,000条端到端解析中,动作exact match为99.30%,P95解析时延为12.97ms所有准确率均是对伪标签教师的一致率,不是人工金标准或真实道路准确率。
49
 
50
- 1.2.0 组合语义扩展冻结 ModernBERT backbone,在 3,288 条训练样本训练实体/关系 token 头;1,065 条验证样本的最佳 token-F1 为 99.49%。由 175 条样本组成的组合语义开发回归集在规则校后达到 100% 图结构 exact matchP95 端到端解析时延为 87.02ms。该结果用于开发回归闭环,代表独立真实道路泛化性能
 
 
51
 
52
  ## 文件
53
 
54
- - `model.safetensors`:ModernBERT backbone权重
55
- - `multitask_heads.pt`:六个任务头权重
56
- - `semantic_token_head.pt`:1.2.0 实体/关系 token
57
- - `semantic_token_head_metrics.json`:语义 token训练与验证指标
58
- - `inference_config.json`:验证集校准阈值及校准前后指标
59
- - `label_schema.json`:六类输出签顺序
60
- - `training_summary.json`:第二阶段训练配置和验证结果
61
- - `test_metrics_calibrated.json`:最终独立测试结果
62
- - `LICENSE`:本模型的研究用途分发条件
63
- - `NOTICE`:上游模型、数据集归属与强制署名
64
- - `licenses/`:ModernBERT、SimLingoTalk2Car 的完整许可副本
 
 
 
 
 
 
 
 
 
 
65
 
66
- ## 许可与用途限制
67
 
68
- 本模型基于 Apache-2.0 的 `answerdotai/ModernBERT-base`,并使用 Talk2Car 与 SimLingo 文本生成训练标签。Talk2Car 数据采用 CC BY-NC-SA 4.0,SimLingo 采用自定义非商业许可,因此本仓库在 Hugging Face 上必须标记为 `license: other`,不能把整个微调模型重新声明为 Apache-2.0 或 MIT。
 
69
 
70
- 模型可以在学术或科研基础上免费发布,但不得用于商业用途、真实或模拟车辆/机器人运行,以及其他高风险用途。任何使用者都必须自行阅读并遵守上游许可;本模型不构成自动驾驶安全认证。
 
 
 
 
71
 
72
  ## 运行
73
 
 
 
74
  ```python
75
- from structured_command_parser.src.modernbert_parser import ModernBertEnglishIntentParser
 
 
 
 
 
 
 
 
 
76
 
77
  parser = ModernBertEnglishIntentParser(
78
- "/root/autodl-tmp/models/modernbert-drive-command-compositional",
79
  device="cuda",
80
  )
81
  parser.warmup()
82
- document = parser.parse("Slow down and stop before the red truck.")
 
 
 
83
  ```
84
 
85
- 实验链路必须在接受请求前调用`warmup()`,并保留规则短路下游安全校验
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  ---
2
  license: other
3
+ license_name: simlingo-talk2car-non-commercial-research
4
+ license_link: https://huggingface.co/UNIC0RN-Zhu/modernbert-drive-command-base/blob/main/LICENSE
5
  base_model: answerdotai/ModernBERT-base
6
  library_name: transformers
7
+ pipeline_tag: feature-extraction
8
  language:
9
+ - en
10
  tags:
11
+ - modernbert
12
+ - autonomous-driving
13
+ - structured-output
14
+ - compositional-semantics
15
+ - research-only
16
  ---
17
 
18
  # ModernBERT Drive Command Parser
19
 
20
+ > 仅限非商业学术、科研、教学和个人实验,必须免费提供;不得用于真实车辆或机器人运行,也不得用于可能造成人身伤害或财产损失的高风险用途。CARLA 仅用于非商业离线仿真研究和评测。完整约束见 `LICENSE`、`NOTICE` 和 `licenses/` 中的上游许可。
21
 
22
+ 该仓库是英文驾驶指令解析的运行时权重,包含 1.1.0 多任务分类器和 1.2.0 组合语义扩展。
23
 
24
+ 该模型不是标准单头 `AutoModelForSequenceClassification`。Hugging Face 仓库中的 `model.safetensors` 是 ModernBERT backbone,运行完整解析器还必须加载 `multitask_heads.pt`、`semantic_token_head.pt`、配置文件和项目代码。不要使用普通 `pipeline("text-classification")` 代替项目解析器。
 
 
25
 
26
  ## 训练配置
27
 
28
  - Backbone:ModernBERT-base
29
+ - 硬件:RTX 5090BF16CUDA/SM120
30
  - 任务:动作、状态、类别、紧急度、方向、速度变化六头多任务分类,以及实体/关系 token 分类
31
+ - 语料:662,700 条英文伪标签,按规范化文本分组切分为 70%/20%/10%
32
+ - 第一阶段1 epoch,学习率 `3e-5`
33
+ - 第二阶段1 epoch,学习率 `1e-5`
34
+ - 校准:仅使用 132,540 条验证集逐类选择动作和方向阈值
35
 
36
  ## 最终结果
37
 
38
+ 66,270 条独立测试集:
39
 
40
  | 指标 | 结果 |
41
  |---|---:|
42
+ | 动作 exact match | 98.70% |
43
+ | 动作 micro-F1 | 97.78% |
44
  | 状态准确率 | 99.39% |
45
  | 类别准确率 | 99.15% |
46
  | 紧急度准确率 | 99.91% |
47
+ | 方向 exact match | 99.75% |
48
  | 速度变化准确率 | 99.82% |
49
 
50
+ 1,000 条端到端解析中,动作 exact match 99.30%,P95 解析时延为 12.97 ms
51
 
52
+ 所有确率均是对伪标签教师的一致率,不是人工金标准准确率、真实道路准确率或安全认证结果
53
+
54
+ 1.2.0 组合语义扩展冻结 ModernBERT backbone,在 3,288 条训练样本上训练实体/关系 token 头;1,065 条验证样本的最佳 token-F1 为 99.49%。由 175 条样本组成的组合语义开发回归集在规则校准后达到 100% 图结构 exact match,P95 端到端解析时延为 87.02 ms。该结果用于开发回归闭环,不代表独立真实道路泛化性能。
55
 
56
  ## 文件
57
 
58
+ | 文件 | 说明 |
59
+ |---|---|
60
+ | `model.safetensors` | ModernBERT backbone 权重 |
61
+ | `multitask_heads.pt` | 六个多任务分类 |
62
+ | `semantic_token_head.pt` | 1.2.0 实体/关系 token 头 |
63
+ | `semantic_token_head_metrics.json` | token 头训练与验证指 |
64
+ | `inference_config.json` | 验证集校准阈值 |
65
+ | `label_schema.json` | 六类输出标签顺序 |
66
+ | `training_summary.json` | 训练配置和验证结果 |
67
+ | `test_metrics_calibrated.json` | 最终独立测试结果 |
68
+ | `SHA256SUMS` | 运行时文件校验|
69
+ | `LICENSE` | 本模型研究用途分发条件 |
70
+ | `NOTICE` | 上游模型、数据集归属与强制署名 |
71
+ | `licenses/` | ModernBERT、SimLingo 和 Talk2Car 许可副本 |
72
+
73
+ ## 下载
74
+
75
+ ```bash
76
+ hf download UNIC0RN-Zhu/modernbert-drive-command-base \
77
+ --local-dir ./models/modernbert-drive-command-base
78
+ ```
79
 
80
+ 或在 Python 中下载:
81
 
82
+ ```python
83
+ from huggingface_hub import snapshot_download
84
 
85
+ model_dir = snapshot_download(
86
+ repo_id="UNIC0RN-Zhu/modernbert-drive-command-base",
87
+ local_dir="./models/modernbert-drive-command-base",
88
+ )
89
+ ```
90
 
91
  ## 运行
92
 
93
+ 完整解析器位于 `ZhuShanzhe/LMM-in-AutoDrive/structured_command_parser`:
94
+
95
  ```python
96
+ from huggingface_hub import snapshot_download
97
+
98
+ from structured_command_parser.src.modernbert_parser import (
99
+ ModernBertEnglishIntentParser,
100
+ )
101
+
102
+ model_dir = snapshot_download(
103
+ repo_id="UNIC0RN-Zhu/modernbert-drive-command-base",
104
+ local_dir="./models/modernbert-drive-command-base",
105
+ )
106
 
107
  parser = ModernBertEnglishIntentParser(
108
+ model_dir,
109
  device="cuda",
110
  )
111
  parser.warmup()
112
+
113
+ document = parser.parse(
114
+ "Slow down and stop before the red truck."
115
+ )
116
  ```
117
 
118
+ 在线链路必须在接受请求前调用 `warmup()`,并保留规则短路、结构校验、语义对齐和下游安全
119
+
120
+ ## 输出范围
121
+
122
+ 解析器输出结构化 `DrivingIntent`,包括:
123
+
124
+ - 规范化文本;
125
+ - 原子动作与顺序关系;
126
+ - 方向、速度变化和紧急度;
127
+ - 目标实体描述;
128
+ - 条件、触发器和约束;
129
+ - 解析状态、置信度、缺失槽位和警告。
130
+
131
+ 模型不负责视觉实体最终落地、风险决策、轨迹规划或车辆控制。目标描述必须由下游语义对齐模块约束到实际候选实体。
132
+
133
+ ## 校验
134
+
135
+ ```bash
136
+ cd ./models/modernbert-drive-command-base
137
+ sha256sum -c SHA256SUMS
138
+ ```
139
+
140
+ 已发布权重的 SHA256:
141
+
142
+ ```text
143
+ 55b0683be1d75355a69720bc30b900e171579f7f1fe345c710dd05e14d5d7af9 model.safetensors
144
+ fca6481f3afcf0cd3a9d9d99952655556c443e7ab3178706e77014c17e4cba8d multitask_heads.pt
145
+ ec7765685d5acb46e4a7a9f23837212f17092074f90fafcbc9f1a41151995f82 semantic_token_head.pt
146
+ ```
147
+
148
+ ## 许可与用途限制
149
+
150
+ 本模型基于 Apache-2.0 的 `answerdotai/ModernBERT-base`,并使用 Talk2Car 与 SimLingo 文本生成训练标签。Talk2Car 数据采用 CC BY-NC-SA 4.0,SimLingo 采用自定义非商业许可,因此整个微调模型必须标记为 `license: other`,不能重新声明为 Apache-2.0、MIT 或其他更宽松许可证。
151
+
152
+ 使用者必须自行阅读并遵守 `LICENSE`、`NOTICE` 与 `licenses/` 中的全部上游条款。本模型不构成自动驾驶安全认证。