jzpOCR · 古琴减字谱识别模型
减字谱(古琴谱)的自动识别模型。本仓库放的是 jzpOCR 目前能拿出来的三个权重, 按能力分三个子目录。
⚠️ 先把这一页读完再下载。 三个模型解决的是不同的问题, 有的只在特定输入下才有意义,而且其中两个的数字互不可比(口径不同)。
三个模型
| 子目录 | 认什么 | 输入 | 输出 | 数 |
|---|---|---|---|---|
atom-right/ |
右手谱字 | 一个谱字的裁图 | ATOM|F:大;H:七八;R:抹;S:七 |
76/132 = 57.58% |
atom-right-f12/ |
右手谱字 | 一个谱字的裁图 | 同上 | 83/132 = 62.88% |
lc-parent-b/ |
左手走手音 | 一整幅左手母图 | 上三三(原样串) |
122/239 = 51.05% |
共同点:都不是整页 OCR。 三者的输入都是已经切好的小图—— 整页要先做版面检测把框切出来。本仓库不含检测模型。
什么时候用哪个
- 要右手、要最新:
atom-right-f12/—— 上一代的生产候选,数最高(62.88%), 但不是本项目训练的,且预处理要用canonical。 - 要右手、要本项目自研的:
atom-right/—— jzpOCR 自主训练系统的产出(57.58%)。 - 要左手:
lc-parent-b/—— 三个里唯一的左手模型。
⚠️ 那两个右手的数字不可直接比
62.88% 与 57.58% 看着能排序,但它们的预处理口径不同:
| 归一化模式 | 输入尺度 | |
|---|---|---|
atom-right-f12/ |
canonical |
[-1, 1] |
atom-right/ |
inkfit |
[0, 1] |
各在自己训练的工况上。换口径,同一批 132 条上 atom-right-f12 会从 83 掉到 58 ——
所以"哪个更好"这个问题,在当前口径下没有干净的答案。两个 README 里都写清了各自的边界。
怎么用
每个子目录都是自洽的:cd 进去、装依赖、跑 infer.py 就行,不需要本仓库的其它部分。
# 右手(二选一)
cd atom-right-f12 && pip install -r requirements.txt && python infer.py 谱字裁图.png
cd atom-right && pip install -r requirements.txt && python infer.py 谱字裁图.png
# 左手
cd lc-parent-b && pip install -r requirements.txt && python infer.py 母图.png
也可以只下子目录:
hf download grydlmq/jzpocr --repo-type model --include "atom-right-f12/*" --local-dir ./f12
atom-right* 要 torch,lc-parent-b 要 paddlepaddle。
这些数字是什么
右手两个用的是同一个评测集 fixed_dev,132 条,由两个正式冻结 benchmark 的子集拼成
(PackageA 72 + real110 60,均为 benchmark_only=1 / training_eligible=0,永久排除训练)。
指标是 whole_exact —— 一条读法的每个字段全对才算对。
左手那个用 239 幅母图的 holdout,指标是整串严格相等。
三者都是 crop / 母框级,没有一个是页级端到端数字。 样本量都小(132 / 132 / 239), 单轮 8 个百分点以下的差异不足以说明问题。
溯源与许可
atom-right/由 jzpOCR 自主训练系统训练,训练图全部是《琴曲集成》的谱字裁图。atom-right-f12/、lc-parent-b/是上一代系统的权重,本仓库原样打包发布; 它们的训练图像清单没有随包提供,谱本来源未经核实。- 《琴曲集成》是今人整理影印本,不是公有领域刊本。发布者未对模型权重是否构成 该出版物的衍生作品作出法律判断,也未取得相关权利人授权。
本仓库按未授予开源许可(license: other)发布:可以使用与评估,
但不构成对训练数据上游权利的任何许可。底层琴谱本身(明清刻本)多属公有领域;
受限的是这一版的影印与整理。商业使用或再分发前请自行厘清上游权利。
关于 jzpOCR
jzpOCR 是一个 AI 自主训练系统,目标是「真实谱页扫描件 → 结构化谱字序列」这条链路。
交付物是一个命令行工具 jzpocr。本仓库是它的模型侧产物。
各子目录的 README 里有该模型的完整身份、字段表、清理过的边界条件和逐文件校验值。